谁是Deepseek最佳的马具?

14 分钟阅读

谁是Deepseek最佳的马具?

——对比五种不同的智能体框架

日期:2026.8.9

前言

众所周知,在人工智能领域,智能体(Agent)是实现自主决策和任务执行的核心组件。随着技术的发展,越来越多的智能体框架被提出,每种框架都有其独特的优势和适用场景。公司如 Anthropic、OpenAI 都有开发针对其基模 Claude、GPT 优化的智能体框架(更多是代码智能体)如 Claude code、Codex。而与之不同的是,Deepseek 背后的研发团队——杭州深度求索——并没有开发针对其模型的智能体框架,因此本文将聚焦于 Deepseek 基模,对比五种不同的智能体框架,以帮助开发者选择最适合其需求的工具。

需要承认的是,本文的实验来源于 b 站 up 主 @科技迷航 发布于2026年8月6号的视频 《谁才是DeepSeek的最佳坐骑?》

实验设计

实验选择了以下五种智能体框架进行对比:

  1. ZCode Logo
    ZCode 是由智普开发的,针对其产品——GLM系列大模型的代码智能体框架。
  2. Codex Logo
    Codex 是由 OpenAI 开发的,针对其 GPT 系列大模型的代码智能体框架。
  3. Reasonix Logo
    Reasonix 是由社区开发的,针对 Deepseek 优化的开源智能体框架。
  4. OpenCode Logo
    OpenCode 是由社区开发的通用型开源智能体框架。
  5. Claude Code Logo
    Claude Code 是由 Anthropic 开发的,针对其 Claude 系列大模型的代码智能体框架。

随后,实验根据真实项目,设计了五种不同的任务场景(共 7 题)来测试这些智能体框架的性能,并按照任务完成的效率、准确性和资源消耗等指标进行评估。每个任务场景都模拟了实际应用中的典型问题,以确保实验结果具有参考价值。

五种任务场景分别为:

  1. 代码排障(debug)任务(共 3 题):
    • 字符串校验引擎排障
    • 日期时间引擎排障
    • 渲染引擎排障
  2. 代码开发任务(共 1 题):请求库自动重试开发。
  3. 信息推理任务(共 1 题):港火事故资料核验。
  4. 信息核查任务(共 1 题):文献真伪核查。
  5. 数据分析任务(共 1 题):电商订单真相还原。

对于每一个任务(题目),智能体将能够接受总计两轮的反馈来修改输出(即总共三轮输出),实验按照不同维度的指标给出分数(对于每一指标,一轮通过拿满分,每过一轮分数减半),同时记录token消耗与完成用时。
评分指标示例: \

评分标准

实验结果

题目一:字符串校验引擎排障

题目一结果

速度最快的是 ZCode,完成时间为 8 分钟,用时最长的是 Claude Code,完成时间为 29 分钟。准确性方面,Codex 得分最高,为95.50分。

题目二:日期时间引擎排障

题目二结果

与题目一相比,题目二的难度大大增加,完成时间普遍延长。Codex 在这一题表现反而最差,完成时间为 85 分钟,且仅得到61.70分。 Claude Code在这一题表现最好,用时最短为 53 分钟,且得分最高为72.50分。值得注意的是,ZCode在这一题的表现也不俗,完成时间为 89 分钟,得分为72.10分。

题目三:渲染引擎排障

题目三结果

在题目三中,Codex的表现依然不佳,完成时间为 85 分钟,得分为69.70分。ZCode 以38分钟完成,77.50分的成绩位居第一。Reasonix 则以80分钟完成,77.50的得分位居第二。Claude Code在这一题的表现也不俗,完成时间为 25 分钟,得分为72.50分。

值得注意的是,Codex在第三题遇到了与第二题一样的问题,在反馈轮(二、三轮)容易将对的答案改错,导致得分下降。相比之下,其余智能体均在反馈轮中表现稳定,能够有效利用反馈信息进行优化。

题目四:请求库自动重试开发

题目四结果

在题目四中,Codex的表现依然不佳,完成时间为 34 分钟,得分为80.00分位列倒数第二。Reasonix 以 22 分钟完成,得分为 95.00分位列第一。 在这一题中,ZCode犯了与Codex在前两题中类似的错误,在反馈轮中将正确答案改错,导致得分下降,尽管这是一个相对简单的开发任务,所有智能体在第一轮输出中都能给出较高质量的答案。

题目五:港火事故资料核验

题目五结果

题目五是一个更加考察基模能力的题目,要求智能体基于一大堆资料推导出正确的事实结论。Codex在这一题中表现最差,完成时间为 7 分钟最长,得分为98.80分。而其余选手只需在5分钟内就能得到满分。

题目六:文献真伪核查

题目六结果

题目六一共准备了20篇文献,其中10篇为真,10篇为伪。智能体需要在20篇论文中找出伪文献,并给出理由。虚假文献中,3篇为凭空捏造,7篇为真实文献的伪造(修改)版本。5种智能体在这一题中表现都非常出色,除 Reasonix 与 Claude Code 之外,其他智能体均在10分钟内完成任务。所有智能体都只判断错了一篇文献。以下是具体细节: \

题目六细节

除 Claude Code 将一篇虚假文献误判为真文献外,其他智能体均将真实文献为虚假文献。因此笔者认为,Claude Code在这一题表现较其他智能体稍逊一筹。

题目七:电商订单真相还原

题目七结果

题目七是一个数据分析任务,要求智能体基于电商订单数据,分析出订单是否存在异常,并给出解决方案。该题偏简单,所以智能体均得到了99.50分且耗时在5分钟以内。

总结

以下为五种智能体在七个任务中的综合表现:

分数

综合得分

智能体按得分排序为:Claude Code > ZCode > Reasonix > OpenCode > Codex。

效率

效率对比

智能体按效率排序为:Claude Code > ZCode > OpenCode > Codex > Reasonix。

价格

价格对比

智能体按价格排序为:ZCode < OpenCode < Claude Code < Codex < Reasonix。 这一点让人有些意外:号称针对 Deepseek 缓存命中优化的 Reasonix,价格却是五种智能体中最高的。 笔者认为,在多轮对话的时候,85-95%缓存命中的时候,模型比较“聪明”。再高的缓存命中可能导致模型沿用曾经的错误推理,反而增加了工作时间与API调用次数,导致虽然单次调用价格便宜,但更多的调用抹杀了这一优势。

结论

综合得分、效率和价格三个维度来看,Claude Code 在本次实验中表现最为出色,尤其在任务完成的准确性和效率上均有优势。
ZCode 作为一个针对 GLM 系列大模型优化的智能体框架,在本次实验中也表现不俗,尤其在代码排障任务中展现了较强的能力,@科技迷航认为这可能是因为GLM与Deepseek都没有视觉模态导致的。
Reasonix 虽然在某些任务中表现良好,但其高昂的价格和在多轮反馈中的不稳定表现,使其在综合评价中略显逊色。
OpenCode 作为一个通用型开源智能体框架,虽然在某些任务中表现中规中矩,但在效率和价格上具有一定优势。
Codex 在本次实验中表现最为不理想,尤其在多轮反馈中容易将正确答案改错,导致得分下降,这也反映了其在处理复杂任务时的局限性。

虽然视频作者认为 ZCode 是 Deepseek 的最佳坐骑。但笔者从统计的角度出发,认为本次实验中五种智能体的差异在统计学上并不显著,尤其是对于任务完成的准确性和效率指标。 因此,选择哪种智能体框架应根据具体的应用场景和需求来决定,而不仅仅依赖于实验结果。换句话说,本次实验恰恰说明了在选择 Deepseek 作为智能体基模的条件下,不同智能体框架的表现没有明显的优劣之分,开发者应根据自身需求和预算进行选择,自己用的顺手的才是最好的。

附录— 题目一览

题目一:字符串校验引擎排障

题目一

题目二:日期时间引擎排障

题目二

题目三:渲染引擎排障

缺失。

题目四:请求库自动重试开发

题目四

题目五:港火事故资料核验

题目五

题目六:文献真伪核查

题目六

题目七:电商订单真相还原

题目七