Qodo CLI在SWE-bench Verified基准上获得71.2%成绩,证明AI Agent在真实工程任务中的实用价值。
我们很高兴地宣布,Qodo 命令行 agent 在 SWE-bench Verified 上获得了 71.2% 的成绩(提交审核中),这是评估 AI agent 在真实软件工程任务中表现的领先基准。
这一成就强有力地表明,Qodo 的 agent 是为生产开发的现实而构建的。对于代码审查、编写测试、修复 bug 和生成功能等用例,我们的命令行 agent 超越了自动完成,提供了深思熟虑、上下文感知且高度完整的代码。
大多数 AI 基准在隔离、简化的环境中评估 agent。然而,SWE-bench Verified 在混乱、复杂的现实软件工程场景中测试代码 agent。SWE-bench 中的每个测试用例都来自 12 个广泛使用的开源 Python 仓库中的真实 GitHub issue。Agent 获得 GitHub issue 和代码库在 issue 被提出时的状态,必须像开发人员一样进行推理、规划和编辑代码,在多个回合中迭代——没有捷径。
Qodo Command 仅使用生产版本的一次运行就获得了 71.2% 的成绩——没有微调或基准特定调整——完全像任何开发人员一样,通过简单的安装包开箱即用运行:npm install -g @qodo/command。
虽然 Qodo Command 被设计为支持所有顶级 LLM,但 Claude 4 成为了我们在 SWE Bench Verified 结果中的首选模型。由于与 Anthropic 的强有力合作——Qodo 是一个"由 Claude 驱动"的解决方案,我们正在合作构建世界上最适应和学习导向的编码 agent,利用当今最先进的语言模型之一。
在 SWE-bench 上取得高性能不是为了优化基准——这是设计 Qodo Command 以解决现实软件工程挑战的自然结果。下面是我们的架构决策如何直接促进其性能的:
SWE-bench Verified 在复杂的多文件代码库上测试 AI,其中理解相互依赖关系对成功至关重要。在这种环境中取得成功需要的不仅仅是将原始文件输入 LLM,进行模式匹配或自动完成。
Qodo Command 通过将多层代码提炼成精确的、高信号的摘要来解决这个问题——确保语言模型在每一步都只接收最相关的、结构化的上下文。这使得深度推理、准确生成和高质量审查成为可能,而不会触及上下文限制或丧失必要细节。
Qodo 的默认计划优先方法确保只有在对用户意图进行结构化分解之后才开始实施。我们不是仓促行动,而是首先深入分析用户的目标,然后将其分解成清晰、可执行的子任务,排列以实现最优执行。这为 LLM 创建了一个路线图,实现了精确的任务跟踪和可靠的验证。完成不仅由输出判断,还由严格遵守原始计划判断——差距会触发反馈和重试循环,直到实现完全一致。
当工具调用失败时,Qodo agent 不会停止——它们会适应。系统提取错误反馈,调用 LLM 诊断故障,并智能地调整工具参数或结构。如果需要,Agent 有权重试最多三次,每一轮都优化它们的调用。如果通过重试无法解决,agent 会转向替代策略,确保尽管初期出现故障但进展仍在继续。
Qodo Command 使用 LangGraph,一个为需要结构、模块性和状态管理的 agent 和 agent 工作流的框架,给予 Qodo Command 模块性和速度。LangGraph 支持基于图的编排,其中每一步都是可配置的节点。这个基础使我们能够重用和扩展来自 Qodo Gen(我们的 IDE 扩展)的经过验证的组件——包括代码分析、摘要和安全扫描——同时给了我们灵活地分割、扩展和改用工作流的灵活性。
Qodo Command 将 agent 推理与一套强大的执行工具相结合。这些工具使 Qodo 的 agent 能够更像专家开发人员一样运作——与真实环境交互、扫描大型代码库、以结构化的步骤思考。
FileSystem:用于读取、写入和编辑文件和目录的标准工具。由于即使是最先进 (SOTA) 的 LLM 在使用编辑文件工具的精确匹配时也可能产生错误,我们实现了一个回退机制,允许模糊匹配以提高工具的成功率。
Shell Tool:像真正的开发人员一样执行,Qodo agent 可以与系统 shell 交互来运行构建脚本和 linter,执行测试套件并实时验证假设。
Ripgrep:为了深入了解代码库,Qodo Command 原生设计为优化使用 ripgrep 递归搜索工具,在大型仓库中定位相关代码。
Sequential Thinking:结构化的 agent 推理通过将任务分解成可执行的步骤来帮助贡献基准结果。这展示了与 AI 代码 agent 进行逐步迭代交互的重要性,以及结构良好的工单或 PRD 如何能产生更好的代码结果。虽然该工具默认未启用,但可以通过 MCP 轻松添加到任何自定义 agent 中。
Web Search:该工具在 SWE-bench 运行中已禁用,以防止解决方案中的数据泄露。
我们最近宣布了 Qodo Command,它已经在改变我们在 Qodo 的开发方式。Qodo Command 的独特之处在于我们对自动化完整性的基础关注。以下是您可以用 Qodo Command 做什么:
自推出以来,Qodo 团队、我们的客户和社区贡献者一直在积极使用 Qodo Command 构建 agent,使团队能够自动化高影响力的任务,例如:
代码审查自动化
文档生成
以及许多其他增强代码质量的 agent,您可以在 Qodo Command agent 仓库中探索。
代码质量不仅停留在生成——它取决于一致、结构化的审查。这就是为什么 Qodo Command 包括一个专用的 UI 模式,内置了 Qodo Merge(我们的高级代码审查 agent)。
这个集成使开发人员能够在单个、流畅的流程中生成和审查代码。每个 AI 辅助的任务都会自动通过审查流程,检查正确性、完整性和质量——帮助团队更快地发货,而不降低标准。
Qodo Command 不是为基准而构建的——它是为你的生产环境而构建的。在 SWE-bench Verified 全球前 5 名中排名的同一版本现在可以用一条简单的命令使用:
npm install -g @qodo/command
用它来自动化你的代码完整性工作流,加速代码审查,生成测试、文档和功能代码——同时保持你的团队依赖的质量标准。这是我们为自己构建的命令行 agent,并继续每周在开源中改进。而且我们才刚刚开始。不要等待,今天就在 Qodo Command https://www.qodo.ai/products/qodo-command/ 开始吧。