前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9654
  • 路由模式省60%token成本:智能选择Agent模型
  • AI 代码审查自动化的前置条件与风险分级
  • AI 写代码比人理解还快:工程瓶颈已转向代码审查
  • Claude 支持千个 Agent 并行:多 Agent 查 Bug 覆盖率达 94%
  • Anthropic 推出免费开源漏洞扫描服务
  • Claude Code CLI 2.1:Haiku 5.5原生集成+确定性Hook+Mesh
  • AI Agent 权限失控:邮箱被批量清空的技术根因
  • AI通话实时督导系统:边听边干预的架构设计
  • 九大AI Agent代码库扫描:证据驱动注册表发现了什么
  • Postman 如何在 Bedrock 上为 4000 万开发者运行 AI Agent 模式
  • Firecrawl vs Tavily评测: 事实召回率97% vs 82%
  • 1200个隔离AI Agent自发建群聊天,OpenAI安全测试意外翻车
  • 我用语音对话 AI 编程工具完整开发了一个博客功能
  • AI agent写的代码,运行前必查的五个安全检查点
  • LLM访问控制与监控:防线应设在何处
  • 把 JSON Schema 直接写成 FunctionTool 效果更好
  • Haiku 5.5降价90%背后的实际账单陷阱
  • AI Agent指令记忆衰减的三种操作策略
  • 让你的网站被 AI Agent 读懂:11 种机器可读清单标准
  • Docker Desktop 4.63 内置 docker agent:YAML 声明式 AI Agent 运行时
  • 联想 TianxiCode 登顶 SWE-bench,71% 问题解决率
  • Saluki 27B:2位量化Qwen击败原版工具调用
  • AI Agent 自主性 Bug:两条规则都有效却产生无效结果
  • Google RRSI自改善Agent指南:噪声带、成本规则与泄漏屏蔽机制
  • expect-llm:vitest原生断言LLM输出的匹配器库
  • JetBrains Mellum2.1:高负载推理吞吐量接近Qwen3.5-9B两倍
  • 企业Claude Code Code Review五个月演进实战复盘
  • skilladopt:根据自己项目适配 AI Agent 技能文件
  • 零依赖本地 Git 提交审查工具:毫秒级语义检查
  • openJiuwen开源企业级AgentOS,加速智能体规模化落地
  • 英伟达RTX Spark来了:本地AI推理新选择
  • ttok 1.0发布:统一token计数工具
  • 构建本地优先AI Agent运行时:沙箱、内存与审计
  • 嵌入模型找不到精确订单号:混合检索一招修复
  • ttok 0.4:轻量Token计数CLI工具更新
  • Anthropic 推免费 OSS Scanner,为开源项目自动扫描漏洞
  • MoE架构解析:为何稀疏专家模型统治了2026年大模型
  • Claude Haiku 5.5定价解析:10万token是关键分界线
  • AI编程工具效果分层:公开代码多则强, niche平台则弱
  • Botropolis: 用公司组织架构管理 AI Agent 开源框架
  • LLM 系统运维:可观测性、成本、路由与平台架构
  • Taste Skill 评测:Claude Code 前端设计质量提升实战
  • Anthropic 官方前端设计 Skill 实测评测
  • AI 生成 UI 验收的正确方法:几何测量替代截图diff
  • Microsoft Agent Framework 重新定义生产级 Agent 标准
  • 用代码规范防御 AI 编程的架构侵蚀
  • Claude新增视频生成与实时仪表盘功能
  • Claude 推出仪表盘构建功能
  • AI Agent 按调用付费:Bedrock AgentCore 支付实战
  • Google为Gemini引入Agent能力,企业版率先支持
  • GitHub Copilot 将推本地模式,但微软拒绝透露哪些数据上云
  • 已加载 51 / 9654
8.0
热点
AI SCORE
模型发布2026-10-09 16:53

联想 TianxiCode 登顶 SWE-bench,71% 问题解决率

量子位#代码智能体#SWE-bench#联想
Editor brief · 编辑速览

联想天禧自研代码智能体 TianxiCode 在 SWE-bench-Live 以 71% 通过率拿下全球第一,展示国产代码 Agent 能力。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

近日,在国际公认难度最高、最贴近真实开发环境的软件工程评测 SWE-bench-Live(Lite 分榜)中,由联想天禧 AI 自主研发的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash 取得突破性成绩:以 71% 的问题解决率登顶全球第一名,并正式通过官方审核。

这一成绩不仅标志着联想自研代码智能体框架迈入国际第一梯队,更展现出天禧 AI 生态以自研工程架构驱动模型潜能、在复杂软件工程竞技场抗衡全球顶尖方案的硬核实力。TianxiCode 是联想天禧 AI 聚焦代码生成、工程开发的代码智能子能力,未来将应用到联想 AI 硬件产品中。

服务真实场景,SWE-bench-Live 的含金量有多少?

不同于考查简单语法或单函数生成的传统代码测试,SWE-bench-Live 是当前全球软件工程领域的权威性动态评测基准。

SWE-bench-Live 以真实 GitHub 项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境。相较于单纯考查代码片段生成,这类评测更贴近真实开发中的问题处理过程,对系统理解代码、定位问题和完成修复提出了综合要求。

为了确保评测的绝对公正,SWE-bench-Live 官方设立了"Verified"核验机制。参评方案必须提交全链路的智能体运行轨迹(Trajectories),由官方团队严格审查评测输入、信息隔离环境,并彻底排查是否存在向智能体泄露标准答案、测试用例或结果的可能。TianxiCode 与 DeepSeek-v4.1-Flash 成功通过审查并斩获"Verified"认证,充分证明了其代码修复成绩的可复现性与高含金量。

TianxiCode 架构突破,释放工程级落地能力

如果把"TianxiCode 配合 DeepSeek-v4.1-Flash"整个系统比作一个软件工程师。那么 DeepSeek-v4.1-Flash 是工程师的大脑,负责阅读代码、理解语义、构思解法;而 TianxiCode 则是工程师的眼、手、工具箱以及工作流规范。再聪明的大脑,离开了一双能敲代码、查日志的"手"和严谨的工作习惯,也无法在复杂的现实工程中独自解决 Bug。

多项榜单对比数据印证了这一点:若缺乏顶层智能体架构的系统协同,即便调用顶级闭源模型,面对真实工程难题也常常束手无策。而这些足以见证 TianxiCode 的技术含金量。

在实际软件工程场景下,TianxiCode 展现出跨文件多跳检索与精准上下文管理、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大系统工程能力。

**跨文件多跳检索(Multi-Hop Retrieval)与精准上下文管理(Context Pruning & Slicing)**让 TianxiCode 能够像资深工程师一样"顺藤摸瓜"寻找问题,在大型代码库中快速定位缺陷根因。

**自驱动规划(Autonomous Planning)与多轮工具调用(Multi-turn Tool Calling)**赋予 TianxiCode 像真人程序员一样"边看边敲":遇到 Bug 会先列出排错计划,主动打开终端命令行去运行测试、翻阅日志、比对修改记录。遇到解决不了的问题,它还会灵活换个思路继续排查,实现自主推进。

**闭环补丁生成(Closed-Loop Patching)与测试驱动自愈(Test-Driven Self-Correction)**可以让 TianxiCode 能够自测自纠。TianxiCode 会自动在隔离环境中运行代码,一旦发现新代码报错或破坏了其他功能,就立刻进行自我反思与修改,直至补丁通过项目验收。

可以说,TianxiCode 扎实的自研工程底座展示了复杂的现实软件研发场景下,强大的智能体框架带来的决定性力量。

从榜单前列走向产业深处,天禧生态加速 AI 普惠

作为天禧 AI 生态在专业技术领域的关键研发布局,TianxiCode 此次在国际顶级评测中跻身第一梯队,不仅是一次技术实力的集中验证,更为智能体在真实研发场景的落地铺平了道路。

代码智能体的最终价值,不在于单一榜单的排名,而在于为一线开发者分担繁重的排错与工程协同成本。未来,联想天禧 AI 将持续推动 TianxiCode 的技术成果向开发者实际工具链沉淀,依托成熟的自主智能体架构,让安全、高效、真正具备自主问题解决能力的专业代码工具,深度赋能到联想的硬件设备中。

本文由联想提供,量子位获授权转载,观点归原作者所有。

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
Docker Desktop 4.63 内置 docker agent:YAML 声明式 AI Agent 运行时
下一篇
Saluki 27B:2位量化Qwen击败原版工具调用