8.0
热点
AI SCORE
技术实践2026-07-08 21:00
SWE-Bench Pro 编码基准评测问题曝光
OpenAI News#编码评测#基准可靠性#OpenAI
Editor brief · 编辑速览
OpenAI 研究显示业界广用的编码基准 SWE-Bench Pro 存在设计缺陷,直接影响对 AI 模型能力的准确评估。
编码基准(benchmark)是评估 AI 代码生成模型能力的重要指标,SWE-Bench Pro 因其难度和全面性获得广泛认可。但 OpenAI 的研究指出这个基准存在设计缺陷——问题可能包括标准答案不唯一、测试用例覆盖不足、或评分机制不够严格——直接导致不同模型在基准上的排名可能并不反映其真实能力。这意味着基于这份基准做的所有模型对比和选型决策都可能存在偏差。
核心要点
对程序员的意义 在选择 AI 编程助手或代码生成工具时,不应该完全依赖单一基准的排名。应该结合实际项目需求、自己的使用体验和多个基准来做决策。