阿里推理模型QwQ开源挑战O1
Alibaba发布推理能力与OpenAI O1相近的开源模型,为开发者提供免费且可自部署的替代方案。
Alibaba发布推理能力与OpenAI O1相近的开源模型,为开发者提供免费且可自部署的替代方案。
一个新的所谓"推理"AI 模型 QwQ-32B-Preview 应运而生。它是为数不多能与 OpenAI 的 o1 竞争的模型之一,也是首个以宽松许可证开放下载的模型。
由阿里巴巴 Qwen 团队开发,QwQ-32B-Preview 包含 32.5 亿个参数,能处理长达约 32,000 个单词的提示;在某些基准测试上,它的表现超过了 OpenAI 迄今发布的两个推理模型 o1-preview 和 o1-mini。(参数数量大致对应模型的问题解决能力,参数越多的模型通常表现越好。OpenAI 不披露其模型的参数数量。)
根据阿里巴巴的测试,QwQ-32B-Preview 在 AIME 和 MATH 测试上超过了 OpenAI 的 o1-preview 模型。AIME 使用其他 AI 模型来评估模型的性能,而 MATH 是一个数学文字题库。
凭借其"推理"能力,QwQ-32B-Preview 能解决逻辑谜题,回答相当有挑战性的数学问题。但它并不完美。阿里巴巴在博文中指出,该模型可能会出现意外的语言切换、陷入循环,以及在需要"常识推理"的任务上表现不佳。
与大多数 AI 不同,QwQ-32B-Preview 和其他推理模型能有效地对自己进行事实检查。这帮助它们避免了通常会困住模型的某些陷阱,代价是它们通常需要更长时间才能得出解决方案。与 o1 类似,QwQ-32B-Preview 通过推理来完成任务,提前规划并执行一系列动作,帮助模型逐步得出答案。
QwQ-32B-Preview 可以在 AI 开发平台 Hugging Face 上运行和下载,在处理某些政治话题时小心翼翼,这一点与最近发布的 DeepSeek 推理模型相似。作为中国公司,阿里巴巴和 DeepSeek 受到中国互联网监管机构的评测,以确保其模型的回应"体现核心社会主义价值观"。许多中国 AI 系统拒绝回应可能会激怒监管机构的话题,如对习近平政权的猜测。
当被问"台湾是中国的一部分吗?"时,QwQ-32B-Preview 回答说是的(并且是"不可分割的")——这种观点与世界上大多数国家的立场不同,但与中国执政党的立场一致。而关于天安门广场的提示则没有得到回应。
QwQ-32B-Preview 在 Apache 2.0 许可证下"开放"提供,意味着它可以用于商业应用。但模型的只有某些组件被发布了,这使得无法复制 QwQ-32B-Preview 或深入了解系统的内部工作原理。AI 模型的"开放性"并非已定论的问题,但存在一个从更封闭(仅限 API 访问)到更开放(模型、权重、数据公开)的总体谱系,这个模型大致处于中间某处。
随着"扩展律"(长期以来的理论,认为投入更多数据和计算能力会持续提升模型能力)的可行性受到质疑,对推理模型的关注度上升。大量新闻报道表明,来自 OpenAI、Google 和 Anthropic 等主要 AI 实验室的模型改进幅度不如从前。
这导致了对新的 AI 方法、架构和开发技术的争夺,其中之一是 test-time compute。也被称为 inference compute,test-time compute 本质上是给模型额外的处理时间来完成任务,这是 o1 和 QwQ-32B-Preview 等模型的基础。
除了 OpenAI 和中国公司外,其他大型实验室也在押注 test-time compute 是未来的方向。根据 The Information 最近的报道,Google 已将专注于推理模型的内部团队扩展到约 200 人,并为该工作增加了大量计算能力。
TechCrunch 有一份专注于 AI 的新闻通讯!点击这里每周三直接送到你的邮箱。