8.0
热点
AI SCORE
模型发布2026-09-10 01:24
Qwen 3.8 跟进 GPT-5.5 Pro 推理预填充能力
Hacker News#Qwen#LLM推理#开源模型
Editor brief · 编辑速览
Qwen 3.8 引入了与 GPT-5.5 Pro 相似的推理预填充(reasoning prefills)技术,在长上下文推理任务上实现性能对齐。
对几个开源模型的推理预填充与「被偷走的思考」的跟进研究
本 v1.1 使用 GPT-5.5 Pro 作为教师模型,重新运行了推理预填充实验。
对于每个问题,我为目标模型生成了两个响应:
可见的答案仍然自由生成。随后我测量了教师模型可见答案中有多少出现在目标模型答案的前 100 个 token 中。与前一篇帖子相同,每个分数是 unigram、bigram 和 trigram 源召回率的平均值。变化量是绝对百分点变化。
评估集包含 45 道题目:15 道 STEM、15 道非 STEM,以及 15 道合成 puzzle。
在之前的实验中,Qwen 几乎没有被 Opus 4.8 拉动,但此次向 GPT-5.5 Pro 移动了 +18.18 分,其中包括在私有合成 puzzle 上的显著效果。数据表明 Qwen 可能是从 GPT-5.5 Pro 或一个密切相关的 GPT 模型中学习的,而不是从 Opus。
Kimi K3 在有预填充和无预填充两种情况下都与 GPT-5.5 Pro 有最高的重叠率(31.11% 和 35.65%),不过预填充仅增加了 +4.54 分。