开源 Qwen 模型在图像生成上的竞争力
用户对比本地运行的 Qwen3.6-35B 与 Claude Opus 4.7 的图像能力,展示开源模型的潜力。
用户对比本地运行的 Qwen3.6-35B 与 Claude Opus 4.7 的图像能力,展示开源模型的潜力。
对于任何一直在(不太明智地)把我的鹈鹕骑自行车基准当作测试模型的强大方法的人来说,这里是今天上午两个重大模型发布版本生成的鹈鹕——来自阿里巴巴的 Qwen3.6-35B-A3B 和来自 Anthropic 的 Claude Opus 4.7。
这是 Qwen 3.6 的鹈鹕,使用 Unsloth 的这个 20.9GB Qwen3.6-35B-A3B-UD-Q4_K_S.gguf 量化模型在我的 MacBook Pro M5 上通过 LM Studio(和 llm-lmstudio 插件)生成的——转录记录在这里:
这是我从 Anthropic 的全新 Claude Opus 4.7 得到的(转录记录):
我把这一个判给 Qwen 3.6。Opus 居然搞错了自行车架!
我试过用 thinking_level: max 再问 Opus 一次。效果也没好多少(转录记录):
很多人确信各个实验室都为我的这个愚蠢基准进行了特殊训练。我不认为他们会这样做,但说实话,这个结果确实让我有点怀疑。所以我拿出了我的秘密备用测试——这是我从 Qwen3.6-35B-A3B 和 Opus 4.7 得到的关于"Generate an SVG of a flamingo riding a unicycle"的结果:
我也把这一个判给 Qwen,部分原因是那个优秀的 <!-- Sunglasses on flamingo! --> SVG 注释。
鹈鹕基准一直都是作为一个笑话——主要是对比较这些模型的任务有多么迟钝和荒诞的陈述。
这个笑话的奇妙之处在于,在大多数情况下,生成的鹈鹕的质量与模型的总体实用性之间存在直接关联。2024 年 10 月的那些第一批鹈鹕很糟糕。最近的版本普遍好得多——以至于 Gemini 3.1 Pro 生成的插图你其实可以在某些地方使用,前提是你有迫切的需要来说明一只鹈鹕骑自行车。
今天,甚至那种与实用性的松散关联也被打破了。我对 Qwen 有极大的尊重,但我很怀疑他们最新模型的 21GB 量化版本是否比 Anthropic 最新的专有版本更强大或更有用。
不过,如果你需要的是一个鹈鹕骑自行车的 SVG 插图,那么现在在笔记本电脑上运行 Qwen3.6-35B-A3B 比 Opus 4.7 是个更好的选择!
OpenAI 对 Hugging Face 的意外网络攻击是发生过的科幻小说 - 2026 年 7 月 22 日
与 Claude Code 团队的 Cat 和 Thariq 的炉边谈话 - 2026 年 7 月 21 日
Kimi K3 及我们仍能从鹈鹕基准学到什么 - 2026 年 7 月 16 日
这是来自 Simon Willison 的 Qwen3.6-35B-A3B on my laptop drew me a better pelican than Claude Opus 4.7,发布于 2026 年 4 月 16 日。
下一篇:加入我们在长滩的 PyCon US 2026 - 今年我们有新的 AI 和安全主题
上一篇:Meta 的新模型是 Muse Spark,meta.ai 聊天有一些有趣的工具
以每月 $10 的价格赞助我,获得该月最重要 LLM 发展的精选电子邮件摘要。
付钱让我少给你发!