Karpathy 评论 DeepSeek-OCR 论文,分析直接用图像像素而非文本的 LLM 架构优缺点。揭示多模态模型设计的深层思考。
Andrej Karpathy(@karpathy)
我很喜欢 DeepSeek-OCR 这篇新论文。它是一个不错的 OCR 模型(可能比 dots 稍差一点),当然还涉及数据收集之类的问题,但这些都不重要。
对我来说,更有意思的部分是(尤其是作为一个骨子里的计算机视觉研究者,只是暂时伪装成自然语言研究者):对于 LLM 而言,像素是否比文本更适合作为输入?文本 token 作为输入,是不是既浪费又糟糕?
也许更合理的做法是:LLM 的所有输入都应该只有图像。即使你手里恰好是纯文本输入,也可能更愿意先把它渲染出来,再送进模型:
我之前已经吐槽过自己有多讨厌 tokenizer。Tokenizer 很丑陋,是一个独立且非端到端的处理阶段。它“引入”了 Unicode、字节编码的所有丑陋之处,继承了大量历史包袱,还带来了安全和 jailbreak 风险(例如 continuation bytes)。
它会让两个肉眼看起来完全相同的字符,在网络内部变成两个截然不同的 token。一个微笑 emoji 看起来就像某个奇怪的 token,而不是一张……真正的笑脸——包括它的所有像素,以及随之而来的全部迁移学习能力。
Tokenizer 必须消失。
OCR 只是众多实用的 vision -> text 任务之一。而 text -> text 任务可以转化成 vision -> text 任务,反过来却不行。
所以,也许 User message 应该是图像,但 decoder(也就是 Assistant response)仍然保持为文本。至于如何逼真地输出像素……或者我们是否真的希望这么做,就远没有那么显而易见了。
现在,我还得克制自己,不要一时冲动跑去做一个只接受图像输入的 nanochat 版本……
vLLM(@vllm_project)
2025 年 10 月 20 日
🚀 DeepSeek-OCR——来自 @deepseek_ai 的 OCR 新前沿,探索面向 LLM 的光学上下文压缩——正在 vLLM 上以惊人的速度运行 ⚡(在 A100-40G 上约为 2500 tokens/s),由 vllm==0.8.5 提供首日模型支持。
🧠 在保持……的同时,将视觉上下文压缩多达 20×。
显示更多
晚上 10:13 · 2025 年 10 月 20 日
330 万次浏览
557
1.6K
13K
6.7K
Elon Musk(@elonmusk)
2025 年 10 月 21 日
长期来看,AI 模型超过 99% 的输入和输出都将是光子。其他任何形式都无法扩展。
《可观测宇宙中的光子数量估算|Grok 共享对话》
来自 grok.com
304
429
3.2K
350 万
Xiao Liu(Shaw)(@ShawLiu12)
2025 年 10 月 21 日
也许你也会对 Z.ai 团队同期开展的工作感兴趣 👋
与 DeepSeek-OCR 类似,我们今天发布了 Glyph:一种视觉文本压缩范式,它将长文本转换成图像,再让 VLM 读取,从而实现约 3 倍的压缩率!
显示更多
530
370
8.4 万
(((ل()(ل() 'yoav))))👾(@yoavgo)
2025 年 10 月 20 日
你能详细解释一下,为什么图像可以轻松使用双向 attention,而文本却不行吗?
另外,虽然不再进行 tokenization,但把输入图像切分成 patch 时,我们难道不会得到某种类似、甚至可能更加丑陋的东西吗?
102
187
10.8 万
加入对话
再查看 554 条回复