Thinky 开源 Inkling 多模态大模型
Thinky 首次发布 Inkling 开源多模态 LLM(Apache 2.0 许可),程序员可直接使用的高质量开源替代方案。
Thinky 首次发布 Inkling 开源多模态 LLM(Apache 2.0 许可),程序员可直接使用的高质量开源替代方案。
Thinky 的首个完整 LLM 发布堪称力作,还有个加分项:它是开放权重的!
Thinky 似乎每隔几个月才浮出水面一次;最近推出了交互模型——但每一次都令人印象深刻,展现出品味和深度。今天他们发布了 Inkling——不是 SOTA 模型,但作为美国开源模型的基础,这是一个非常扎实的新系列:
我们的模型叫做 Inkling,是一个 Mixture-of-Experts transformer,总参数 975B,active 参数 41B。
它支持最高 100 万 token 的上下文窗口。
它在 45 万亿个 token 的文本、图像、音频和视频上预训练。
这是一个不同规模模型系列中的第一个:我们同时分享 Inkling-Small 的预览版本,这是一个轻量级模型,有 12B active 参数,用相似的配方训练,以更低的成本和延迟实现了强大的性能。
Inkling 可以对文本、图像和音频进行原生推理,通过高效且可控的思考工作量平衡成本与性能。
Huggingface 的分解涵盖了一些有趣的技术亮点:
Inkling 在大多数帖子中报告为 975B 总参数 / 41B active 参数。一条推文说是 974B,另一条说 952B;推文集中的压倒性共识是约 975B。
这是一个 Mixture-of-Experts 模型,每个 token 有 41B active 参数。
根据多个反应和总结,它采用 Apache 2.0 许可证。
它支持文本、图像和音频输入,输出文本。
开源权重检查点支持最高 100 万 context。
Tinker/API context 描述为 256K,针对 64K 和 256K 上下文的定价有区分。
TML 表示 Inkling 是从头开始训练的。
社区读者从发布材料中提取了 45T 训练 token,虽然一篇文章说是 48T。这个数据集中更常见的数字是 45T。
Inkling 包含可控的推理工作量 / 数字工作量级别。
Tinker 用户强调了简洁的推理和强大的工具调用能力,而不是最大化原始基准追逐。
几个技术水平高的反应从发布中提取了架构选择:
混合/滑动窗口注意力,local-to-global 层比例 5:1,窗口大小 512。
相对位置编码 / 相对注意力偏置,而不是 RoPE;多位发帖者称这是最具新颖性的大规模选择之一。
短卷积层添加到注意力/FFN 流周围;评论者标记这为异常大规模的短卷积使用。
MoE 带有共享专家 sink / 2 个共享专家,注意到这是非典型的,因为许多最近的 MoE 使用 1 个共享专家。
DeepSeek 风格的无辅助损失负载平衡在社区对架构的阅读中被引用。
muP 和 Muon/weight decay 变体从文章中推断出来,并由优化器专家反应确认:Aaron Defazio 表示他们正在使用他修正后的 weight decay 方法"MuonC/AdamC",而社区读者也指出了 muP。
vLLM 突出了 8 个 MTP 头用于推测解码。
Inkling-Small 在多个讨论中被重复提及为即将推出或单独讨论的较小模型。
社区总结将 Inkling-Small 描述为 276B 总参数 / 12B active,在几个评估中与较大模型相比出人意料地具有竞争力。
Artificial Analysis 表示 Inkling 在 Intelligence Index 上首次亮相评分 41,使其成为领先的美国开源权重发布,领先于 Nemotron 3 Ultra (38)、Gemma 4 31B (29) 和 gpt-oss-120b (24)。
Artificial Analysis 还表示 Inkling 在 Intelligence Index 任务中平均 25K 输出 token,而 GLM-5.2 最大值为 43K,Kimi K2.6 为 38K,DeepSeek v4 Pro 最大值为 37K,这被描述为相对高效的 token。
Natolambert 称其为"相比 Nemotron Ultra 的明确进步"和"新的最佳美国模型",但仍然"在 agentic 基准上略微落后于 GLM 5.2,在多模态上落后于 Kimi K 2.6"。
Design Arena 表示 Inkling 进入 Agentic Web App Arena 排名第 9,Elo 1257,与 Claude Opus 4.6 和 Gemini 3.5 Flash 处于同一级别,并称其为最高排名的美国开源权重 agentic 工作负载模型。
Arena 在发布当天将 Inkling 添加到 Agent Arena / Text / Vision / Code Arena。
来自 Artificial Analysis:
GDPval-AA v2 Elo 1238,高于 Kimi K2.6 (1190) 和 DeepSeek v4 Flash 最大值 (1189)。
τ³-Banking 24%,高于 Kimi K2.6 (21%),略高于 DeepSeek v4 Flash 最大值 (23%)。
"锐利且简洁"的推理,不冗长。
Strong 工具调用和 agentic 任务中良好的长视野错误恢复。
良好的"思维品质" / 不谄媚的风格。
Alex Kirillov 宣称 Inkling 避免了许多全模态模型中常见的"音频输入 = 智能惩罚",不过另一个用户要求更强的支持证据和基准。
Scaling01 辩称基准"不是特别好",将其描述为大致"另一个 Kimi-K2.6",落后于所有闭源模型和 GLM-5.2,推测发布可能是在 Kimi-K3 和 DeepSeek-V4-GA 之前提前进行的。
Stochasticchasm 表示它似乎"对多模态非常强"但"对 terminal bench 等没有超级强"。
JJitsev 对"仅有的未经蒸馏训练的开源权重模型"的炒作进行了反驳,称 Inkling 使用来自开源权重的蒸馏,在 TerminalBench 风格的评估上表现不如 GLM 5.2。
TeortaxesTex 提供了一个反向的正面看法:平庸的基准最大化实际上可能表明更少的角落切割/蒸馏污染,以及更独立的数据管道。
NVIDIA 表示 Inkling 在 GB300 NVL72 上训练,NVFP4 检查点在第一天就可以在 Hugging Face 上获得。
vLLM 表示第一天的支持包括 NVFP4 和 BF16,针对 Blackwell 和 Hopper 进行了优化,在 4× GB200 上使用 MTP 可达每用户 380 tok/s。
Inferact 详细说明了系统工作:sconv 感知的张量并行分片、低延迟融合集合(在 bs=1 时快 5 倍),以及 TML 的 FA4 sheared-bias 内核的直接集成。
LMSYS/SGLang 表示 Inkling 架构支持是原生实现的,包括 ShortConv、相对位置注意力、共享专家 sink MoE、prefill 完整 CUDA 图、MXFP8 KV 缓存、自定义 Megatron 后端中的完整参数和 LoRA RL、routing replay、跨运行时参数同步和来自 Modal 的 DFlash 推测解码。
Modal 表示 Modal 上的 Inkling 使用自定义 DFlash 推测器,实现了 67% 更高的吞吐量和交互性。
Soumith Chintala 另外强调 Modal 的 DFlash 推测器"远快于 MTP"。
Lysandre 报告将 TML 的因果 Conv1D 替换为 causal-conv1d 产生了 +4% tok/s,将注意力替换为 FlashAttention-4 产生了另外 +11%,总共约 15% 的吞吐量增益,无需重新训练。
Unsloth 发布了据称 86% 更小的 1-bit GGUF 量化 (270GB vs 1.9TB),同时保留了 74.2% 的 top-1% 准确率,支持视觉和音频。
Artificial Analysis 列出了 Tinker 定价:
64K context: $1.87 / 1M input, $0.374 cached, $4.68 output
256K context: $3.74 / 1M input, $0.748 cached, $9.36 output
可在 Tinker、Hugging Face 上获得,以及通过包括 Databricks、Baseten、Modal、vLLM/SGLang 栈在内的发布合作伙伴获得。
开放权重/完整权重已发布。
从头开始训练。
975B 总参数 / 41B active MoE,多模态文本-图像-音频输入,权重上 1M context,Tinker/API 上 256K。
Apache 2.0 许可证。
预训练在去年冬天开始;agentic/编码/推理工作在 1 月中旬开始。
主要服务栈上的第一天支持,带有来自 vLLM/Inferact/Modal/NVIDIA 的具体性能声明。
"最佳美国开源模型" / "拯救了美国开源前沿"是判断,尽管由多位受人尊敬的观察者重复。
关于 Inkling 之所以特别重要是因为它不是从 OpenAI/Anthropic 蒸馏而来的说法存在争议。Jxmnop 称其为"仅有的"不进行此类蒸馏的开源权重模型,随后部分收回了说法:"显然他们确实进行了蒸馏。但只是一点点"。Andrew Carr 也质疑了纯正性框架,指出使用 Kimi 2.5 进行 SFT 跟踪。
关于 Inkling 是否被"仓促"发布以抢在中国发布之前的说法是批评者的猜测,发布材料中没有证据支持。
关于相对注意力给 TML 一个微调护城河的说法因为反向传播很难是推测性的。
关于 Inkling 避免多模态智能损失的说法很有希望,但推文集中尚未有基准完整性。
开放权重和宽松许可作为战略胜利:许多人将 Apache-2.0 发布视为美国/西方开源生态的重大提升。
自定义优于排行榜追逐:研究人员和构建者赞赏 Inkling 是一个广泛的、可调整的基础而非基准最大化点解决方案的明确框架。
强大的发布质量:多个用户赞赏了透明度、有根据的语气和全面的技术文档。