Granite 4.2 含3B/8B/30B三规格,均支持思考模式切换和原生工具调用,8B/30B经 Agentic RL 训练可在沙箱环境中编辑代码、操作终端和搜索网页,30B 在 SWE-Bench Verified 达57.00分。
IBM 推出了 Granite 4.2,这是一套参数量分别为 3B、8B 和 30B 的开放式推理语言模型。不同于早期的指令跟随型 Granite 版本,Granite 4.2 以显式推理为核心构建。每个模型都能在回答前输出一条思维链,并且每个模型都提供了一个思考 / 非思考开关,外加一种低 effort 模式——用较少的推理预算来处理简单问题。这些模型是纯解码器的密集 Transformer,在约 15 万亿 token 上从头开始预训练,然后通过多阶段强化学习链进行后训练。对于 8B 和 30B,该训练链包含一个智能体 RL 模块,模型在真实的沙箱环境中学习编辑代码、操作终端和执行网络搜索。三款模型均采用 Apache 2.0 许可发布。IBM 同时还发布了两款 470M 参数的 Granite Speech 5.0 Turbo CTC 模型,与上述 LLM 一同亮相。
是的,三款 Granite 4.2 语言模型均采用 Apache 2.0 许可发布,因此下载、微调和商业生产使用均无许可门槛。
适用公司:3B 适合通过 Ollama 或 LM Studio 在笔记本电脑上运行的独立开发者和初创公司,尤其是发布的 GGUF 量化版本可低至 Q4_K_M。8B 适合在单块现代 GPU 上运行的中型团队。30B 面向拥有 A100/H100 级别算力的企业,或在 vLLM 上使用 FP8/NVFP4 进行服务的企业。受监管机构还能获得本地部署权重这一额外优势。
行业:软件与开发者工具、金融服务、医疗、电信、公共部门以及呼叫中心——后者正是新款语音模型的落地场景。
应用场景:软件工程智能体、终端与 DevOps 自动化、深度研究搜索智能体、长文档 RAG、结构化工具调用、高吞吐量转录。
Granite 4.2 是一个纯解码器的密集 Transformer,而非混合架构或 MoE 设计。核心组件包括:8 个 KV 头的分组查询注意力(Grouped Query Attention)、θ = 10,000,000 的 RoPE 位置编码、SwiGLU MLP、RMSNorm(ε = 1e-5)、未绑定的输入/输出嵌入,以及 bfloat16 精度。
3B 使用 40 层、嵌入维度 2560。8B 使用 40 层、嵌入维度 4096。30B 扩展到 64 层,MLP 隐藏层维度为 32,768。已发布的架构表格列出 131,072 token(128K)的序列长度,而五阶段预训练中的长上下文阶段延伸至 512K token。预训练覆盖约 15 万亿 token,从零开始训练。
监督微调使用了约 720 万样本、约 1000 亿 token,其中约 650 亿可训练。混合数据中智能体类占 31.6%、非智能体类占 68.4%,而软件工程在智能体数据中占比 69%。轨迹数据来自 OpenHands、SWE-agent、Terminus-2、MiniSWE、Codex 和 Goose 等测试框架。质量控制使用 GPT-OSS-120B 和 Gemma 4 作为评判模型,并通过对工具字段和消息字段进行 SHA-256 去重。
后训练是一个多阶段、多环境的 RL 链,而非单次通过。每个阶段是独立的异步 GRPO 运行,以前一检查点为热启动,使用留一法替代价值网络,并采用截断重要性采样来约束离策略漂移。顺序为:RLVR → 技能增强 → SWE → Terminal → Search → RLHF。
智能体 RL 模块仅在 8B 和 30B 上运行。3B 仅进行基础 RL 和对齐训练。正是这一设计选择解释了不同规模之间的大部分能力差距。训练基于 CoreWeave 托管的 NVIDIA GB200 NVL72 集群,使用 NeMo-RL 和 NeMo-Gym 进行。
两个关键支撑同样重要:IBM CodeAlchemy 流程生成的 1 万亿 token 合成代码,以及用于加速服务的投机解码层。
| Benchmark | 3B | 8B | 30B |
|---|---|---|---|
| SWE-Bench Verified | NA | 47.67 | 57.00 |
| Terminal-Bench 2.1 | NA | 20.56 | 29.24 |
| τ³-bench | 50.99 | 66.34 | 68.05 |
| BFCL (v4) | 52.41 | 50.29 | 61.39 |
| AIME25 | 78.33 | 86.67 | 89.17 |
| GPQA | 54.80 | 64.14 | 66.41 |
| MMLU-Pro | 67.84 | 74.04 | 77.60 |
| RULER 128K | 55.30 | 71.41 | 81.38 |
Turbo CTC 模型参数量为 470M,完全移除了 LLM 主干网络,使用连接主义时序分类(CTC)将音频直接映射为文本。IBM 报告在单块 H200 上的 RTFx 吞吐量接近 12,600,而 Open ASR leaderboard 上当前领先模型的吞吐量约为 6,000。WebGPU 演示Demo已上线。
访问 IBM Research 博客、技术报告和 GitHub 仓库了解更多信息。也欢迎关注我们的 Twitter、加入 150k+ ML SubReddit 以及订阅我们的Newsletter。另外,你也可以加入我们的 Telegram 频道。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位富有远见的企业家兼工程师,Asif 致力于将人工智能的潜力用于社会公益。他最新的项目是推出了人工智能媒体平台 Marktechpost,该平台专注于机器学习和深度学习新闻的深度报道,技术严谨且通俗易懂。该平台月浏览量超过 200 万次,深受读者喜爱。