28B 参数纯文本模型,上下文窗口达 10M token,10M tokens 时 RULER 得分 93.3%,部署于客户自有 VPC 或本地。
Artificial Intelligence
长时程 agent 积累上下文的速度往往快于其解决任务的速度。每个工具输出、观察结果和中间推理步骤都会留在上下文窗口中,而真正重要的两种能力——保持上下文和在其基础上维持连贯性——迄今为止几乎只能从云端 endpoint 获取。这将受监管行业、公共部门机构和端侧应用排除在外,因为这些场景的数据根本不允许离开边界。Pokee AI 发布了 Pokee-Isaac 28B,这是一款 28B 纯文本基础模型,拥有 10M-token 的上下文窗口,設計可在边界内部运行。Pokee 研究团队声称,在 10M token 规模下 RULER 达到 93.3%,在 agent 基准测试上与成本优化最强的云端基线持平,且 serving 配置文件可在单 GPU 上运行。
是的——但这是授权许可模式,而非开放权重。Pokee AI 通过 OpenAI 兼容的开发者 API 提供 Isaac,并授权其部署到 VPC、本地或端侧。发布公告宣传 Day-0 支持 vLLM 和 SGLang,单 GPU serving 最低从 RTX 4090 或同等算力起步。研究团队仅在单块 B200 级 GPU 上发布测量数据,因此消费级 GPU 的说法应视为厂商指导而非已报告结果。
公司层面:这适合已经自建推理栈的组织——拥有平台团队的中型和企业团队,以及设备 OEM。缺乏本地硬件的个人开发者应使用托管 API;边界论证只有在确实存在边界时才值得。
行业层面:医疗保健和支付方、金融服务和保险、国防和公共部门、法律和电子发现,以及制药或半导体研发。共同特征是数据不能跨越外部 API 边界的规则,而非隐私偏好。
应用层面:全仓库代码审查、多年度合同和理赔分析、基于完整日志归档的事件取证,以及永远不需要摘要或上下文裁剪的长时程工具 agent。研究论文明确阐述了第二点:当边界内有足够可用的上下文时,记忆层次结构和压缩变成了可选项而非必选项。
在 RULER 上,Isaac 在所有测试长度上都保持在 93.3% 以上,在 10M 处为 93.3%。GPT-5.6 Luna 和 Gemini 3.5 Flash Lite 在 512K 之前与其持平,然后在 1M 处遇到上下文溢出。
在 MRCR v2 8 针测试中,Isaac 在 256K、512K 和 1M 上的得分分别为 0.607、0.743 和 0.500。在整个扫描过程中,其相对 Gemini 的领先优势从 0.133 扩大到 0.295。
Isaac 在 BFCL v4 上以 70.94 领先于 Luna 的 70.61。报告称这为持平而非领先,这是正确的判断。在 τ³-bench 上,它在四个领域的平均得分为 0.662,领先于 Gemini 的 0.631,银行业对所有人都是 0.186 的难度。在 MCP-Atlas 上它排名第三,覆盖率为 74.59%,但每个任务使用 9.10 轮,而 Gemini 为 14.99。在 Terminal-Bench 2.1 上,它解决了 86 个文本兼容任务中的 56 个(65.1%),落后于 Luna 的 60。这是云端基线唯一获胜的基准测试,报告也直白地说明了这一点。
在 DTAP 红队测试中,Isaac 记录了最低的直接(36.0)、间接(35.2)和组合(35.6)攻击成功率,同时保持 82.5 的良性任务成功率。有一个条件不同:基线在 stock runner 下运行,而 Isaac 在 Pokee harness 下运行。
在 RULER 工作负载下,使用单块 B200 级 GPU,TTFT 在 1M 时为 23.6s,在 10M 时为 72.9s。Prefill 吞吐量随上下文增长而上升,从 42,400 升至 137,200 tokens/s,因此十倍长的 prompt 大约需要三倍的 TTFT。列表定价为每百万输入/输出 tokens 0.15/1.00 美元,标注为暂定。Isaac 还可在 Intel Arc Pro B70 和 Core Ultra Series 3 (Panther Lake) 上完全端侧运行,也可在 Qualcomm Snapdragon X2 Elite 上运行。
查看 Blog 和 Paper。也请记得在 Twitter 上关注我们,不要忘记加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等一下!你用 telegram 吗?现在你也可以加入我们了。
需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会等?请联系我们
Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学数据科学理学硕士学位。凭借在统计分析、机器学习和数据工程方面的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。