前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯3779
  • OpenAI 暂停 Astra:自主 Agent 协调层风险警示
  • 生产环境 RAG 为何总失败:自适应查询路由实战
  • 间接提示注入:MCP 和浏览器自动化引入的隐形威胁
  • Codebase Memory MCP:为编程 Agent 构建结构化代码知识图谱
  • LLM聊天模型全面指南:从原理到生产集成
  • 流式LLM实战:SSE实现实时AI应用
  • 我为何先建AI Agent评估框架再写业务代码
  • AI 技能正在变成软件,需要工程化治理
  • Claude Code v2.1.224:自托管计算边界与跨会话协调机制解析
  • 修复有效≠修复是原因:一次根因分析教训
  • 为工具调用Agent构建AI评测体系实战
  • Agent的问题不是记忆,而是宕机
  • Gemini 3.6 Flash 评测逆袭:免费模型智商超越付费 Pro
  • 辩论驱动开发:AI共识架构代码模式
  • Rust构建自动根因分析引擎实战
  • 多Agent规划时代到来:Meta Muse Code 与 AWS Kiro
  • 为Claude Code构建Git感知的持久记忆层
  • SentinelGuard:LLM 应用的安全网关实战评测
  • Claude Code vs Codex:按任务性格选对工具
  • AI文本检测器实测:14款工具无一超过80%准确率
  • Pokee-Isaac 28B:10M 上下文企业级 Agent 模型
  • 为何AI编程助手每天都要从头开始
  • AI开发Chrome扩展的5条安全规则
  • 理解 Token:AI 模型如何处理文本及成本、上下文、Agent 关系
  • Python+Dify 为低成本 LLM 注入实时本地上下文
  • Claude Code 实战技巧:上下文压缩、路由策略与安全修复
  • Andrew Ng 发布多智能体系统图工程实践指南
  • Takumi:为 AI 编程 Agent 注入工程判断力
  • SwarmForge:tmux 多 AI 智能体协作框架
  • Autolang:面向 AI 生成代码的轻量运行时
  • 用LLM做代码review的正确方式
  • AI Agent 跑通 Demo 却栽在生产环境:缺的是业务上下文层
  • AI 应用应提交工作负载,而非直接选 GPU
  • 多AI编程智能体并行管理:任务所有权与协调经验
  • Claude Code 新增跨会话消息功能
  • Agentic Harness:赋予LLM自主执行能力的架构设计
  • Google官方Agent Skills:覆盖Cloud/GKE/AI全场景
  • AI记忆≠上下文:程序员应知的模型实际工作原理
  • AI激活率≠实际使用率:企业落地为何徒有其表
  • Anthropic将Claude Code默认开启Auto模式
  • LLM-as-Judge:用大模型评估大模型的实战方法
  • 如何为AI Agent构建高质量测试集
  • AI Agent评估方法论:无确定性输入如何做可重复验证
  • Seedance 2.5 / MiniMax H3 / Wan 3.0 视频模型API实测对比
  • 基于 Pydantic AI 的类型化 WebSocket 流式 Agent 实战
  • 腾讯 WorkBuddy 跃居国内 AI 办公智能体榜首
  • 用 Claude Code 排查生产内存泄漏实战复盘
  • Atlassian Rovo 提示词注入漏洞可泄露 Jira 数据
  • AI Agent生产环境仍存在五类工程缺陷
  • OpenAI训练事故时间线分析:RLVR强化学习与安全边界的教训
  • AI修复的SSRF漏洞仍是CWE-918:Cursor的防护在DNS重解析处失效
  • 已加载 51 / 3779
8.0
热点
AI SCORE
模型发布2026-08-09 01:04

Pokee-Isaac 28B:10M 上下文企业级 Agent 模型

MarkTechPost#大模型#长上下文#企业部署
Editor brief · 编辑速览

28B 参数纯文本模型,上下文窗口达 10M token,10M tokens 时 RULER 得分 93.3%,部署于客户自有 VPC 或本地。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Artificial Intelligence

长时程 agent 积累上下文的速度往往快于其解决任务的速度。每个工具输出、观察结果和中间推理步骤都会留在上下文窗口中,而真正重要的两种能力——保持上下文和在其基础上维持连贯性——迄今为止几乎只能从云端 endpoint 获取。这将受监管行业、公共部门机构和端侧应用排除在外,因为这些场景的数据根本不允许离开边界。Pokee AI 发布了 Pokee-Isaac 28B,这是一款 28B 纯文本基础模型,拥有 10M-token 的上下文窗口,設計可在边界内部运行。Pokee 研究团队声称,在 10M token 规模下 RULER 达到 93.3%,在 agent 基准测试上与成本优化最强的云端基线持平,且 serving 配置文件可在单 GPU 上运行。

是的——但这是授权许可模式,而非开放权重。Pokee AI 通过 OpenAI 兼容的开发者 API 提供 Isaac,并授权其部署到 VPC、本地或端侧。发布公告宣传 Day-0 支持 vLLM 和 SGLang,单 GPU serving 最低从 RTX 4090 或同等算力起步。研究团队仅在单块 B200 级 GPU 上发布测量数据,因此消费级 GPU 的说法应视为厂商指导而非已报告结果。

公司层面:这适合已经自建推理栈的组织——拥有平台团队的中型和企业团队,以及设备 OEM。缺乏本地硬件的个人开发者应使用托管 API;边界论证只有在确实存在边界时才值得。

行业层面:医疗保健和支付方、金融服务和保险、国防和公共部门、法律和电子发现,以及制药或半导体研发。共同特征是数据不能跨越外部 API 边界的规则,而非隐私偏好。

应用层面:全仓库代码审查、多年度合同和理赔分析、基于完整日志归档的事件取证,以及永远不需要摘要或上下文裁剪的长时程工具 agent。研究论文明确阐述了第二点:当边界内有足够可用的上下文时,记忆层次结构和压缩变成了可选项而非必选项。

在 RULER 上,Isaac 在所有测试长度上都保持在 93.3% 以上,在 10M 处为 93.3%。GPT-5.6 Luna 和 Gemini 3.5 Flash Lite 在 512K 之前与其持平,然后在 1M 处遇到上下文溢出。

在 MRCR v2 8 针测试中,Isaac 在 256K、512K 和 1M 上的得分分别为 0.607、0.743 和 0.500。在整个扫描过程中,其相对 Gemini 的领先优势从 0.133 扩大到 0.295。

Agent 能力和安全结果

Isaac 在 BFCL v4 上以 70.94 领先于 Luna 的 70.61。报告称这为持平而非领先,这是正确的判断。在 τ³-bench 上,它在四个领域的平均得分为 0.662,领先于 Gemini 的 0.631,银行业对所有人都是 0.186 的难度。在 MCP-Atlas 上它排名第三,覆盖率为 74.59%,但每个任务使用 9.10 轮,而 Gemini 为 14.99。在 Terminal-Bench 2.1 上,它解决了 86 个文本兼容任务中的 56 个(65.1%),落后于 Luna 的 60。这是云端基线唯一获胜的基准测试,报告也直白地说明了这一点。

在 DTAP 红队测试中,Isaac 记录了最低的直接(36.0)、间接(35.2)和组合(35.6)攻击成功率,同时保持 82.5 的良性任务成功率。有一个条件不同:基线在 stock runner 下运行,而 Isaac 在 Pokee harness 下运行。

效率、定价和可移植性

在 RULER 工作负载下,使用单块 B200 级 GPU,TTFT 在 1M 时为 23.6s,在 10M 时为 72.9s。Prefill 吞吐量随上下文增长而上升,从 42,400 升至 137,200 tokens/s,因此十倍长的 prompt 大约需要三倍的 TTFT。列表定价为每百万输入/输出 tokens 0.15/1.00 美元,标注为暂定。Isaac 还可在 Intel Arc Pro B70 和 Core Ultra Series 3 (Panther Lake) 上完全端侧运行,也可在 Qualcomm Snapdragon X2 Elite 上运行。

  • Pokee-Isaac 28B 在 10M token 规模下 RULER 达到 93.3%;其面板中的每个基线在 2M 以外均返回 0.0
  • Prefill 在单块 B200 上 10M 上下文时达到 137,200 tokens/s;decode 保持在 335 tokens/s 附近
  • 在 BFCL v4 (70.94) 和 τ³-bench (0.662 avg) 上领先,在 Terminal-Bench 2.1 上排名第二,在 MCP-Atlas 上排名第三
  • 在 DTAP 上保持最低组合攻击成功率 (35.6),同时维持 82.5 的良性任务成功率
  • 权重未公开发布;部署通过授权许可进入 VPC、本地或端侧

查看 Blog 和 Paper。也请记得在 Twitter 上关注我们,不要忘记加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等一下!你用 telegram 吗?现在你也可以加入我们了。

需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会等?请联系我们

Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学数据科学理学硕士学位。凭借在统计分析、机器学习和数据工程方面的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
AI文本检测器实测:14款工具无一超过80%准确率
下一篇
为何AI编程助手每天都要从头开始