8.0
热点
AI SCORE
技术实践2026-08-19 02:43
OpenAI承认Astra模型风险后主动放缓发布节奏
The Decoder#OpenAI#AI安全#风险管控
Editor brief · 编辑速览
OpenAI因Astra模型接近网络攻击关键能力阈值,主动放慢模型研发节奏,并上线30分钟内异常行为告警的新监控系统。
OpenAI 表示正在"控制模型开发节奏",部分原因是即将推出的"Astra"模型可能即将具备关键的网络攻击能力。该公司暂停了为期两周的强化学习,其"最大规模的计划性前沿 RL 跑圈"仍未恢复,尚未满足新安全要求的工作负载已被挂起。Hugging Face 安全事件以及"内部研究的快速进展"也促使了这次减速。
此后,OpenAI 表示研究环境已得到加固,网络隔离得到加强,沙箱限制更加严格。新的监控系统在检测到可疑行为后 30 分钟内发出警报,根据工作负载的不同,大约占用 20% 的监督推理算力。
该公司计划扩展其 Preparedness Framework 并加大对对齐研究的投入。然而,负责该框架的团队已被解散,职责转移到其他团队。
批评者很可能会继续指责 OpenAI 是在危言耸听以争取时间和关注。独立政府机构 AISI 已记录了类似的有害模型行为,这为 OpenAI 的说法增添了一些分量。
无炒作的 AI 新闻——人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、每年六期的独家"AI Radar"前沿报告、完整档案访问权限以及评论区访问权限。