安全研究人员发现,当向Claude和GPT提供deep_think工具时,模型的隐藏思维链存在被提取的风险,可能导致推理过程外泄。
Can Bölük @_can1357
你们知道可以关掉 thinking,然后给它一个 "deep_think" 工具,它就会用内部 CoT 推理格式调用它吗?gl fixing that
Alexander Panfilov @kotekjedi_ml
我们终于可以聊聊了:我们发现了一种方法,利用每个前沿 AI 公司 API 中的一个漏洞来提取前沿模型的隐藏推理过程。我们验证了,在大多数查询的 prompt 中,我们的推理 token 数量与计费的 API thinking token 一对一匹配。



Can Bölük @_can1357
这里有个 PoC:pasta.can.ac/omegiligox.py 注意我说的是没有提及参数格式的,结果得到了 gpt5 5+ 的 grug-talk 格式。有点意思。
3639 951K
Can Bölük @_can1357
有点怀念真正的 thinking streams 了。切换 thinking 级别也很好使,它一直是 system prompt 里的一个数字!
00:00 2124 529K
Can Bölük @_can1357
下个版本会加上,hf!
9 126 423K


Can Bölük @_can1357
fable btw,anthropic 的 regex 功底通常都很强,smh
522 920K
Can Bölük @_can1357
而且我居然没搞到一个正经域名!离谱!!!
5 116 119K
Kevin @kcos
这下好了。很快我们就只能使用各实验室提供的云端 harness 来跑这些模型了。
41 135 8.1K