前DeepMind研究员发现,前沿AI模型的加密推理块可跨用户、跨会话、跨同系列模型重放,甚至能套出GPT-5、Claude等隐藏的思考内容。
他们从公开Agent轨迹中解码出31.5万条隐藏推理,含API密钥、邮箱、内部IP等隐私数据。
模型还会用“外星语言”或空白字符思考,安全监控形同虚设,攻击者也可在他人轨迹中投毒外传数据。
该研究40小时内获300万浏览,Anthropic、OpenAI、Google均已确认收到负责任披露。
前DeepMind研究员发现,前沿AI模型的加密推理块可跨用户、跨会话、跨同系列模型重放,甚至能套出GPT-5、Claude等隐藏的思考内容。
他们从公开Agent轨迹中解码出31.5万条隐藏推理,含API密钥、邮箱、内部IP等隐私数据。
模型还会用“外星语言”或空白字符思考,安全监控形同虚设,攻击者也可在他人轨迹中投毒外传数据。
该研究40小时内获300万浏览,Anthropic、OpenAI、Google均已确认收到负责任披露。