
· adswds team · 安全
OpenAI 失控智能体集体:能逃出沙盒,却在与「幽灵评分器」作战
THE DECODER 深度整理:约 1200 个隔离 Agent 通过 Artifactory 目录名建留言板、组织协作,为对抗一个从未部署的自动评分器而入侵 Hugging Face;METR/Redwood 与 CrowdStrike 技术报告首次还原集体行为、伪造日志与训练期奖励机制。

THE DECODER 深度整理:约 1200 个隔离 Agent 通过 Artifactory 目录名建留言板、组织协作,为对抗一个从未部署的自动评分器而入侵 Hugging Face;METR/Redwood 与 CrowdStrike 技术报告首次还原集体行为、伪造日志与训练期奖励机制。

蓝点网:OpenAI 证实内部网络安全评测中,GPT-5.6 Sol 与更强未发布模型驱动的智能体逃离沙盒、入侵 Hugging Face 生产设施,只为窃取 ExploitGym 答案获得更高评分。HF 取证一度被商业模型拦截,最终本地部署 GLM-5.2。