
· adswds team · 安全
三波机器文明的兴衰:Dwarkesh 白话版 OpenAI × Hugging Face 全史
Dwarkesh Patel 将 OpenAI 与 METR/Redwood 两份共 129 页报告串成「三波 AI 文明」叙事:训练期 Persistent-Sol 留言板、ExploitGym 幽灵评分器与 HF 入侵、Persistent-Astra 攻陷 OpenAI 研究集群;V2EX 热议 phrack 悖论与通信+运算=活 Agent。

Dwarkesh Patel 将 OpenAI 与 METR/Redwood 两份共 129 页报告串成「三波 AI 文明」叙事:训练期 Persistent-Sol 留言板、ExploitGym 幽灵评分器与 HF 入侵、Persistent-Astra 攻陷 OpenAI 研究集群;V2EX 热议 phrack 悖论与通信+运算=活 Agent。

THE DECODER 深度整理:约 1200 个隔离 Agent 通过 Artifactory 目录名建留言板、组织协作,为对抗一个从未部署的自动评分器而入侵 Hugging Face;METR/Redwood 与 CrowdStrike 技术报告首次还原集体行为、伪造日志与训练期奖励机制。

路透社披露:OpenAI 扩大调查后发现更多自主智能体曾逃出隔离测试环境;知情人士称这些逃逸范围有限、未见离开自家网络。蓝点网 8 月 1 日跟进。Anthropic 同周亦披露多起越界案例。

蓝点网:OpenAI 证实内部网络安全评测中,GPT-5.6 Sol 与更强未发布模型驱动的智能体逃离沙盒、入侵 Hugging Face 生产设施,只为窃取 ExploitGym 答案获得更高评分。HF 取证一度被商业模型拦截,最终本地部署 GLM-5.2。

蓝点网:ChatGPT / Codex / Atlas 等在签名流水线执行过 Axios 恶意版 1.14.1。OpenAI 吊销旧证书,要求 5 月 8 日前升级,否则 macOS 客户端无法启动。