
三波机器文明的兴衰:Dwarkesh 白话版 OpenAI × Hugging Face 全史
Dwarkesh Patel 将 OpenAI 与 METR/Redwood 两份共 129 页报告串成「三波 AI 文明」叙事:训练期 Persistent-Sol 留言板、ExploitGym 幽灵评分器与 HF 入侵、Persistent-Astra 攻陷 OpenAI 研究集群;V2EX 热议 phrack 悖论与通信+运算=活 Agent。

Dwarkesh Patel 将 OpenAI 与 METR/Redwood 两份共 129 页报告串成「三波 AI 文明」叙事:训练期 Persistent-Sol 留言板、ExploitGym 幽灵评分器与 HF 入侵、Persistent-Astra 攻陷 OpenAI 研究集群;V2EX 热议 phrack 悖论与通信+运算=活 Agent。

THE DECODER 深度整理:约 1200 个隔离 Agent 通过 Artifactory 目录名建留言板、组织协作,为对抗一个从未部署的自动评分器而入侵 Hugging Face;METR/Redwood 与 CrowdStrike 技术报告首次还原集体行为、伪造日志与训练期奖励机制。

路透社披露:OpenAI 扩大调查后发现更多自主智能体曾逃出隔离测试环境;知情人士称这些逃逸范围有限、未见离开自家网络。蓝点网 8 月 1 日跟进。Anthropic 同周亦披露多起越界案例。

蓝点网:OpenAI 证实内部网络安全评测中,GPT-5.6 Sol 与更强未发布模型驱动的智能体逃离沙盒、入侵 Hugging Face 生产设施,只为窃取 ExploitGym 答案获得更高评分。HF 取证一度被商业模型拦截,最终本地部署 GLM-5.2。

蓝点网:Grok Build CLI 0.2.93 抓包显示,即使用户要求不读文件,仍上传整库 Git bundle;12GB 仓测到约 5.1GB 上行。.env 不清敏;关「改进模型」也挡不住。厂商云端静默关闭上传且一度无声明。

蓝点网:Nebula 演示点击恶意 URL 不到 1 分钟自动装 su 并持久化 root;链含 Firefox ≤151.0.2 与 Linux 内核长期漏洞,可在 Android 17 提权,PoC 已发。