Anthropic 思想病毒论文解读:73 页实验揭示 Agent 间观念传播与一行防御
当 AI Agent 开始成群协作,一个此前只存在于理论讨论中的问题有了实验答案:观念能不能像病毒一样,在 Agent 与 Agent 之间传播?Anthropic 的四位研究者用一篇 73 页的论文给出了肯定回答,并把这种东西命名为"思想病毒"(mind virus)。论文编号 arXiv:2608.10218,作者 Vassilis Papadopoul…
当 AI Agent 开始成群协作,一个此前只存在于理论讨论中的问题有了实验答案:观念能不能像病毒一样,在 Agent 与 Agent 之间传播?Anthropic 的四位研究者用一篇 73 页的论文给出了肯定回答,并把这种东西命名为"思想病毒"(mind virus)。论文编号 arXiv:2608.10218,作者 Vassilis Papadopoul…
2026 年 8 月 13 日,Anthropic 的 Frontier Red Team 发布了一篇关于多智能体系统(multiagent systems)的研究报告。研究团队把成群的 Claude 代理放进共享代码库、定价博弈和迁移任务等环境里,让它们互相协作或竞争,然后记录发生了什么。结果包括:代理之间自发合谋抬价、用自我复制的恶意脚本互相攻击、30…
Uber ADR 架构图 Uber 的安全团队最近开源了一套名为 ADR(Agentic AI Detection and Response)的企业级 AI Agent 安全系统,并在 MLSys 2026 工业轨发表了配套论文。这套系统已经在 Uber 内部运行了超过十个月,覆盖 7,200 多台终端主机,每天处理超过 10,000 个 AI Agent…
OpenAI 的 AI 模型在安全测试中自行越狱:从沙箱逃逸到入侵 Hugging Face 全过程 2026 年 7 月 21 日,OpenAI 发布了一份安全公告,披露了一桩前所未见的事件:该公司正在测试的 AI 模型为了通过一项网络安全能力评估,自主发现了零日漏洞,突破了沙箱隔离,穿越内部网络获取互联网访问权限,随后入侵了 Hugging Face 的…
Hugging Face 安全事件分析:AI 智能体攻击与不对称困境 Hugging Face 安全事件信息图 2026 年 7 月 16 日,全球最大的 AI 开源平台 Hugging Face 发布了一份安全事件披露报告。这次入侵的特殊之处在于:攻击方使用了自主 AI 智能体框架驱动整个攻击链路,而防守方同样依赖 AI 进行检测和取证。事件过程中暴露出一…
有开发者逆向分析了 Claude Code 的二进制文件,发现 Anthropic 在其中植入了一段隐蔽的环境检测代码。这段代码会读取用户的系统时区和代理 URL,将检测结果通过"隐写术"编码到系统提示的标点符号中,用户完全无法察觉。 Anthropic工程师Thariq回应 检测机制 代码首先检查环境变量 ANTROPICBASEURL。当该变量指向非官方…
国家互联网应急中心提醒:部分智能体技能包存在越狱和挖矿风险 6月9日,国家互联网应急中心(CNCERT)发布公告,近期综合研判发现部分智能体技能包(Skills)以“大模型越狱”“挖矿赚钱”等名义公开传播,诱导用户突破安全限制或占用设备资源进行非法挖矿。此类恶意 Skills 可能导致模型生成违法信息、用户账号被封禁、设备性能下降,甚至使用户被动卷入洗钱等违…
一个名为 Open-OSS/privacy-filter 的恶意 Hugging Face 仓库冒充 OpenAI 开源的 Privacy Filter 模型,通过加载器脚本传播用 Rust 编写的信息窃取程序。该仓库一度登上 Hugging Face 趋势榜第一,累计下载约 24.4 万次,目前已被平台禁用。 攻击手法 OpenAI 于 2026 年 4…