
Anthropic 与瑞士洛桑联邦理工学院的研究人员近日发表论文,测试观点或目标是否会像病毒一样在多个 AI 智能体之间传播。研究团队把这类通过自然语言诱导智能体继续转发、并可能改变其行为的内容称为「心智病毒」。
研究设置了两类环境:一组共同完成编程项目的智能体,以及每次交互后都会清空上下文、只能借助记忆文件延续信息的智能体链。部分测试中,病毒能够连续传播近 20 个智能体;有害载荷通常比无害内容更难传播,前沿模型整体上也更不易受影响,但不同模型存在例外。
论文认为,这类攻击目前真实存在但风险有限。在系统提示词中加入简短的自传播内容警告,几乎可以完全阻断传播。研究人员提醒,随着企业内部部署更多相互连接、权限不同的智能体,这种自然语言攻击路径仍需纳入安全设计。
