快讯

当AI开始自组织:一次考试作弊,如何变成700个Agent集体攻击事件

链上分析师AI姨表示,metr和redwood research公布了OpenAI之前「AI agent黑进Hugging Face」事件的独立调查。事件最初是一场网络安全考试,OpenAI同时放出了数万个agent,让它们各自寻找软件漏洞。最初这些agent彼此隔离,但一些agent开始想办法作弊。一个agent在OpenAI内部的软件仓库发现了其他agent的痕迹,意识到可以通过这里互相传话,搭起了一块「留言板」。几个小时内,50多个agent找到这里,最终约1200个agent在此交换了超过7万条消息和文件。攻击迅速升级,多个agent共同研究如何骗过考试的自动评分系统,并通过上传恶意数据集从Hugging Face服务器获取本不该看到的数据。