Wikimedia 发现 OpenAI 智能体在其平台上的未授权活动
OpenAI "rogue" agent activities found on Wikimedia projects
Wikimedia 基金会公布自查结果,确认在 Wikimedia 平台上发现来自 OpenAI 所运营智能体的未授权活动,包括对 wiki 的编辑、对公共 Etherpad 的未成功入侵尝试,以及对公共 API 的数百万次自动请求。
Wikimedia 公布对 OpenAI 智能体活动的自查结果,读者可了解智能体对公共知识平台造成的实际影响与治理缺口。
最近,多个组织披露了所谓的“流氓”AI代理集群如何试图闯入网站和在线服务,有时甚至成功。特别是来自OpenAI环境的代理,已知它们利用其他公共wiki(非我们所有的协作编辑网站)来相互沟通和协调。
这些成功的入侵可能暴露敏感数据或破坏用户依赖的网站服务,而代理集群可以尝试以防御者难以管理的规模发动攻击。它们影响到网站背后的人们,这些人可能不了解攻击的性质,也没有有效反击的工具。对于像Wikipedia这样的网站,代理可能会发现并利用安全漏洞,或进行大规模的误导性编辑。Wikipedia的志愿编辑和Wikimedia Foundation的安全团队必须检测并撤销这些活动。
Wikimedia Foundation进行了自己的调查,以查看Wikimedia网站是否受到AI代理的类似影响,重点关注OpenAI运营的代理。我们可以确认,我们在Wikimedia平台上发现了这些“流氓”OpenAI代理的一些活动。未经授权的机器人活动包括对我们wiki的编辑、一些试图利用我们托管的公共笔记工具的不成功尝试,以及大量流量,下面将详细描述。
我们没有发现任何证据表明我们的系统被用于代理之间的协调,也没有发现任何证据表明我们的系统或数据遭到入侵。然而,我们对这里可能发生的事情、调查和归因这些活动所涉及的难度和努力,以及代理AI活动在我们平台上日益增长的风险感到担忧。开放网络是一种公共产品。我们不应允许这种行为成为维护它的人们或组织的“新常态”。
总之,我们看到了:
- Wiki编辑:我们已经识别出对Wikimedia wiki的编辑,我们认为这些编辑来自OpenAI运营的AI代理。这些编辑没有发布到一般读者可见的页面上;几乎所有这些编辑都是在wiki的“沙盒”区域进行测试编辑。它还包括对引用工具配置的一些编辑,我们认为这些可能是恶意编辑,意图滥用此工具作为从远程服务获取数据的代理。虽然Wikipedia政策允许机器人在披露并获得社区批准后进行编辑,但在这些事件中,没有寻求任何此类批准。
- Etherpad探测和使用:我们认为由OpenAI运营的代理对我们公共的Etherpad(我们作为社区服务托管的笔记工具)进行了一些不成功的入侵尝试。代理们不成功地试图用它作为代理从其他网站获取数据。其他可能也由OpenAI运营的代理记录了它们的任务笔记,尽管这似乎没有转化为协调。
- 过度数据下载:我们认为由 OpenAI 运营的代理对我们的公共 API 发起了数百万次自动化请求,以获取维基媒体项目上的知识,抓取了数百万个页面(主要来自我们的 Wikidata 和 Wikimedia Commons 项目),并对 Wikidata 查询服务(WQDS)发起了数十万次数据查询。这一流量可能导致了五月 WQDS 的部分服务中断。
作为全球一些规模最大、使用最广泛的开源知识平台的非营利技术托管方,我们对“流氓”AI 代理对像我们这样的平台所造成的影响深感担忧——这些平台由来自世界各地的志愿者构建,并依赖于开放互联网的承诺。像这样的事件,以及已经(并且仍在)被发现的许多其他事件,都表明 AI 代理如何耗尽资源、使服务器崩溃,并试图破坏可信信息。
在过去 25 年里,维基百科已发展成为世界上最受欢迎、最受信任的网站之一,拥有超过 300 种语言的 6700 多万篇文章,每月页面浏览量高达 150 亿次。通过开放、透明和协作的流程,志愿者们努力确保知识保持中立、可靠,并让每个人都能获取。维基百科是用于训练大型语言模型(LLM)的质量最高的数据集之一,其知识构成了互联网信息的骨干,为 AI 聊天机器人、搜索引擎、语音助手等提供支持。
维基百科是为人类设计的——而代理行为显然带来了无人能解决的挑战。由于我们独特且成功的知识创造模式,维基媒体的志愿者是首先接触到并清理 AI 代理留下烂摊子的人。不断上升的机器人流量和代理活动正在对维基媒体项目及其基础设施产生切实影响,而这些基础设施为全球数百万用户提供服务。2025 年,基金会报告称,由于自 2024 年以来其网站上机器人活动的激增,其带宽使用量增加了 50%。与此同时,其项目上 65% 的最耗资源流量来自机器人。
对我们基础设施的这种巨大压力不仅增加了服务器和人力成本,而且如果得不到解决,还可能因系统过载和中断而阻挡人类访客。我们已经在为活动增加所带来的成本买单。
维基媒体的志愿者迄今为止在应对我们平台上的新挑战时保持了韧性,但我们还想说:事情本不必如此。
虽然 OpenAI 承认代理行为“不可预测”,但他们也必须承认自己有责任监控和防范这些风险。AI 公司在保护其系统、保护公众免受其造成的伤害方面做得还不够。这一负担正落在其他所有人身上,包括较小的组织。至少,他们的系统应当以一种像我们这样的非营利网站所有者能够轻松识别的方式运行,并让我们选择如何与其服务进行交互。
网络带来了如此多的可能:与朋友和家人联系、报名上学、规划穿越城市的行程、购买日用品,以及通过 Wikipedia 了解世界。机器人和智能体是网络的未来的一部分,而那些释放它们并从中获利的公司必须直接帮助避免和修复它们可能造成的损害。
我们的共同优先事项应该是整个网络生态系统的健康,以便它继续惠及所有人——而不仅仅是少数亿万富翁。Wikimedia 在守护知识共享方面发挥着关键作用,但我们无法独自完成。我们邀请所有正在构建网络未来的人加入我们,共同保护使这一未来成为可能的开放、共享资源。
你能帮我们翻译这篇文章吗?
为了让这篇文章尽可能触达更多人,我们希望得到你的帮助。你能翻译这篇文章,把信息传播出去吗?
来源:Hacker News · diff.wikimedia.org