英国 AI 安全研究所:AI 说服力主要来自后训练与提示词,而非模型规模
How do AI models persuade? Exploring the levers of AI-enabled persuasion through large-scale experiments
英国 AI 安全研究所与牛津互联网研究所、伦敦政经、斯坦福和 MIT 合作,在 Science 发表研究,通过三项实验、超 76,000 名参与者和 19 个模型测试了 707 个政治议题上的说服效果。
今天,我们在Science上发表了与牛津互联网研究所、伦敦政治经济学院、斯坦福大学和麻省理工学院的同事共同开展的一项研究,探讨对话式AI如何塑造政治态度。通过三项大规模实验,共有超过76,000名参与者,我们测试了19个AI模型在700多个政治议题上的说服力。
我们的目标是理解对话式AI的说服杠杆:是什么让它有效,以及在什么条件下有效。我们有兴趣回答这样的问题:说服力主要由模型规模驱动吗?个性化和微定向重要吗?模型能否经过后训练变得更有说服力?哪些修辞策略最有效?
为什么要研究AI赋能的说服?
对话式AI系统如今能够即时生成详细、结构良好的论证,并进行感觉量身定制且引人入胜的互动讨论。这虽然为有用的应用创造了机会,但也带来了AI可能影响人们想法和行为的可能性。
尽管目前几乎没有证据表明此类系统正被用于大规模恶意说服人们,但随着技术的进步,这种情况可能会改变。理解使AI具有说服力的机制,使我们能够识别真正的风险所在,而不是依赖假设或推测。这些证据对于设计保护人们安全的保障措施和标准至关重要。
我们的实验设置
在三项实验中,参与者与19个开源和闭源语言模型中的一个进行了来回对话。在受控条件下,模型被指示使用八种不同修辞策略中的一种,说服参与者同意707个议题立场中的一个。这些策略包括以信息为中心的论证、讲故事和道德重构。
参与者在对话前后分别对某个议题的同意程度进行了评分。我们将说服力衡量为对话后平均意见相对于未进行说服性对话的对照组的差异。
我们的主要发现
在三项实验中,我们确定了三个主要发现。
1. 后训练比模型规模更重要
在后训练保持不变的情况下,更大的模型更有说服力,但与在经过验证的说服性对话示例上进行后训练所带来的提升相比,这些增益是适度的。例如,我们的说服奖励建模将一个小型开源模型的说服力提升到足以匹配或超过大得多的前沿模型。进一步证明后训练重要性的是,我们观察到同一前沿模型相隔七个月发布的两个版本(相同规模,不同后训练)之间的说服力差异,超过了我们的统计模型对预训练计算量即使增加100倍所预测的差异。
2. 信息密度比个性化或“微定向”更能驱动说服
尽管人们普遍担心 AI 驱动的微定向,但我们观察到的个性化效果始终很小(不到一个百分点)。真正能预测更大说服收益的是信息密度:模型所部署的可核查事实主张的数量。与基本的“要有说服力”提示相比,提示模型强调事实和证据使说服力提高了 27%,这一增幅大于我们测试过的任何其他策略(其中包括说服文献中的主流策略,如道德重构、讲故事和深度游说)。
3. 更具说服力的模型提出了更多不准确的主张
我们在各项实验中一致发现,提高模型说服力的因素,例如以信息为重点的提示和说服奖励建模,会系统性地降低事实准确性。这意味着,为说服而优化模型可能会以真实性为代价。
然而重要的是,我们的发现并不意味着不准确的主张比准确的主张更有说服力。对这种相关性的一种可能解释是,随着模型在回答中信息密度越来越高,它们最终会耗尽可靠准确事实的供给,并开始生成更薄弱或更不准确的内容。进一步探索这一关系是我们未来研究的一个重要目标。
这一切意味着什么?
我们的发现表明,对话式 AI 在受控条件下可以成为一种有说服力的工具。但重要的是,最强大的说服杠杆不是模型规模或个性化——而是训练后和提示技术,它们会显著影响模型呈现多少信息以及如何组织论点。
提高说服力的同一批技术也会降低事实准确性,这凸显了稳健评估标准、模型训练透明度,以及审慎考虑任何可能影响影响力或真实性的优化的重要性。
展望未来,说服能力可能会通过更大模型的发展而演变,但也许更重要的是通过增强的训练后阶段。与此同时,现实世界的影响仍不确定:我们研究中最有效的说服发生在持续、信息密集的多轮讨论中,而人们在调查实验之外会在多大程度上自愿参与此类对话仍不清楚。
这些结果有助于厘清哪些 AI 说服杠杆值得开发者和政策制定者特别关注。它们也强调了有必要监测未来前沿模型中与说服相关的行为,确保准确性仍是优先事项,并建立保护用户和民主进程的保障措施。随着 AI 能力的进步,持续研究和评估说服潜力将是确保安全可信部署的关键部分。
来源:UK AI Security Institute Blog · aisi.gov.uk