跳到正文
Google Research·· 4 小时前精选AI 评分66

Google Research 三个月实地实验:AI 辅助提升专利撰写产出,但初级律师无辅助判断力未见提升

Does better work always mean better workers?

AI 导读

Google Research 与 NBER 发布一项为期三个月的实地实验,在 11 家知识产权律所的 133 名律师中随机开放当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)。

推荐理由

三个月实地实验区分了AI带来的即时产出提升与无辅助判断力的变化,为讨论AI是否削弱初级专业能力提供了可对照的证据。

正文 · AI 翻译

判断力是资深专业人士与初级同行之间的区别所在。培养判断力需要在工作中投入数千小时的学习,通常是通过与相对常规的工作进行枯燥但具有塑造性的接触,并且往往是在经验丰富的员工指导下进行。但AI已经在改变在职学习的方式。一方面,放射学、商业问题解决、求职者写作和法律教育领域的实证研究表明,当AI工具被深思熟虑地嵌入培训工作流程时,经验较少的员工可以提高其独立表现。

另一方面,最近针对软件工程师、管理咨询顾问、高中生和临床医生的实验表明,虽然AI充当了临时外骨骼,能提升即时产出,但一旦移除该工具,这些收益往往无法持续。要理解AI如何侵蚀或增强专业知识,需要三个很少同时具备的要素:(1)持续数月的AI使用嵌入日常专业工作中,而非仅数小时;(2)在AI不可用时对无辅助判断力进行可信评估;(3)由领域专家进行盲评。

在美国国家经济研究局发表的《AI辅助是增强还是侵蚀专业知识?来自专利起草三个月实地实验的证据》一文中,我们描述了一项实地实验,用于捕捉在知识产权法这一高度专业密集的行业中,使用AI所带来的短期生产力和长期技能培养两方面的变化。在我们的实验中,我们在11家与谷歌有常规、非排他性业务往来的知识产权律师事务所的133名律师中,随机分配了一款当时尚未发布的Google Labs AI专利撰写助手工具(现已成为Gemini Notebook的一部分)的使用权限。每家律所三分之二的律师(“处理”组)获得了该工具的提前使用权,而其余律师(“对照”组)接受了一些关于如何使用AI的培训,但在三个月研究期结束前被禁止使用该工具。

用AI做出更好的工作

在为期10天的人工智能辅助之后,我们向所有参与的律师发送了一套关于一项假设发明的发明人材料,并要求他们起草一份专利。在90天后,我们用另一组模拟的发明人材料做了同样的事情。我们在这两个时间段都看到了起草任务上预期的AI性能提升。在第10天,AI工具的访问使起草得分(由独立法律专家根据包含五个不同质量方面的李克特量表的评分标准进行评分)提高了0.34个标准差,相当于在对照组得分中百分位排名上升了10个点;到第90天,这一提升增加到0.38个标准差,意味着百分位排名上升了11个点。这些改进在所有质量维度上都表现出显著的一致性。值得注意的是,更好的表现来自于低分频率的降低和高分频率的提高,而优秀分数的频率没有变化。形式上,被分配使用AI的律师的得分从底部移动到了中下和中等等分位,但卓越分数的数量没有明显变化。这种模式在初级律师中尤为明显,他们的质量提升也伴随着显著的时间节省(例如,在10天任务中,比对照组平均124分钟的速度快18分钟)。

但专利律师不仅仅起草专利;他们还相互审查彼此的工作,以发现可能导致专利在法庭上无法执行的关键错误(有时称为“专利亵渎”)——例如,过度主张发明的新颖性或范围。因此,我们在第90天增加了另一项任务,要求受试者对一份包含许多实质性及风格错误的现有假设专利进行红线标注(手动标记并更正)。这项测试任务反映了更资深律师通常使用的专业判断,而他们往往没有依赖AI的奢侈。关键的是,虽然治疗组律师被鼓励在起草任务中使用未发布的AI工具或任何其他AI工具,但没有人被允许在红线标注任务中使用AI,这使得他们在这项任务上的得分成为衡量其技能发展程度的指标。对于所有任务,无论是起草还是红线标注,我们都与第三方专利专业人士合作,从五个质量维度对提交内容进行评分:(1)可执行性,(2)准确性,(3)战略模糊性(权利要求的战术范围界定),(4)完整性,以及(5)清晰度。

当AI被移除时

当AI助手在90天红线标注任务中被移除时,这种拉平效应消失了。获得AI工具访问权的律师在这项无辅助任务上比对照组高出0.32个标准差(相当于百分位排名上升9个点),但这种效应完全由资深律师驱动,他们比对照组受试者高出0.45个标准差(上升13个点),而初级律师则没有显示出明显改善。相反,初级律师的得分出现了分化:更多极低分,较少平庸分,更多良好分,而优秀分没有增加。

这些结果对学习意味着什么?获得AI工具使用权限的资深律师,显然在过去三个月里通过使用该工具,在专业判断方面收获了显著的价值。但初级律师的情况则更为复杂。部分分数有所提高,暗示AI具有跨越式提升学习的能力。另一些分数则分布到了分布的下端,表明在某些场景下AI能帮助初级律师交付合格的工作,但他们借助机器取得的高绩效,并不能转化为更快地掌握那些让资深专业人士具有独特价值的专业知识。

考察定性编辑模式,可以让我们了解不同经验水平的专业人士如何与生成式AI工具互动。在实验组和对照组中,初级律师的提交都遵循僵化的形式主义:他们从上到下按顺序工作,常常在到达主要专利权利要求之前,就把时间耗在低风险引言部分的文字编辑上。初级律师还专注于表面上的同义词替换,而非商业范围的改进。即使初级律师发现了严重缺陷,他们也往往留下描述性评论来诊断缺陷,而不是执行修订来修复它。由于这种“只诊断不执行”的姿态在未借助AI的对照组初级律师中同样普遍,它代表了初级律师的一种基线缺陷,而三个月依赖AI执行改写并未弥补这一缺陷。

相比之下,资深律师则持续从AI接触中受益。接受处理的资深律师在修订上花费的时间比初级律师更长,他们跳过低风险的文字,从头重建权利要求,删除可能无意中缩小法律权利或限制保护范围的语言,并将许多修改与明确的法律原则相配对。在后续访谈中,资深律师描述说,他们把AI输出视为“逻辑审计员”,而非成品。这削弱了他们对现有文字的依恋,迫使他们阐明结构性修改的原因和方式,从而激活并磨砺了他们的基础专业知识。

进一步的方向

提高绩效和建立持久的专业判断是不同的目标。尤其对初级专业人士而言,二者可能相互冲突。基础专业知识可能是缺失的一环,它使AI辅助的重复练习能够在职业生涯中转化为老练的专业判断。即使模型能力不断进步,这种判断很可能仍将重要:律师将继续在与法官、客户和同事的互动中运用自己的判断。他们无法在所有场合都依赖AI工具来协助自己。这个AI时代的一个关键挑战是,确保那些旨在今天产出更好工作的工具,不会阻碍初级专业人士成为我们明天所需的专家。

研究专业人士在其工作环境中的表现对研究人员来说是一项挑战。我们的实验仅包含有限的专利律师样本,这反映了该领域顶级专业人士高昂的小时计费费率。我们仅对他们进行了三个月的观察,与培养持久专业知识所需的数年时间相比,这一窗口期很短。此外,过去一年中模型能力和基线 AI 熟悉度的快速提升(以及 AI 赋能产品在法律领域的渗透)如果现在重新进行试验,可能会影响我们的结果。这些局限性为进一步研究提供了机会,我们希望在未来几个月内开展其中一些研究。尽管如此,我们工作中的一个明确结论是,理解 AI 辅助对专业技能的影响,需要将使用工具的效果与无辅助用户表现的效果区分开来的测试。

致谢

衷心感谢共同作者 Josh Martin、Zanna Iscenko、Scott Strand、David Pearl 和 Melissa Ferere;感谢 James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock 和 Fabien Curto Millet 的指导与支持;感谢 Google Labs 的 Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng 和 Franz Och 与我们合作开展实验;感谢 Kiera Russell 提供产品访问和可信测试者支持;感谢 Steve Gong 和 Taylor Montgomery 提供法律指导和招聘支持;感谢我们的传播、营销和研究博客合作伙伴,包括 Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas 和 Leanne Trujillo 推动发布。

来源:Google Research · research.google