Google Research 三个月专利起草实验:AI 助手提升产出但未必培养初级律师的专业判断
Does better work always mean better workers?
Google Research 发布NBER论文,报告一项针对11家知识产权律所133名律师的三个月随机现场实验,向三分之二律师提前开放当时未发布的Google Labs AI专利起草工具(现为Gemini Notebook的一部分)。
三个月随机实验区分了AI辅助与无辅助表现,读者可以看到初级律师技能未随之增长这一可迁移的发现。
判断力是资深专业人士区别于初级同侪的关键。培养判断力需要数千小时在工作中的学习,通常是通过与相对常规的工作进行乏味但有塑造意义的接触,并常在经验丰富的员工的指导下进行。但 AI 已经在改变在职学习的方式。一方面,在放射学、商业问题解决、求职者写作和法学教育领域的实证研究表明,当 AI 工具被深思熟虑地嵌入培训工作流程时,经验较少的工作者可以提升他们的独立表现。
另一方面,针对软件工程师、管理咨询顾问、高中生和临床医生的最新实验表明,虽然 AI 像一个临时外骨骼一样提升了即时产出,但这些收益往往在工具被移除后无法持续。理解 AI 如何侵蚀或增强专业技能需要三个鲜少同时具备的要素:(1) 数月而非数小时的、嵌入日常专业工作的持续 AI 使用;(2) 在 AI 不可用时对独立判断力的可信评估;(3) 由领域专家进行的盲评。
在由美国国家经济研究局发布的《AI 辅助是增强还是侵蚀专业技能?来自专利起草领域三个月实地实验的证据》中,我们描述了一项实地实验,用以捕捉在高度专业技能密集型的知识产权法律行业中,AI 使用所带来的短期生产力和长期技能培养的变化。在实验中,我们将一个当时尚未发布的 Google Labs AI 专利写作助手工具(现为 Gemini Notebook 的一部分)的使用权限,随机分配给与 Google 有经常性非排他业务往来的十一家知识产权律师事务所的 133 名律师。每家律所中三分之二的律师(“处理”组)获得了该工具的早期使用权,其余律师(“对照组”)接受了一些关于如何使用 AI 的培训,但在三个月研究期结束前不能使用该工具。
借助 AI 把工作做得更好
在为期 10 天的 AI 辅助之后,我们向所有参与的律师发放了一套针对一个假想发明的发明人材料,请他们起草一份专利。在 90 天后,我们用另一套模拟的发明人材料重复了同样的操作。我们在两个时间点都观察到了预期中 AI 对起草任务表现的提升。在第 10 天,获得 AI 工具的权限使起草得分(由独立法律专家依据包含五个不同质量维度的 李克特量表 进行评分)提高了 0.34 个标准差,相当于在对照组得分分布中的百分位排名上升 10 个百分点;到第 90 天,这一提升扩大到 0.38 个标准差,意味着百分位排名上升 11 个百分点。这些改进在所有质量维度上都表现出显著的一致性。值得注意的是,更好的表现来自于低分出现频率的降低和高分出现频率的升高,而优秀分数的出现频率没有变化。严格来说,获得 AI 权限的律师的分数从底部的五分位区间移到了中下和中部的五分位区间,但杰出分数的数量没有明显变化。这一模式在初级律师身上尤为明显,他们的质量提升还伴随着显著的时间节省(例如,在 10 天的任务中,比对照组 124 分钟的平均速度快了 18 分钟)。
但专利律师不仅仅是起草专利;他们还要互相审查工作中的关键错误(有时被称为“专利禁忌语”),这些错误可能使专利在法庭上无法被执行——例如,过度主张发明的新颖性或保护范围。因此,我们在第 90 天增加了另一项任务,要求受试者对一份包含许多错误(既有实质性错误也有文风问题)的现有假想专利进行红线标注(即手动标记并更正)。这项测试任务反映了资深律师日常运用的那种专业判断,而他们通常没有依赖 AI 的余地去完成这类判断。关键在于,虽然我们鼓励处理组律师在起草任务中使用未发布的 AI 工具或任何其他 AI 工具,但任何人都不得在红线标注任务中使用 AI,这使他们在该任务上的得分成为衡量其技能发展程度的标准。对于所有任务,包括起草和红线标注,我们与第三方专利专业人士合作,从五个质量维度对提交内容进行评分:(1) 可执行性,(2) 准确性,(3) 策略性模糊(权利要求的战术性范围界定),(4) 完整性,以及 (5) 清晰度。
当 AI 被移除时
当在第 90 天的红线标注任务中移除 AI 助手后,拉平效应消失了。获得 AI 工具权限的律师在这项无辅助任务中的表现超出对照组 0.32 个标准差(相当于百分位排名上升 9 个百分点),但这一效应完全由资深律师驱动,他们的表现超出对照组受试者 0.45 个标准差(上升 13 个百分点),而初级律师则没有显示出可辨识的改善。相反,初级律师的分数出现了分化:极低分更多了,平庸的分数更少了,好分数更多了,但优秀分数并未增加。
这些结果对学习意味着什么?获得 AI 工具使用权限的资深从业者显然在三个月的使用中,其专业判断收获了大量价值。但初级从业者的图景则更为复杂。一些分数有所提升,暗示 AI 具有跨越式促进学习的能力。另一些分数则向分布的下端散开,表明在某些场景下 AI 能帮助初级从业者交付合格的工作,但他们借助机器辅助取得的更高表现,并不能转化为更快地积累那种使资深专业人士独具价值的专业知识。
考察定性的编辑模式可以提供一些洞察,帮助我们理解不同经验水平的专业人士如何使用生成式 AI 工具。在实验组和对照组中,初级从业者的提交都遵循僵化的形式主义:他们自上而下按顺序处理文档,经常在尚未到达主要专利权利要求之前,就把时间耗在低风险引言部分的文字校对上。初级从业者还倾向于进行表面层面的同义词替换,而非改进商业保护范围。即使发现了严重缺陷,他们通常也只留下描述性的诊断性评论,而不实际执行修订去修复它。由于这种“只诊断不执行”的姿态在未获辅助的对照组初级从业者中同样普遍,它代表了一种初级从业者的基础性短板,而三个月依赖 AI 执行重写并未弥补这一短板。
相比之下,资深律师持续从 AI 的使用中受益。获得辅助的资深律师花在修订上的时间比初级从业者更长,他们跳过低风险的文本,从头重建权利要求,剔除可能无意中缩小法律权利或限制保护范围的语言,并将大量修改与明确的法律原则相对应。在后续访谈中,资深律师描述说,他们并不把 AI 输出视为成品,而是将其当作“逻辑审计师”。这削弱了他们对既有文本的执着,迫使他们阐明结构性修改的原因和方式,从而激活并磨砺了他们的基础专业知识。
进一步的方向
提升表现与培养持久的专业判断是不同的目标。对初级从业者而言,这两个目标之间可能存在张力。基础专业知识或许正是缺失的一环,它能让 AI 辅助下的重复练习在整个职业生涯中转化为成熟的专业判断。即使模型能力不断进步,这种判断很可能仍将非常重要:律师将继续在与法官、客户和同事的互动中运用自己的判断。他们不可能在所有场合都依赖 AI 工具的辅助。这个 AI 时刻的一个关键挑战在于,确保那些旨在让今天的工作变得更好的工具,不会阻碍初级从业者成长为我们在明天所需要的专家。
在真实工作环境中研究专业人士对研究人员来说是一大挑战。我们的实验只纳入了有限数量的专利律师样本,这也反映了该领域顶级专业人士高昂的小时计费费率。我们仅观察了他们三个月,与他们培养持久专业能力所需的数年相比,这只是很短的一段窗口期。此外,过去一年模型能力和AI基础熟悉度的快速提升(以及AI赋能产品在法律领域的渗透),如果我们现在重新运行这项试验,可能会影响我们的结果。这些局限也为进一步研究提供了机会,我们希望在未来几个月内着手其中一些研究。尽管如此,我们这项工作的一个明确结论是:要理解AI辅助对专业技能的影响,需要通过测试将使用工具的效果与用户无辅助时的表现效果区分开来。
致谢
衷心感谢合著者 Josh Martin、Zanna Iscenko、Scott Strand、David Pearl 和 Melissa Ferere;感谢 James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock 和 Fabien Curto Millet 的指导与支持;感谢 Google Labs 的 Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng 和 Franz Och 与我们合作开展这项实验;感谢 Kiera Russell 提供的产品访问权限和可信测试员支持;感谢 Steve Gong 和 Taylor Montgomery 提供的法律指导和招聘支持;并感谢我们的传播、市场和研究博客合作伙伴,包括 Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas 和 Leanne Trujillo,感谢他们推动本次发布。
来源:Google Research · research.google