一位分析师打开了一份由人工智能助手在几秒钟内生成的供应商合同摘要草稿。草稿内容流畅,包含了终止条款和付款期限,并且整体语气自信。过去,这位分析师需要花一个上午的时间阅读合同才能找到这些信息。现在问题不同了:这份摘要是否正确?在签字之前,他们还需要核实哪些内容?
这是一个示例场景,并非已记录的客户案例。它反映了许多工作中正在发生的变化:找到答案的速度更快了。但判断答案是否可信,以及如果不可信该由谁负责,仍然由个人决定。
本指南面向负责学习与发展 (L&D) 的负责人和教学设计师,旨在帮助他们规划人工智能 (AI) 员工培训。指南阐述了如何找到 AI 会改变人类工作的任务,如何围绕有时会出错的输出结果构建实践,以及如何在不承诺提高生产力的情况下衡量 AI 的合理使用。
要闻速览
| 问题 | 简答 |
|---|---|
| 人们在工作中使用人工智能后,会发生哪些变化? | 撰写初稿或答案会变得更容易,但验证、评判和承担结果的责任却不会消失。 |
| 人工智能训练应该教授什么? | 一项任务现在需要的检查和判断,以及完成这项任务所需的领域知识。 |
| 单靠指令就能解决过度信任的问题吗? | 不。对自动化偏见的研究发现,新手和专家都会出现这种偏见,而且仅靠培训或指导并不能预防。 |
| 要测量什么? | 在真实任务中进行观察验证,并遵守人工智能使用的既定界限。 |
1. 绘制人工智能如何改变工作任务的示意图
先从一个实际任务入手,而不是从某个工具入手。分别描述人工智能出现之前和现在完成这项任务的方式,然后逐列比较两者。
以合同为例:
- 之前: 阅读完整合同,提取关键条款,标记任何异常之处,并撰写摘要。
- 现在: 审核人工智能生成的摘要,将其与来源进行核对,决定是否采纳,标记任何异常情况,并对结果负责。
有些步骤缩短了。提取术语可能只需几秒钟。而另一些步骤则出现或增加:例如,将输出结果与源文本进行比对、注意摘要遗漏的内容,以及决定何时咨询专家。所需的技能已从产出转向评估。用布鲁姆的术语来说(布鲁姆描述的是任务所需的思维方式,而非任务的执行方式),重点已转移到分析和评估上。我们的指南 将学习活动与布鲁姆分类法相匹配 说明如何在了解级别后调整目标、活动和评估。
这种对比是进行客观的人工智能培训需求分析的核心。它还能避免一个常见的错误:当真正的变化仅仅是新增了一项检查职责时,却对所有人进行工具培训。
2. 确定验证和判断需求
针对“现在”栏中的每个步骤提出三个问题。
- 错误的输出会是什么样子? 捏造的条款、遗漏的例外情况、看似合理但已过时的数字。
- 我需要哪些证据才能证实这一点? 源文件、第二个系统、同事、政策。
- 我什么时候应该停下来问问别人? “我可以验证这一点”和“这需要专家”之间的界限。
几十年来,研究人员一直在研究人们在使用不完善的自动化辅助工具时会发生什么。Parasuraman 和 Manzey 对这些研究的回顾描述了自动化偏差,即人们由于依赖并非总是正确的决策辅助工具而犯下遗漏错误和执行错误。该研究发现,新手和专家参与者都会出现这种效应,并得出结论:仅靠培训或指导无法预防这种效应。Parasuraman 和 Manzey,2010,《人类因素》这项研究早于当今的人工智能助手,因此应将其视为对人类行为的警示,而不是对任何当前工具的衡量。
对员工进行人工智能培训的实际经验是,仅仅告诉他们“检查输出结果”并不是一个好方法。员工所处的环境也很重要:检查所需的时间、获取源代码的权限,以及不会因为他们工作速度慢而惩罚他们的工作环境。
3.围绕不可靠的输出建立练习
如果任务现在涉及判断输出结果,那就练习判断输出结果。构建一个小型案例集,其中人工智能的响应为:
- 正确且完整。 正确的做法是接受它,并说明原因。
- 不完整 这话没错,但它忽略了一些重要的东西。
- 误导。 自信、文笔流畅,但错误之处却很容易被忽略。
学习者会收到每个案例、一个可供核对的参考资料,以及一个选择:接受、纠正或向上级汇报。他们还必须给出理由。评估同意或质疑的理由,而不仅仅是他们的自信。不加核实就接受正确答案的学习者没有展现出相应的技能,而对所有问题都提出质疑的学习者也同样如此。
互动式教学形式非常适合这种教学方式。每个人在小组讨论前都要做出决定并说明理由,这样一来,过度信任和过度谨慎都会暴露出来。自主学习模式适用于第一轮学习,而实时讨论则用于处理存在两种合理解读的模糊案例。AhaSlides 支持互动式学习,并可在实时讨论和自主学习模式之间切换,因此一套案例可以同时用于两种模式。在制定计划之前,请务必将任何特定的创作、反馈或报告功能与您自己的工作流程进行比对。
4. 保留先决知识
你无法评估自己不理解的输出结果。如果一个人从未了解过付款条款与终止权之间的关系,那么当摘要中出现错误时,他也不会察觉。人工智能的普及并不会消除对这种理解的必要性,它只是改变了人工智能的应用场景。
确定每个验证任务所依赖的领域知识,并在练习前通过简短的自定进度诊断进行检查。这样的回忆检查只能确认前提条件,并不能证明任何人都能验证输出结果。卡内基梅隆大学的埃伯利中心也提出了类似的普遍设计观点:评估、目标和教学活动应该保持一致。如果评估衡量的是回忆,而目标却要求分析,那么它就无法衡量学习者应该学习的内容,这种不匹配会削弱学习动机和学习效果。埃伯利中心,目标、评估和教学的协调一致).
5. 在实际任务中衡量负责任的使用
选择一项人们真正执行的验证任务,并在进行衡量之前设定人工智能使用的批准范围:哪些可以委托给工具,哪些必须检查,哪些必须上报。
美国疾病控制与预防中心将学习效果评估与人们在工作中应用这些效果的评估区分开来,并建议对两者都进行规划(美国疾病控制与预防中心,评估培训:衡量有效性这是评估指南,而非结果预测。对于人工智能任务而言,这意味着两项指标:
- 学习: 在一组全新的、未见过的案例上的表现,与基线进行比较。
- 传递: 在监督下完成的工作任务或真实工作样本,在人们有时间运用所学知识之后,根据相同的评分标准进行审查。
明确纳入对象、分母和时间节点。效率报告仅基于可衡量的证据。如果团队在接受人工智能训练后速度提升,在将功劳归于训练之前,应检查同一时期内还有哪些其他变化,例如使用了新的模板、人员变动或工作组合发生了变化。
为了更全面地了解风险,美国国家标准与技术研究院发布了…… 人工智能风险管理框架该指南于2023年1月发布,供各组织机构思考人工智能风险时使用。它只是风险讨论的起点,并非培训标准或认证。
一个实际示例:合同概要
举例说明。从事这项工作的从业人员在使用前应验证案例和答案标准。
案子。 学习者收到一份虚构的供应商合同和一份人工智能生成的摘要。摘要中提到终止通知期为 60 天。而合同中规定,无故终止的通知期为 60 天,违约终止的通知期为 30 天。摘要还遗漏了附录中的付款期限例外条款。
学习者被要求做什么。 解释决定(接受、纠正或上报),引用合同中的证据,并说明他们还需要哪些进一步的信息或支持。
反应迟钝。 “摘要看起来准确,涵盖了主要条款。接受。”但它没有引用任何内容,也没有勾选任何选项。
更强硬的回应。 “我不会接受目前的条款。第14条规定,无故终止合同的期限为60天,违约终止合同的期限为30天,而摘要中只提到了60天。附录B中有一项付款例外条款,但摘要中没有提及。我会修改终止条款并添加该例外条款。我不确定该附录是否适用于这家供应商,所以我会咨询合同负责人。”
重试。 学习者会收到第二份合同,其中人工智能的总结是正确的。此时正确的做法是接受并说明检查结果。这可以防止人们养成条件反射式的怀疑态度。
人工智能任务分析工作表
对于实际任务,请在“现在”列中为每个步骤使用一行。
| 任务步骤 | 人工智能现在做什么 | 这个人仍然必须做什么 | 需要证据来核实 | 升级至 | 先决知识 |
|---|---|---|---|---|---|
| 提取关键术语 | 草拟清单 | 与来源进行比较 | 合同本身 | 合同负责人 | 合同结构和条款类型 |
| 标记异常术语 | 推荐候选人 | 判断此背景下哪些内容不寻常。 | 过往合同、政策 | 法律 | 此类供应商的标准条款 |
| 签署摘要 | 没什么 | 承担结果 | 已核实摘要 | 直线经理 | 审批限制 |
您可以根据自身情况进行调整
每个标准评分 0 到 2 分。这是一份由该领域专家进行调整的建议,并非经过验证的准备标准。
| 标准 | 可观察的证据 |
|---|---|
| 任务执行 | 识别人工智能在验证和判断任务中发生变化的位置,并记录该行为及其背后的证据。 |
| 推理 | 解释了各种限制条件、替代方案和不确定性。接受或质疑某个结果的原因取决于其来源。 |
| 边界 | 使用经批准的人工智能使用程序,并在信息或权限不足时寻求帮助。 |
主播: 0 分 = 缺失或缺乏支持。1 分 = 部分缺失,存在相关遗漏。2 分 = 完整且符合既定标准。请单独定义严重错误,例如签署与源文件相矛盾的输出结果,或使用未经批准的工具共享机密数据。总分不得掩盖严重错误。
可能存在的限制
在训练案例中做出更明智的判断并不能消除所有限制:
- 时间紧迫。 如果成交量目标没有检查的空间,人们就会忽略他们被教导要检查的内容。
- 问责机制不明确。 如果没有人被指定为已检查输出的所有者,那么检查就不是任何人的职责。
- 工具的局限性。 有些工具不让用户看到答案背后的来源,这使得验证过程很慢。
- 更换工具。 更新后行为发生改变的人工智能系统可能会打破你上个季度养成的验证习惯。
针对这些问题制定单独的解决方案,并告知赞助商。培训可以培养技能,但无法创造时间或权力。
常见问题
员工人工智能培训应该涵盖哪些内容?
首先介绍人工智能在其角色中改变的任务。内容包括如何将输出结果与证据进行比对、何时需要升级处理、人工智能使用的获准范围,以及判断答案所需的领域知识。工具提示随后介绍。
人工智能是否取代了领域知识?
不。人们需要具备足够的理解力才能发现输出结果的错误或不完整之处。改变的是知识的运用方式:减少生产,增加评估。
如何评价人工智能辅助工作中人类的判断力?
给学习者提供包含正确、不完整和误导性结果的真实案例,并对他们接受、纠正或升级处理的理由进行评分。然后在适当的延迟后,观察他们在监督下完成的实际任务。
从哪儿开始
选择贵公司目前借助人工智能完成的一项任务。请填写上方表格,并注明负责该任务的人员姓名,并指出错误输出可能造成最大危害的三个方面。围绕其中一项,构建您的第一个实践案例。
要了解自主学习检查、互动案例练习和现场汇报如何结合起来完成这项任务,请探索 AhaSlides。








