企业AI培训最常见的做法,是给所有人一套“AI素养”。培训后,员工会写Prompt,也知道几个常用工具。进入真实工作以后,差距很快拉开:有人把AI嵌入流程,有人能发现AI错误,还有少数人开始定义团队使用规则。AI能力需要分层看。

L1:工具使用者

能够用AI完成具体任务。写草稿、查资料、生成代码、整理会议。这层能力容易通过培训获得,也是采用的基础。

L2:流程嵌入者

AI不再是偶尔打开的工具,而是稳定进入日常工作流。成员知道在哪一步使用最有效,也知道怎样准备Context。这层开始产生持续生产率。

L3:质量判断者

能识别AI错误、边界和风险。不会因为输出表达专业就直接接受,能够设计验证,并在复杂场景里知道什么时候应该人工介入。这层能力是很多组织的真正瓶颈。

L4:规则定义者

能够把个人经验变成团队能力。参与制定AI Working Agreement、Evaluation、数据边界和工作模式,能够指导其他成员。一个团队有几位L4成员,往往能显著提高扩散速度。

不同岗位目标层级不同

测试岗位可能重点做到L2或L3。架构师、关键业务Owner和AI平台负责人需要更高的判断和规则能力。没有必要让所有员工达到同一层级。

L3和L4不能只靠课堂训练

这两层需要真实案例、错误、反馈和复盘。组织可以让高阶人才参与复杂项目、Evaluation设计和事故复盘。AI能力盘点最终不应该只回答“多少人会用”。

能力盘点要进入真实场景

不要问员工“你会不会用AI”。可以给一个真实工作任务,观察他如何准备Context、验证输出、处理错误和解释决定。行为证据比自评更可靠。对于L3/L4人才,还可以看他们是否能帮助别人形成稳定做法。AI能力最终应该体现在工作质量,工具知识测试只能提供很有限的证据。

培训资源也应该按层级重新分配

L1工具培训可以标准化、规模化,成本较低。L3/L4则需要小班实践、专家辅导和真实项目。如果企业把大部分预算都投在全员基础培训,组织会很快出现“大家都学过,但关键场景没人敢负责”的情况。能力投资需要向真正稀缺的判断和规则设计倾斜。

更重要的是:关键工作流里有没有人能够判断、验证和定义规则。当AI进入生产,这些人会成为最稀缺的能力节点。

四层能力对应四种不同证据

L1可以通过真实任务完成情况验证:成员能否在允许的工具和数据边界内获得可用结果。L2需要观察一段时间的工作流:AI是否稳定进入流程,输入、输出和交接是否清楚。L3要通过边界案例与人工推翻检验:成员能否发现貌似合理的错误,并说明判断依据。L4则要看团队结果:规则是否被他人采用,质量是否更一致,异常是否更早暴露。

如果企业只用一场知识测验或Prompt比赛评估所有层级,就会奖励表达能力,漏掉真正的生产判断。能力证据应尽量来自真实工作、可复盘的决定和重复结果。等级也不应成为身份标签,它描述的是某人在特定领域、特定任务上的当前能力。

L3的核心是建立可解释的判断链

判断者不能只说“我觉得AI不对”。他需要指出任务目标、关键Context、输出证据、风险边界和验证结果,说明为什么接受、修改或拒绝。这样的判断链既保护业务,也能被团队学习。

组织可以收集高价值的Human Override:AI建议了什么,人为什么改变,最后结果怎样。周期性聚类后,一部分判断可以进入评估集、规则或工具,一部分仍保留给专家。L3能力由此不再只是个人直觉,而成为提升系统质量的输入。

L4承担的是规则的生命周期

定义AI Working Agreement只是开始。规则需要说明适用场景、最低证据、允许的数据、审批阈值、Owner和复核日期。模型能力、业务政策或风险发生变化后,L4成员要能够调整甚至删除旧规则。

L4也不能成为中央审批者。其价值在于把领域经验编码为可重复使用的标准,并培养更多L3,使低风险决定能够在团队内完成。若所有问题仍排队等少数L4签字,能力分层会制造新的组织瓶颈。

能力建设要与工作机会绑定

课堂可以建立共同语言,真正的进阶需要真实责任。L1到L2可以通过重构一个低风险流程;L2到L3需要参与评估、故障复盘和边界案例;L3到L4需要主持规则设计、指导同伴并对团队质量负责。每一级都应有导师、实践任务和可观察结果。

管理者还要保护学习阶梯。若AI接管了所有基础任务,新人会失去形成领域直觉的机会。可以保留诊断、Review、解释和对比练习,让成员看见AI如何出错,并逐步承担更复杂的判断。能力投资与工作架构必须一起设计。

同一个客服岗位的四层差异

L1成员能用AI整理客户事实并形成回复草稿,同时遵守数据规则;L2成员把AI稳定嵌入受理、查证、回复和记录流程,知道何时补Context;L3成员能识别AI忽略授权边界、错误归因或过度承诺,并留下判断依据;L4成员把高频错误转成评估案例、升级阈值和团队Working Agreement,并指导其他人。

四个人可能使用同一工具,组织价值却完全不同。若企业只统计调用量,会看不见判断与规则的稀缺;若要求所有人都达到L4,又会浪费资源并制造虚假认证。关键工作流必须保证足够的L3/L4覆盖,普通低风险任务则以L1/L2为主。

用能力热力图检查系统风险

可以在价值流上标出每个判断节点需要的层级、当前人数、替代者和证据日期。某个节点只有一位L4,即使表现出色,也构成单点;多个L1都能完成任务,却没有人维护评估和规则,说明团队采用广但生产能力薄弱。

热力图应连接Workforce Planning:哪些能力通过导师和实践培养,哪些需要招聘或借用,哪些判断应被平台化,哪些基础任务要保留为新人学习机会。季度复核时关注节点风险是否下降,而非平均培训分数是否上升。

分层不能演变为新的等级身份

AI能力具有领域性和时效性。某人在一个场景达到L4,换到陌生业务可能只是L1或L2;模型和规则变化后,过去证据也需要更新。等级应服务责任配置和发展,不应用作笼统的人才优劣标签。员工要能知道如何通过真实任务获得更高层证据,也能在不需要L4的岗位上取得专业成长。

为四层能力设计不同学习路径

L1适合短周期工具训练、数据与安全底线和真实小任务;L2适合由导师带领重构一个重复流程,连续观察质量和交接;L3需要参与边界案例、故障复盘、Evaluation和Human Override校准;L4需要主持工作协议、把判断编码进系统并培养替代者。学习路径越接近真实责任,能力证据越可信。

培训资源也应按稀缺度倾斜。大规模基础课程可以标准化,L3/L4需要领域专家、受控项目和反馈时间,成本更高却直接影响生产可信度。若所有预算都投向L1,组织会出现工具使用活跃、关键工作流无人敢负责的结构性缺口。

管理者如何看能力增长

个人层看能否处理更复杂情境并解释判断;团队层看重复错误是否下降、规则是否被采用、关键节点是否有替代者;组织层看业务是否能在护栏内自主推进,中央专家队列是否缩短。能力增长不应只体现为更多人升到高等级,也要体现为系统减少了对少数人的依赖。

当某个判断被稳定编码为自动验证,原L3成员可以转向新的边界;这说明能力正在发挥杠杆,而非简单被技术替代。高阶人才的价值在于持续把成熟判断交给系统,再处理尚未结构化的问题。

能力分层还应连接风险分层。低影响任务缺少L3覆盖时,可以通过抽样和快速反馈学习;高影响任务若没有领域Judge和明确L4规则,就不应扩大自主程度。这样,人才成熟度成为工作流权限的输入,组织不会在能力尚未形成时仅凭模型表现提高自动化。

从观点到管理动作

层级 关键责任 最合适的能力证据
L1 工具使用 在边界内完成具体任务 真实任务产出与合规使用
L2 流程嵌入 让AI稳定进入工作链 周期、交接、质量和重复性
L3 质量判断 接受、修改或拒绝AI输出 边界案例、判断链与Override
L4 规则定义 把经验变成团队机制 规则采用、质量提升和人才扩散

分层的意义在于把“会用AI”拆成不同责任。企业可以更准确地配置培训,更早发现关键场景缺少判断者,也能让高阶人才看到清楚的发展路径。最终成熟度体现在团队能否稳定做出更好的决定,而非拥有多少证书。

延伸依据:OECD:Skills in the AI AgeILO:生成式AI与工作任务NIST AI RMF Core