企业讨论AI工作设计时,经常只有两个问题:这项工作人做,还是AI做。现实更复杂。同一个流程里,AI可能只负责信息准备,也可能承担主要执行;人的角色有时是主导,有时是审核,有时只在例外时介入。把人机分工拆成四种工作模式,可以帮助管理者更具体地设计边界。
Human-led:高歧义、高风险、关系密集
这类工作由人主导,AI提供辅助。典型场景包括重大组织决定、复杂客户谈判、涉及伦理和价值判断的事项,以及失败后果难以逆转的决策。AI可以提供数据、情景分析和备选方案,但人必须掌握问题定义和最终责任。
AI-assisted:最常见的人机协作方式
AI承担搜索、分析、生成和整理,人负责定义问题、筛选结果和做决定。大多数知识工作目前都处在这一层。关键不在“有没有用AI”,而在是否改变了工作方式。一个工程师用AI补全代码属于辅助;如果需求拆解、方案比较和测试设计都围绕AI重新组织,已经开始进入流程重构。
AI-led + Human Review:AI主做,人负责质量门
当任务标准比较明确、输出容易验证时,可以让AI承担大部分执行。例如生成标准报告、整理固定格式材料、完成某类测试或代码转换。人的价值集中在设定标准、审核异常和最终批准。这种模式最容易出现新的瓶颈:生成速度提高以后,人工Review量可能迅速增加。因此,验证能力必须和生成能力一起设计。
Agent-operated:稳定流程由数字执行能力持续运行
边界清楚、规则稳定、可以监控的工作,可以进一步交给Agent连续执行。这时管理者需要关心权限、数据、日志、异常和升级条件。Agent可以自动跑流程,不意味着流程“无人负责”。最终Accountable Owner仍然需要由组织明确。
四种模式不是成熟度等级
并不是Agent-operated一定比Human-led先进。高风险决策即使技术能力不断提高,也可能长期需要人主导;低风险、标准化任务则可以很快自动化。选择依据应该是价值、歧义、可验证性和风险,而不是自动化比例。 这一步需要人判断吗?AI可以提供什么?输出怎样验证?什么情况下必须交回给人?谁承担最终结果?这些问题回答清楚以后,AI才从一个工具变成工作设计的一部分。
一个高级工程师可能自己主导架构决策,用AI辅助分析,让AI主导生成测试,再让Agent持续运行某些监控。因此,企业不应该按岗位一次性定义“AI替代比例”。更实用的是按Workflow逐段设计,并允许边界随着模型能力和风险经验变化。
这也提醒绩效管理:评价对象不再只是个人执行量,还包括是否设计出更好的分工和验证机制。 同一种工作模式,在不同业务环境下要求不同。内部草稿即使由AI主导,风险通常有限;面向客户、财务或监管场景,即使任务结构化,也需要更严格的Review与日志。因此,人机分工最好和风险分级放在一起设计。不要让“AI-led”自动等于“低风险”,也不要因为某个场景高风险就完全禁止AI辅助。
组织真正要做的是匹配:效率、风险和责任三者同时成立。企业追求的也不该是“让AI做最多”。更合理的目标,是让人和AI分别承担最适合自己的部分,并让责任始终清楚。
选择模式时,需要同时看四个变量
四种模式的边界可以用一张判断表初步确定:
| 变量 | 越高时意味着什么 |
|---|---|
| 任务歧义 | 更需要人定义问题和解释情境 |
| 错误代价 | 更需要人工批准、双重验证和可追溯记录 |
| 可验证性 | 越容易自动核验,越适合AI主做 |
| 环境稳定性 | 规则和输入越稳定,越适合持续Agent运行 |
例如,合同摘要可能规则清楚、容易抽样验证,适合AI-led;合同条款的最终商业取舍涉及谈判情境和重大责任,更接近Human-led。二者发生在同一流程,却需要不同控制强度。这个判断也不是永久标签。模型、数据、流程和外部环境改变以后,模式需要重新评估。
每次提高自主性,都要补齐控制面
从AI-assisted走向AI-led,变化的不只是执行比例。组织必须同步回答:允许调用哪些数据和工具,输出用什么测试,谁可以批准上线,日志保存多久,发生异常怎样停止。
从AI-led走向Agent-operated,还要增加运行时控制:权限最小化、预算或频率限制、状态监控、人工接管、版本回滚和事故复盘。Agent越能跨系统行动,错误就越可能从“生成了一段坏内容”升级为“执行了一串坏动作”。
NIST的生成式AI风险管理框架把Govern、Map、Measure、Manage作为连续活动。映射到工作设计中,就是先明确责任与场景,再评估风险和表现,最后决定自动化边界;运行以后继续测量,而非一次审批后永久放行。
需要设计升档,也需要设计降档
企业往往只设计“如何提高自动化”,很少定义“何时退回更多人工参与”。健康的人机系统应预先设定降档信号,例如:输入分布明显变化、人工接管率上升、客户投诉集中出现、关键测试覆盖下降、供应商模型更新,或发生新的合规要求。降档本身属于风险控制。团队若把退回人工视为项目倒退,就可能长期掩盖系统已经超出适用边界的事实。
衡量模式效果,要看业务和人的双重结果
只看模型准确率或节省工时,无法判断工作设计是否健康。至少还要观察:
- 端到端周期和等待是否下降;
- 错误是否更早被发现,重大异常有没有遗漏;
- 人工接管发生在哪些环节,是否集中在同类情境;
- 员工是否获得更高价值工作,还是变成持续清理AI输出;
- 最终Owner能否解释关键结果是怎样形成的。
如果自动化比例提高,却让责任更模糊、员工技能退化或下游负担增加,工作模式就需要重做。 它们最大的价值,并非给每项工作贴标签,而是让业务、技术、风险和HR可以在同一张桌上讨论。业务说明价值和现场情境,技术说明能力与限制,风险团队定义控制要求,管理者负责人才和责任。当这些角色能够共同回答“AI做到哪一步、人在何处介入、谁对结果负责”,AI才真正进入Operating Model,而非停留在工具采购。
用一条客户流程检验四种模式
以企业客户续约为例,团队可以由AI-assisted开始:AI整理使用数据、合同和历史沟通,客户经理核验并形成判断。标准化健康检查可以进入AI-led,由系统生成报告、运行规则,人只处理低置信度和高风险项。到期提醒和内部任务创建若边界稳定,可以由Agent-operated持续运行。续约策略、价格取舍和困难客户沟通仍由人主导。
同一流程采用多种模式,避免了两种极端:把整个岗位宣布为“AI化”,或因为最后一步需要人而保留全部旧工作。它也让控制更精准——不同步骤拥有不同权限、验证和责任。
试运行时,应从低风险、可逆、结果可验证的一段开始。先建立人工处理基线,再记录AI介入后的总周期、一次通过率、人工接管、客户影响和异常。若人工接管集中在同类情境,就需要缩小边界或补充Context;若生成变快但最终周期不变,应寻找新的下游瓶颈。
Human Gate必须具备真实能力和权力
“有人审核”经常只是形式控制。审核者可能没有时间看完整证据,不理解模型限制,也没有权力拒绝业务压力下的自动结果。这样的Human-in-the-loop只是把责任名义上交给人。
有效Gate至少满足四个条件:能看到来源和关键Context;理解系统的适用边界;拥有足够时间和专业能力;可以推翻、暂停或回滚。欧盟《AI法案》对高风险系统的人类监督要求也强调,监督人员需要具备能力、培训和授权,能够理解限制、避免自动化偏差并在必要时干预或停止系统。法规适用范围有其边界,但这一设计原则对企业工作流具有普遍价值。
从观点到管理动作
| 设计问题 | 需要形成的产物 |
|---|---|
| 这一步为什么适合当前模式 | 价值、歧义、可验证性、风险四维判断 |
| AI获得什么能力 | 数据、工具、动作、额度与明确禁区 |
| 结果如何被验证 | 自动测试、抽样、同行Review或正式批准 |
| 何时交回给人 | 置信度、异常类型、业务阈值和外部变化 |
| 谁承担结果 | Business Owner、Technical Owner、Escalation Owner |
| 如何持续调整 | 指标、复核频率、升档与降档条件 |
管理团队可以每季度选一条高价值工作流复核模式,无需对所有岗位做一次性分类。真正成熟的标志,是每次提高自主性都有相应控制,每次边界失效都能安全退回,员工也清楚自己为何介入、拥有什么决定权。
模式选择还会影响员工体验。长期处于末端审核的人容易失去完整问题感,持续处理异常的人则可能承担最高认知负荷,却在岗位和绩效中不可见。工作设计需要定期检查人的任务是否仍具完整性、学习与决定权,避免效率改善建立在更碎片化的工作之上。
延伸依据:NIST AI Risk Management Framework、NIST Generative AI Profile、欧盟《AI法案》第14条:Human Oversight