适用场景:自动生成不等于自动执行
例如销售表单里写着“客户下周前回访”,模型可能把它生成成周一到期的任务,也可能漏掉“客户”这个对象;会议里说“请小林看一下”,系统却把负责人映射成另一个同名成员。任务已经进入系统后,错误会继续触发提醒、邮件或报表,直到人工发现。
因此,AI 自动化办公更适合把“识别、建议、预填”交给模型,把“确认、发送、变更责任人”留给人。永沃云枢建议先把任务字段设计成可审计结构,再连接 AI 模型接口。可以参考语音纪要转工单复核、发送前人工确认和表单抽取样本验收。
先把任务拆成可复核字段
建议至少保留:原始来源、任务标题、任务对象、负责人候选、截止时间原文、标准化截止时间、优先级、置信度、模型版本、人工确认状态。特别是日期和责任人,既要保存结构化值,也要保存模型看到的原句,方便复核时解释“为什么这样填”。
如果使用 AI API 接入或 CCSwitch 配置,应把调用 trace_id、模型名和请求批次写进任务元数据,而不是把完整 prompt 塞进备注。这样开发者 AI 调用、办公流程和后续问题反馈能串到同一条记录上,也方便发现某次模型升级带来的字段偏移。
操作步骤:从一条表单到可确认任务
- 先选一组不含敏感信息的历史表单,整理出人工已确认的标准答案,作为小样本基线。
- 定义字段规则,例如“下周五”要保留原文,标准日期需要注明计算时区;“小王”不能直接映射到账号,必须进入候选状态。
- 让模型只输出结构化结果和证据片段,不允许它直接发邮件、改权限或向外部系统提交。
- 在任务界面显示原文、提取值、置信度和候选项。人工确认后才写入正式负责人、截止时间和优先级。
- 保存确认人、确认时间和修改前后差异。若人工改了模型结果,不要覆盖原始预测。
- 抽样复核失败任务,按字段统计错误类型,再决定是改提示词、改 schema、换模型还是增加人工门槛。
常见问题 / 避坑
不要只用一个总置信度判断任务是否能自动执行。负责人识别很准,不代表截止时间也准;字段要分开设阈值。不要把空值自动补成默认负责人或默认日期,这会把“不知道”伪装成确定结果。也不要让 Codex 接入或办公自动化脚本直接覆盖源表单,源数据必须只读保存。
另一个坑是把人工复核做成一句“请确认”。真正有效的复核需要显示差异和来源:原文哪一段触发了字段、模型用了哪个版本、是否经过 CCSwitch 路由、确认后会执行什么动作。否则人只是机械点击,出了问题仍然无法追溯。
检查清单
- 原始表单、邮件或纪要有不可变的来源记录。
- 负责人、截止时间、优先级等高风险字段分别设定阈值。
- 模型输出和人工修改结果分开保存。
- 写入正式任务前必须有确认人、时间和状态。
- AI API 调用的模型、批次和 trace_id 可回查,但日志已脱敏。
- 延伸阅读:附件接收核验、置信度升级规则、AI 自动化办公专题、AI API 接入专题。
验收标准:人工知道自己在确认什么
一次合格的任务化流程,应让复核人看到来源、预测、风险字段和将要发生的动作。随机抽一条已确认任务,能反查原文和调用日志;随机抽一条低置信度任务,能看到它没有被自动写入;随机抽一条人工改动,能看到模型原值和最终值。只有这些证据都在,AI 自动化办公才不会变成无人负责的黑盒。
补充验证:把异常样本单独过一遍
除了正常样本,还要准备三类异常样本:空字段样本、模糊时间样本和同名责任人样本。空字段样本用来确认系统不会瞎补默认值;模糊时间样本用来确认系统会保留原文并要求人工确认;同名责任人样本用来确认候选列表而不是自动定人。只要这三类样本中的任何一类直接进入执行状态,就说明任务化链路还不安全。
如果系统后面还接着邮件、IM 通知或 CRM 更新,这一层异常样本更要谨慎。AI 自动化办公的关键不是多省几步,而是每一步都知道是谁确认、为什么确认、确认后会发生什么。把这些信息固定下来,后面再接 AI API 接入、CCSwitch 配置或 Codex 接入时,流程就不会因为模型升级而失真。
对于有审批习惯的团队,还可以再加一层“已执行后回看”。也就是隔一天回头抽查,看看人工确认过的任务有没有被下游系统二次修改,或者有没有因为同步失败而丢了状态。这个动作不费多少时间,但能很好地暴露任务系统之间的接口问题。
FAQ:什么时候可以取消人工复核?只有当字段错误成本低、回滚简单、样本长期稳定且有人持续抽查时,才考虑缩小复核范围。对于外发邮件、权限变更、财务金额和客户承诺,保留人工确认通常更合理。AI 模型接口能提高处理速度,但最终责任边界仍要落在清晰的流程上。