AI 开始接手工作,谁来验收?
助手能打开网页、修改文件之后,一句“完成了”需要有可以检查的结果。
假设你让助手比较三家供应商,准备一份下周开会用的材料。它搜索网页、整理报价、写好文档,然后告诉你:完成了。
打开文档,事情才刚刚变得具体。三家的报价是否对应同一个套餐?其中一家是否已经更新了价格?链接能不能打开?文档放进团队空间后,谁可以看见?原来已有的笔记还在不在?
个人智能体把这些问题带到了日常使用中。据 AP 报道,Meta 于 9 月 8 日推出 Muse,初期面向美国成年用户,尝试协助处理日程、购物等事务。[1] 用户交给它的工作开始包含实际操作,结果也会留在聊天框之外。
文档在哪里,比回复写得漂亮更重要
Anthropic 的智能体评估指南将执行记录与最终结果分开:前者记录系统做过什么,后者检查环境实际发生了什么变化。评估对象也包括模型周围的工具和运行系统。[2]
这给供应商比较任务提供了一个清楚的验收办法。助手说创建了文档,就打开那份文档;它说某个套餐支持一项功能,就沿着引用找到对应版本的说明。价格后面有使用条件,比较表里也应当保留。
不同工作需要不同程度的检查。内部讨论提纲可以留出修改空间,发给客户的合同则需要逐项核对。两类工作都套上同一套审批,会让简单任务变慢,也可能漏掉复杂任务的关键细节。
把人留在需要判断的地方
用户说“做一个可以讨论的版本”,通常期待助手自己整理维度、补齐资料、安排版式。如果每搜索一个网页都来问一次,省下的鼠标操作就变成了新的确认工作。
但采购承诺和草稿之间还有距离。整理候选供应商,可以交给助手;是否向其中一家下单,需要另有授权。修改副本与删除唯一原件,也应当分别处理。
产品可以让搜索和草稿编辑连续进行,在提交正式结果、扩大分享范围或作出对外承诺时,显示具体对象和内容。用户已经明确授权的动作就继续执行;目标、对象或后果发生实质变化,再请人判断。确认框的价值,来自它能让人看清接下来会发生什么。
中断后,还能从哪里接着做
长任务经常有很多中间成果。资料查到一半,网页打不开了;正文写好了,保存时失败了。若系统只能从头再来,等待和计算都会重复。若它没查清先前是否保存成功就再次写入,还可能留下两份文档。
Anthropic 在长时运行智能体的工程文章中,介绍了分段推进、记录进度和为下一轮保留工作状态的做法。[3] 这份经验的实用之处,是把恢复能力落在具体记录上。
一条“完成 80%”的进度提示,对接手工作帮助不大。记录“前两家报价已核实,第三家套餐有冲突,比较稿保存在这里,下一步查官方说明”,就能让后续执行有据可依。已经确认的资料不必重查,尚未解决的冲突也不会被误当成结论。
便宜的调用,未必是便宜的工作
模型单次调用的价格容易比较,完整任务的账要复杂一些。检索、重试、人工检查和修订,都会进入成本。
用一组假设数字算算:两套系统各处理一百件任务,最终达到相同质量。甲花了五十元机器费用,需要人工检查和修复二百四十分钟;乙花二百元,人工只用六十分钟。若暂按每分钟一元计算人的时间,甲总计二百九十元,乙为二百六十元。
人工时间的计价变了,选择也可能改变。如果修订本身有学习价值,或者这批任务并不急,人愿意投入的时间就不同。比较时还要保持交付标准一致,否则少检查几遍也能让账面很好看。
机器运行三十分钟,也不能直接记成节省三十分钟。等待期间,人可能在做其他工作;审阅和纠错则会持续占用注意力。把机器费用、人的投入和未通过验收的任务分开记录,才知道钱与时间花在了哪里。
谁接下了自动化留下的工作
智能体可能减少执行工作,却增加审阅工作。原来分散在各人手里的问题,也可能集中到少数维护者身上:检查失败原因、修正工具接口、处理重复写入。
对一位使用者来说,工作确实轻松了;对整个团队来说,还需要把这些维护时间算进去。注册量和使用时长能说明人们愿意尝试,稳定交付、返工和维护记录则更接近组织真正得到的收益。
开放式工作又有所不同。头脑风暴和创意讨论可以出现多种答案,研究也需要探索未知。此时可检查的是材料、推理依据和过程记录,不必预先规定唯一结果。
智能体能否得到更多工作,最终会在一次次使用中体现出来:普通任务能不能重复完成,失败以后能不能接上,交付物是否需要人重新做一遍。供应商比较结束后,桌上应该留下一份可供讨论的文档,以及清楚标出的那几个待确认问题。
