先把事情做通,再给 AI 出题
研究回看|模型需要练习怎样调用工具。练习题从哪里来,会影响它最后学会什么。
假设你要教一位新同事整理订单。最省事的教材,是拿一笔已经完成的订单,把查询库存、确认数量、生成清单的过程写下来,再配上客户最初的要求。新人可以沿着记录走一遍,也容易知道自己在哪一步做错。
给 AI 准备工具使用数据,也有类似的选择:先编一句用户要求,让系统寻找答案;或者先构建一条能够执行的路径,再为它补上合理的提问。前者从需求出发,后者从已知的操作出发。
Google Research 九月十日介绍的 ToolGrad 选择了后者。系统先逐步构造工具调用链,依据执行反馈挑选下一步,再生成与这条路径相符的用户请求。它把出题和解题的顺序调了过来。[1]
论文初稿发表于 2025 年八月,当前第三版修订于 2026 年六月,并标注为 ACL 2026 Findings。九月的介绍让这项方法重新进入视野,研究本身已有更早的积累。[2]
一句简单要求,可能没有可用答案
“帮我找一家明天能送货的供应商。”读起来很自然,但工具库里可能只有公司介绍,没有库存和配送日期。出题者若不知道这些缺口,便会造出一道现有系统做不了的题。
如果先拿现有查询接口确认能返回什么,再形成相应请求,训练材料就更容易完整。比如接口确实能查询某种零件的库存、取得指定仓库的地址,那么题目便可以围绕这些信息展开,不必让标注程序反复寻找根本不存在的配送承诺。
这样做节省的,是为了找到可用训练答案而进行的探索。但一条路径越容易成功,也越可能绕开麻烦:需要澄清的需求、信息缺失、系统故障,都不如顺畅完成的样本容易整理。
出题便同时承担了另一项工作:决定模型会反复遇见哪些世界。有充足信息、有合适工具、每次返回都正常的世界,适合教会基本动作;面对日常工作,还得补上另一半材料。
成功答案可以成为教材,不能包办考试
假设一套题库全是完整订单:客户编号唯一,商品名称规范,库存充足。模型学会把订单送进正确接口,表现可能很好。换成“和上次一样,再加两个”,问题就变了。它需要找到上次是哪笔订单,判断“两个”指哪项商品,还要确认当前库存。
这些难点来自人的表达和系统中的上下文。字段全部填对,仍可能理解错了订单。
如果训练和考试都由同一种出题流程产生,模型可能熟悉了出题者的措辞,却没有获得同样广泛的任务能力。把同一订单换个公司名、改个数量,并没有改变其中的推理结构。题目看上去多了,实际训练的仍是同一种动作。
因此,一套有用的课程可以先用成功路径教基本功,再用独立收集的需求检查遗漏。两部分不必争夺同一个位置:前者降低准备成本,后者告诉团队便宜的教材有没有把重要困难省掉。
小模型的机会,在任务是否讲得清楚
ToolGrad 团队用生成的数据对不同大小的 Gemma 3 模型进行后训练,在其工具调用实验中报告了改进。[1] 这给小模型提供了一条值得关注的路线:用针对性很强的练习,改善一个明确能力。
对业务团队而言,接下来可以问得更具体。日常请求是否集中在少数操作?正确结果能否被程序检查?工具变化快不快?如果任务边界稳定,训练数据里的每一个好例子都可能反复发挥作用。
反过来,一套流程每周更换接口,客户表达又十分开放,维护教材可能比最初生成教材更费时间。昨天正确的字段,今天已被替换;过去一步能完成的操作,现在分成了查询和确认。模型会不会写出曾经有效的答案,也要进入评估。
把这项研究放回产品开发,最值得借鉴的部分是可检查的过程:先找出任务实际依赖哪些信息和动作,让每一步有明确结果,再决定哪些经验适合教给模型。只有一句顺畅的最终回复,很难承担这份教材的工作。
上一期讨论了机器人如何从示范学习。这一期把镜头移回屏幕:数字助手的示范也需要有人编排,而教材中那些没写出来的情况,常常会在上线后找上门。
[1] ToolGrad: Efficient tool-use dataset generation with textual gradients · 2026-09-10 · 研究团队介绍/近期研究回看
[2] ToolGrad 论文 v3 · 2025-08-06初稿;2026-06-17 v3 · ACL 2026 Findings论文/背景
