Veyria
AI & TECHNOLOGY本期目录往期刊物
第 001 期封面:银色外套人物触碰蓝色界面上的检查节点,AI 创作。
Veyria
人工智能与科技杂志2026.09.09 · NO.001 · 试刊
THE AGE OF AGENTS / 封面故事

AI 开始接手工作,
谁来验收?

搜索、整理、修改之后,
留下一份能用的结果。

封面为 AI 创作,人物与场景均为虚构。

LETTER FROM THE EDITOR

工作交出去了,
结果留下来了吗?

责任编辑 / Veyria

一次供应商比较、一份会议清单、一项机器人任务:本期从这些具体工作出发,看 AI 怎样处理资料、完成操作,以及人在其中还要做什么。

封面故事讨论智能体交付;技术拆解解释上下文;实战手记给出会议清单的整理方法。科学预测、语音和视频进展收在 AI 前线。

资料截至 2026 年 9 月 9 日 · 刊期使用 UTC · 可按兴趣选读

COVER STORY

AI 开始接手工作,谁来验收?

助手能打开网页、修改文件之后,一句“完成了”需要有可以检查的结果。

假设你让助手比较三家供应商,准备一份下周开会用的材料。它搜索网页、整理报价、写好文档,然后告诉你:完成了。

打开文档,事情才刚刚变得具体。三家的报价是否对应同一个套餐?其中一家是否已经更新了价格?链接能不能打开?文档放进团队空间后,谁可以看见?原来已有的笔记还在不在?

个人智能体把这些问题带到了日常使用中。据 AP 报道,Meta 于 9 月 8 日推出 Muse,初期面向美国成年用户,尝试协助处理日程、购物等事务。[1] 用户交给它的工作开始包含实际操作,结果也会留在聊天框之外。

文档在哪里,比回复写得漂亮更重要

Anthropic 的智能体评估指南将执行记录与最终结果分开:前者记录系统做过什么,后者检查环境实际发生了什么变化。评估对象也包括模型周围的工具和运行系统。[2]

这给供应商比较任务提供了一个清楚的验收办法。助手说创建了文档,就打开那份文档;它说某个套餐支持一项功能,就沿着引用找到对应版本的说明。价格后面有使用条件,比较表里也应当保留。

不同工作需要不同程度的检查。内部讨论提纲可以留出修改空间,发给客户的合同则需要逐项核对。两类工作都套上同一套审批,会让简单任务变慢,也可能漏掉复杂任务的关键细节。

把人留在需要判断的地方

用户说“做一个可以讨论的版本”,通常期待助手自己整理维度、补齐资料、安排版式。如果每搜索一个网页都来问一次,省下的鼠标操作就变成了新的确认工作。

但采购承诺和草稿之间还有距离。整理候选供应商,可以交给助手;是否向其中一家下单,需要另有授权。修改副本与删除唯一原件,也应当分别处理。

产品可以让搜索和草稿编辑连续进行,在提交正式结果、扩大分享范围或作出对外承诺时,显示具体对象和内容。用户已经明确授权的动作就继续执行;目标、对象或后果发生实质变化,再请人判断。确认框的价值,来自它能让人看清接下来会发生什么。

中断后,还能从哪里接着做

长任务经常有很多中间成果。资料查到一半,网页打不开了;正文写好了,保存时失败了。若系统只能从头再来,等待和计算都会重复。若它没查清先前是否保存成功就再次写入,还可能留下两份文档。

Anthropic 在长时运行智能体的工程文章中,介绍了分段推进、记录进度和为下一轮保留工作状态的做法。[3] 这份经验的实用之处,是把恢复能力落在具体记录上。

一条“完成 80%”的进度提示,对接手工作帮助不大。记录“前两家报价已核实,第三家套餐有冲突,比较稿保存在这里,下一步查官方说明”,就能让后续执行有据可依。已经确认的资料不必重查,尚未解决的冲突也不会被误当成结论。

便宜的调用,未必是便宜的工作

模型单次调用的价格容易比较,完整任务的账要复杂一些。检索、重试、人工检查和修订,都会进入成本。

用一组假设数字算算:两套系统各处理一百件任务,最终达到相同质量。甲花了五十元机器费用,需要人工检查和修复二百四十分钟;乙花二百元,人工只用六十分钟。若暂按每分钟一元计算人的时间,甲总计二百九十元,乙为二百六十元。

人工时间的计价变了,选择也可能改变。如果修订本身有学习价值,或者这批任务并不急,人愿意投入的时间就不同。比较时还要保持交付标准一致,否则少检查几遍也能让账面很好看。

机器运行三十分钟,也不能直接记成节省三十分钟。等待期间,人可能在做其他工作;审阅和纠错则会持续占用注意力。把机器费用、人的投入和未通过验收的任务分开记录,才知道钱与时间花在了哪里。

谁接下了自动化留下的工作

智能体可能减少执行工作,却增加审阅工作。原来分散在各人手里的问题,也可能集中到少数维护者身上:检查失败原因、修正工具接口、处理重复写入。

对一位使用者来说,工作确实轻松了;对整个团队来说,还需要把这些维护时间算进去。注册量和使用时长能说明人们愿意尝试,稳定交付、返工和维护记录则更接近组织真正得到的收益。

开放式工作又有所不同。头脑风暴和创意讨论可以出现多种答案,研究也需要探索未知。此时可检查的是材料、推理依据和过程记录,不必预先规定唯一结果。

智能体能否得到更多工作,最终会在一次次使用中体现出来:普通任务能不能重复完成,失败以后能不能接上,交付物是否需要人重新做一遍。供应商比较结束后,桌上应该留下一份可供讨论的文档,以及清楚标出的那几个待确认问题。

AI FRONTIER

从科学预测到创作工具

两项九月研究进展,以及语音、视频、模型部署的近期回看。

09.08 · AlphaGenome Atlas:先筛选,再做实验

Google DeepMind 发布 AlphaGenome Atlas,提供约 90 亿种人类 DNA 单碱基变异的分子效应预测,并用 AVI 评分排列变异影响。[8] 这些结果来自模型预测,后续生物实验仍要逐项回答机制和效应问题。

预先计算的数据库改变了使用入口。研究者可以直接筛选、比较大量候选,从中挑出值得投入实验资源的部分,少做一轮轮单独调用。它提供的是更广的查找范围,临床应用还需要相应的验证。

09.03 · WeatherNext 3:追赶正在变化的天气

WeatherNext 3 预印本介绍了利用低延迟卫星观测、每小时生成新预报的路线,并提高时空分辨率。[9] 官方规格分别列出站点、地表网格和高空层,也区分完整预报周期与中间逐小时运行的时长。[10]

对调度工作而言,更新得早一点可能影响安排:航班何时调整,施工是否暂停,太阳能发电量预计下降多少。不同地区和极端事件中的表现,需要继续看独立评估;这篇论文目前仍是预印本。

08.13 · Gemini 3.7 Flash:高频任务的成本

Google 发布时将 Gemini 3.7 Flash 定位为面向编码与智能体的主力模型,强调相对 3.6 Flash 的能力改进,并提供介绍期价格。[4] 这里回看的是八月发布内容,价格须以使用时的报价为准。

摘要、字段提取和代码修改的难度不同,团队可以尝试分配给不同模型。路由也有成本:困难任务被误交给较弱模型,可能要重做;简单任务频繁升级,则会增加费用。比较组合方案时,把这些调用一起记入任务账单。

08.26 · Gemini 3.5 Transcribe:逐字稿和整理稿

Google 为实时语音转文字推出 Gemini 3.5 Transcribe,公告强调噪声、专业词汇和语句整理能力。[5] 中文口音、行业词和多人混说,仍需要各自场景的音频样本。

口述文章时,删掉重复会让文字好读。会议里的一句“如果测试通过”,却不能随着停顿一起被清掉。保留逐字稿、整理稿及音频时间位置,能让人既快速阅读,也能回查一句话原来是怎么说的。

08.27 · Gemini Omni 1.1 Flash:修改一段视频

开发者公告介绍了场景延展、首尾帧控制、快速预览和 4K 放大。[6] 放大输出描述的是输出分辨率,不能据此推定原始生成细节。

制作连续镜头时,人物与动作是否接得上、局部修改会不会破坏已有画面,都关系到返工。首尾帧提供了两个参照,中间动作仍可能偏离。拿同一段短镜头连续做几次小修改,比只看一条精选成片更容易了解控制效果。

07.22 · Kimi K3 与 vLLM:权重之外的适配

vLLM 团队的支持预览讨论了 Kimi K3 的混合注意力、前缀缓存和硬件适配。Moonshot 的产品介绍则强调长上下文、多模态与长任务。[7][20] 七月预览记录了当时的工程进度,当前可用路径还需查看对应版本。

下载权重之后,推理引擎还要处理计算核、缓存、并行通信和工具调用解析。这些工作会影响延迟、资源占用和运行稳定性。模型规模相近,也未必能沿用同一套部署配置。

FROM NEWS TO UNDERSTANDING

从模型的新进展,
走进具体的工作。

UNDER THE HOOD

长上下文,怎样用好旧资料?

项目记录越积越多,助手需要知道哪些仍然有效,哪些已经被替换。

一份项目记录里,先写着“按发布日期排序”,后来又改成“按产品类别排序”。两句话都保留下来很容易,到了交付时选对现行规则,才是任务的一部分。

上下文是模型在一次推理中能够使用的信息,包括用户要求、检索结果、工具输出和任务状态。Anthropic 的上下文工程文章将其视为有限资源,讨论了压缩、结构化笔记和按需取用资料。[11]

桌上的材料与柜里的档案

当前上下文像桌上展开的材料,方便即时比较。文件和数据库像档案柜,需要检索才能取来。任务状态则记录已经确认、执行或作废的事项,可能只有几行,却会决定下一步操作。

排序的例子里,状态记录应保留“新要求替代旧要求”。若摘要只剩“用户重视排序”,具体决定就丢了;若两项要求并列有效,后续整理又会冲突。

记录得长,能留下更多细节。记录得清楚,才能让这些细节在合适的时候发挥作用。

搜到同名产品,还得找对套餐

检索增强生成通常简称 RAG:先找到相关资料,再据此回答。但文字相似的材料,适用条件可能不同。

假设资料 A 说导出上限是一千行,资料 B 说是一万行,而 B 讲的是另一个套餐。只按产品名搜索,两份材料都很相关;回答免费版上限时,还要匹配套餐、版本与日期。

因此,标题、实体名称、生效时间和来源都值得保留。几十份文件也可以通过命名和最新版标记减少混淆。更大的向量库能帮助找材料,哪份文件具有权威性,仍要由业务规则说明。

摘要最怕丢掉短短一句限制

“不覆盖原件”“只比较免费版本”可能只有几个字,却比大段背景更直接地约束任务。压缩记录时,应优先保留目标、已确认决定、未解决冲突和产物位置。

例如,一份接续记录可以这样写:

目标:比较三款产品的当前免费版。A、B 的导出限制已核实;C 是否支持批量导出仍待查。比较稿为第二版。下一步查 C 的官方说明,保留原文位置和核查日期。

后来有人想确认“支持导出”从何而来,就能沿记录回到原文。若只留结论,下一轮可能把推断当成事实继续引用。

缓存省下的是重复计算

前缀缓存尝试复用请求前段的计算,减少重复处理。它不会替过期内容作废,也不会自动判断一个偏好适用于哪项任务。具体行为取决于服务和推理引擎。

vLLM 的 Kimi K3 适配记录展示了注意力结构变化带来的缓存实现难点。[7] 模型、软件和硬件需要配合,标称的上下文容量还无法说明高并发延迟,或模型使用早期细节的准确程度。

用一次规则变更检查记忆

测试时,可以准备包含旧方案、新方案、例外和无关材料的文档,请助手指出当前规则与出处。任务中途再修改一个条件,看最终结果是否更新。

也要放入资料没有回答的问题。例如文档从未说明批量导出,输出就应该保留“未说明”。换几个任务、调整材料位置继续观察,才更容易区分偶然答对与稳定处理。

开始一项工作前,先整理一小段当前状态,再按需提供原始文件,往往就能减少很多来回解释:这次做什么,用哪个版本,哪些决定已经改过,最终文件放在哪里。

FIELD NOTES

把会议录音变成可执行清单

一句“可以看看”,怎样才不会被写成已经接下的任务?

“旧版周五发,先别动新版。”过了一会儿,有人补充:“如果测试通过,小林下周一安排发布。”讨论临近结束,时间又改成了下周三。

这段假设对话里,版本、前置条件和日期都影响执行。如果录音没有说清最后改的是哪一项,会议清单就需要留一个待确认问题。

先把原话留住

会议工具可以交付逐字稿、整理稿和行动清单。逐字稿保留原话与时间位置,整理稿便于浏览,行动清单收录明确承诺及待确认事项。读到一条待办时,审阅者应该能回到原话。

“也许下周试一下”仍是建议;“下周上线”已经是承诺。整理时保留条件和否定,比让每一行都显得完整更重要。负责人没确定,就写待确认,不必替团队找个人填上。

用五到十分钟录音试一次

选一段已获准用于测试的录音,包含多人发言、相近姓名、行业术语和中途修改。团队常见的录音环境,比安静的单人口播更能暴露实际问题。

先人工列出几项容易弄错的地方:旧版和新版有没有混淆,“如果测试通过”有没有保留,改期对应的是哪件事。然后让工具生成清单,对照检查。日期仍有歧义,就回听相应片段,不用重听整场会议。

每项任务带一条依据

行动清单可以保留事项、负责人、时间、前置条件和依据五个字段。依据指向录音时点或原文;后续修改则注明替代了哪条信息。

现有转写和文档工具已经可以承载这套记录。跨会议追踪、自动写入任务系统成为日常需求以后,再考虑集成,能避免第一轮试用就花大量时间搭平台。

可复用的整理要求

请依据转写稿提取行动项。明确承诺列为“已确认”;建议、假设和没有负责人的事项列为“待确认”。保留条件、否定和后续修改。每项附原文与时间位置。未提及的信息写“未说明”,先输出审阅稿。

把核对时间也记下来

姓名、数字和术语错误要检查,错误分配负责人、删掉前置条件则应单独记录,因为它们会直接改变后续工作。

转写两分钟、核对二十分钟,仍可能方便归档,却未必省下整理时间。相反,一份有少量文字错误、但能准确定位关键决策的稿件,也可能很好用。是否采用,取决于它帮人省掉了哪一段工作。

接入任务系统之后

当清单足够稳定,可以尝试写入任务系统。先在测试空间重跑同一场会议,检查是否重复创建;再修改日期,看它更新旧任务还是新增一条。

失败重试前也要检查已有结果。写入已经成功、反馈却丢失时,再执行一遍就可能留下重复待办。最后交给团队的清单,应能找到依据、看清当前状态,并顺手修正那几项仍有歧义的内容。

TECH HORIZON

机器人理解了指令,然后呢?

“把杯子收起来”只有几个字,完成它却需要持续观察和动作控制。

桌上有两只相似的杯子,其中一只还有水。人说“把杯子收起来”时,可能同时指了指其中一个,也可能刚在上一句提到它。机器人需要把语言、视线和空间里的对象对上。

Google DeepMind 的产品说明将全身智能、灵巧操作与多机器人协作列为 Gemini Robotics 2 的能力方向,并列出面向本地硬件的 On-Device 版本。[14] 语言理解进入机器人系统后,任务还要经过识别、规划和控制才能完成。

杯子拿起来,环境还在变

在收杯子的假设场景里,系统要判断杯子是否易碎、有没有液体、应该用多大力量。移动途中,有人走近或物体被遮住,最初那张图就不够用了。

屏幕上的对象往往有固定标识;物理环境中的物体会移动、接触、遮挡。持续观察能让动作跟随变化,识别正确只是其中一步。把杯子拿起之后,还要移动、放下,再回到可以继续工作的状态。

本地运行要解决哪些问题

端侧推理有助于应对响应时间、连接条件和数据处理需求,但具体效果取决于哪些组件在本地、哪些仍调用外部服务,以及硬件资源与更新方式。

机器人中的高层规划和底层动作控制,也有不同的更新频率。解释晚一点出现,影响阅读体验;控制反馈晚一点到达,可能直接改变动作结果。系统如何分工,比一个笼统的“本地大模型”标签更能说明设计。

两个九成,可能在测不同的事

十次抓取成功九次,与一百项完整收纳任务中九十项无需人工介入就结束,衡量的是不同范围。完整任务还包含移动、放置和异常恢复。

成功率需要附上尝试次数、环境条件和人工介入情况。失败后重新摆好桌面,再成功抓取,与系统自己处理失败,工作量也不同。

因此,一段演示适合展示某个动作的可行性;评估是否可以投入工作,还要看连续运行中的故障、恢复和维护记录。

从整齐货架到杂乱家庭

环境稳定、任务重复的场景,更容易看清投入和收益。固定位置的物品、明确的放置区域,让错误也比较容易定位。这样的任务即使范围不大,每天重复很多次也可能有价值。

换到陌生家庭,同一种指令会面对更多变化:杯子可能藏在别的物体后面,桌面有水,收纳位置也不同。评估要跟着环境重新做。实际使用记录越具体,才能知道哪一部分能力可以带到下一个场景。

SECOND OPINION

AI 编程提效,为什么研究结果会打架?

先看研究中的人和任务,再看那个最容易传播的百分比。

METR 在 2025 年的随机实验中发现,资深开源开发者使用当时的 AI 工具,在熟悉仓库里完成任务,平均耗时增加约 19%。[12] 这个结果描述了特定人员、任务和工具条件。

到 2026 年 2 月的后续更新,研究者遇到了新的困难:一些开发者不愿在没有 AI 的条件下工作,部分预期更受益的任务也没有进入样本。METR 因而认为后续数据难以可靠估计当前提效幅度,并调整实验设计。[13]

早期结果没有被这次更新简单撤回,后续数据也没有给出一个可以通用的新倍数。变化首先发生在样本如何形成。

新手做出页面,与熟手修改仓库

初学者借助工具完成原来不会做的页面,获得的是能力扩展。资深开发者修改熟悉代码,比较的则是同一项工作能否更快完成。两种体验可以同时存在。

组织还会关心另一个问题:相同时间内,团队交付了多少被接受的工作?这包含审阅、协作和维护,无法只用个人生成代码的速度回答。

生成很快,审阅可能很慢

模型生成时,屏幕上不断出现内容,进度容易被看见。读懂已有代码、检查改动、删除错误方案,却常常没有同样显眼的反馈。

若只计生成时间,返工就会漏掉。若只计任务开始到结束的时长,又可能把机器独自运行的时间全部算给人。记录人的投入、机器等待和验收结果,才能比较具体变化。

首次交付之外,还有后续维护和学习收益。今天生成的实现能运行,几周后是否难以修改,需要继续观察;今天多花一点时间理解陌生系统,也可能帮助下一次工作。

把比较放回日常任务

团队可以选几类反复出现的工作,记录是否使用 AI、人工投入、返工与验收结果。先用相同口径积累记录,再看哪些任务受益、哪些增加负担。

模型和工具会更新,研究的人员与任务范围却不会随之扩大。引用旧结论时保留这些条件,再查作者的后续研究,才能知道那个数字回答的究竟是哪一个问题。

SIGNALS

电力、记忆与工具接口

两项九月能源消息,三则产品与研究回看。

09.09 · Google 宣布在芬兰投资 130 亿欧元

计划覆盖未来两年的数字基础设施、清洁能源和配套合作。[15] 后续实施、投产与利用情况,将逐步说明这笔承诺如何落地。

09.09 · Fortum 与 Google 签署 22 年购电协议

协议支持 Loviisa 核电站延寿和升级,2028 年起以较小规模开始,2030—2049 年覆盖其 50% 产能。[16] 这项长期安排把算力建设与供电计划接在一起。

09.01 · Android 预告物品位置记忆功能

Google 宣布将通过 Gemini 把物品位置存入 Find Hub,并允许附照片。[17] 实际使用还要看地区与设备开放情况;搬动物品以后如何更新旧位置,会影响这项功能是否省心。

05.11 · METR 调查技术工作者的使用感受

调查覆盖 349 名技术工作者,报告自述的工作价值变化,并提醒读者谨慎解释估计幅度。[18] 这类调查提供采用情况与主观体验,可与任务记录和对照实验相互参照。

2025.09.11 · 给智能体设计工具接口

Anthropic 的工程文章讨论工具设计和评估。[19] 名称、参数、返回结果是否清楚,会影响系统选用工具和理解结果;接入更多工具时,也需要维护这些接口说明。