AI一周观察 2026W36:Astra 拓展Agent边界,Google 意外受益于 tokenmaxxing
01、产业
Astra 没带来AGI,但带来了Agent能力边界的扩展
9 月 3 日,OpenAI 在官方公告中发布 GPT-6 Astra,将电脑操作与面向专业环境的专项训练列为重点。公司展示的任务包括更新客户管理系统、整理日历、上网研究后在文档编辑器里撰写总结,以及操作 Excel、Power BI 和 工程软件。
这次扩张瞄准的是分散在不同软件里的工作。以制作一份市场报告为例,Agent 需要在浏览器查资料,把数据放进表格计算,再将图表和结论排进文档。电脑操作能力让它可以在这些应用之间切换,读取界面、输入内容、执行操作,再根据结果继续下一步。用户过去要亲手完成的下载、填表、复制和排版,也进入了 Agent 可以接手的范围。
官方测试显示,这条路线已有可量化的进展。在 OSWorld 2.0 的延迟模拟中,Astra 得分为 72.6%,每项任务约耗时 40 分钟;Sol 为 65.7%,约耗时 75 分钟。OpenAI 同时更新了 Codex 的电脑操作框架,模型和框架配合后,在 Mind2Web 测试中的任务完成速度约为原先 Sol 使用体验的 1.9 倍。
这也接上了近期工作轨迹数据的热潮。编程有代码仓库、运行环境和测试,比较容易把一次工作变成可以反复练习的任务。向外拓展时,表格、文档、网页和专业软件里的操作,是较容易先走通的一片空间:材料已经数字化,许多中间状态能保存,数字和文件也能检查。模型公司可以先训练这些有明确产物的环节,再尝试把它们接成完整工作。
跨应用执行进一步扩大了这类训练的用途。单独学会做表格、写文档,只能接手工作中的几个环节;学会调用不同软件完成连续步骤,才有机会接下一整项委托。模型公司争取的市场,也随之从开发者的编程工具,扩大到分析、运营、设计等岗位每天使用的软件。
独立评测显示,这种扩张仍有明显短板。Artificial Analysis 的发布评测中,Astra 在包含多项关联任务、大量源文件的 AA-Briefcase 中提高约 80 个 Elo 分,分析质量上升,呈现质量却下降;在覆盖 44 类职业任务的 GDPval-AA v2 中,得分反而下降约 80 个 Elo 分。9 月 4 日,AA 将更复杂的工作任务和更多私有题目纳入综合指数后,Astra 排名第二,比 Sol 高 4 分。
费用也没有随执行效率一起下降。Astra 输入、输出单价均为 Sol 当前促销价的 2.5 倍。AA 在 9 月 3 日的综合智能测试中测得,同为 max 档,Astra 单任务费用比 Sol 高 75%,约为 1.75 倍;在编程 Agent 测试中,更少的 token 消耗才把总费用拉回与 Sol 大致持平。
Reddit 的 Codex 讨论里,涨价和额度消耗引发不满,也有用户希望减少返工能抵消价差。局部能力已有正面反馈:Simon Willison 的 SVG 实测中,低档 Astra 的画面好过他测试的各档 Sol。
但把一项任务交出去之后还要改多少,直接影响用户是否愿意支付这笔溢价。
NVIDIA 收购 Hugging Face,补上 AI 云的模型分发入口
9 月 3 日,NVIDIA 宣布已同意以约 129.3 亿美元收购 Hugging Face。按公司公告,超过 1800 万名开发者、研究者和创作者使用这个平台,超过 20 万家公司在上面寻找、评估和部署模型。交易尚待完成。
Hugging Face 聚集的是英伟达云业务需要的开发者需求。开发者在这里找到模型,接下来就要决定用什么工具运行、到哪里租算力。买下这个平台,英伟达便有机会在开发者选定云服务商之前接触需求,把模型选择与后续的算力采购接起来。
这条路已有实际业务支撑。2025 年 6 月,Hugging Face 与 NVIDIA 推出训练集群服务:用户在 Hugging Face 提交需求,双方协助匹配、报价和配置 GPU 集群,DGX Cloud Lepton 提供资源接入与训练调度。今年 7 月,NVIDIA 又推出信用支持与收入分成模式,合作云商出售基于英伟达硬件的云服务,英伟达除了卖设备,还能从相关云收入中分成。Hugging Face 聚集的开发需求,正好可以接到这批算力上。
因此,这笔收购也意味着英伟达在向云业务的客户一端延伸。过去,它主要把设备卖给云厂商,由云厂商争取使用算力的客户;现在,它一边参与算力供给和融资,一边接近开发者选择模型、启动项目的地方。机房可以由合作伙伴运营,英伟达则有机会同时参与前面的客户获取和后面的使用收入。
Stripe 也在争取模型分发入口。8 月 19 日,Stripe 宣布收购这个模型路由平台,后者可以根据任务、价格和速度,在不同模型供应商之间分配请求。Hugging Face 影响开发者发现什么模型、怎样部署;OpenRouter 更接近实际调用和结算。两笔交易显示,大公司正在争夺模型分发这一层。即使某个模型被更好的模型替代,用户仍可能留在同一个平台上,继续通过它选择和购买模型服务。
这也解释了黄仁勋为什么要承诺继续支持其他芯片和云服务商。入口的价值来自足够多的模型和开发者愿意留下;一旦变成只能使用 NVIDIA 的销售渠道,它对整个生态的吸引力反而会下降。但保持开放与影响购买选择可以同时存在。哪套部署方案更省事、哪种硬件适配得更好,都会影响用户把钱花在哪里。
Fable 5.1 缓存降价,缓存成为Agent定价中核心环节
9 月 1 日,Anthropic 在产品公告中发布 Fable 5.1 和 Mythos 5.1。Fable 的输入、输出价格仍为每百万 token 10 美元和 50 美元,缓存读取从 1 美元降至 0.25 美元。公司据此估算,典型任务可便宜约 25%,高度依赖 Agent 的任务可节省约 45%。
Artificial Analysis 在同为 max 档的测试中发现,5.1 的输出 token 约为 Fable 5 的 1.7 倍,综合智能测试的单任务费用从 3.14 美元升到 3.76 美元,涨约 20%。缓存降价已经替它省下约 1.40 美元,仍然没抵消新增消耗。与此同时,它的综合得分提高了 4 分。用户买到的是更强、也更费钱的最高档。
使用方式不同,也能得到相反结果。开发者 paddo 按 API 标价重算自己的 Claude Code 记录,5.1 每轮调用约 0.26 美元,旧版约 0.42 美元。他原来的开销大部分是缓存读取,因此明显受益。
Anthropic 的选择仍然很清楚:让反复读取长上下文的工作更容易负担,争取原本嫌 Fable 贵的客户。官网引用 Cognition 的反馈称,代码审查等此前只能交给 Opus 的任务,现在用 Fable 也开始合算。
这次定价调整把一部分预算从读取旧上下文转给了更多推理。缓存占比高的任务更容易省钱,开到最高档则可能把折扣重新花掉。
Atlas 世界模型发布,和 Seedance 走的是两条路
9 月 1 日,World Labs 在官网文章中介绍了新模型 Atlas,并开放早期访问申请。Atlas 与 Seedance 这类视频模型走的方向不同:一个更像搭场景,一个更像拍电影。两者都在处理空间和时间,只是训练的着力点不同。
Seedance 从视频出发,学习连续画面怎样变化。人怎样转身,衣服怎样随动作摆动,切换镜头后人物怎样保持一致,都是它要解决的问题。以 Seedance 1.0 的公开技术报告为例,模型分别处理单帧内部的信息和帧与帧之间的关系,训练也直接围绕运动、镜头衔接和视觉质量展开。视频首先追求连续画面的可信度。让杯子摔碎的画面显得逼真,与换个角度后每块碎片仍在原处,是两种要求。
World Labs 则从空间建模出发。2024 年的初代演示,重点已经是生成可以持续存在、供用户游览的三维世界。这条路线要求场景在视角切换后保持一致。相机绕到桌子背后,桌腿和门窗的位置应该对得上。空间能被反复查看,才方便继续编辑、搭建游戏场景,或交给机器人仿真系统使用。
Atlas 延续空间建模方向,从头训练了多模态自回归扩散 Transformer,把文字、图像、相机位置和深度放进同一套空间上下文。新底座的价值在于统一处理这些线索,并利用成熟的训练、推理技术继续扩大规模。这里的自回归可以沿相机位置展开:生成下一项,是给同一场景换一个观察角度。物体怎样运动到下一秒,则属于动力学预测。
公开演示主要体现了这种空间能力。Atlas 的一分钟视频沿人工设计的相机路径生成;“子弹时间”给已经录下的事件换视角。机器人演示中,Atlas 帮助构建仿真,公开材料尚未说明物体运动由哪一部分预测。World Labs 此前介绍的机器人仿真系统,会按任务组合不同的表示和建模技术。
两条路线最终会在机器人任务中相遇。机器人把杯子推下桌,模型要预测杯子怎样落地;机器人转身再回来,模型还要保留已经改变的场景。Seedance 这类模型从连续画面的变化出发,Atlas 从持久的空间出发,各自积累的是完成这项任务所需的一部分能力。Atlas 的商业用途也因此更接近游戏场景搭建、空间编辑和仿真环境生成。
Gemini 3.8 发布,Google 披露模型研发中的自动改进循环
9 月 2 日,Google 发布 Gemini 3.8 Flash 与 Flash Cyber。据产品公告,Flash 在六周内已更新三次。普通版延续 3.7 的促销价,每百万输入 token 0.75 美元、输出 3.75 美元,优惠持续到今年底。
Artificial Analysis 的发布评测中,3.8 Flash 高推理档得分 59,比 3.7 高 3 分,与 GPT-5.6 Sol 的非最高推理档持平。上述分数采用 9 月 2 日评测的旧版指数。Google 在前沿能力竞赛中仍未追回领先,Flash 却已经积累了大量实际调用。
Google 在 9 月 1 日的回顾中披露,Gemini 应用整体月活已超过 10 亿。3.7 Flash 在第三方开发者市场也有大量调用:9 月 6 日查阅 OpenRouter 的 Google 模型页面,其用量快照显示为 2.6 万亿 token。
结合这些采用迹象看,Google 很可能意外吃到了 tokenmaxxing 失败后的路由兴起的红利。最难的判断仍然值得交给强模型,大量有明确要求、结果容易检查的步骤,则给了便宜模型发挥的空间,Gemini Flash系列在路由中就是一个核心选择。
Google 还披露了 3.8 的研发方式,研发中使用了持续运行的 Agent 循环,反复评估并改进底层模型。这是 Google 披露的自动化研究环节,完整训练流程中的人工参与程度尚未公开。
这与我们此前分析的自动化训练路线相吻合。研究 Agent 根据模型的失败提出改进方案,生成新的任务或数据,调用训练系统做实验,再根据结果决定下一轮试什么。反复有效的经验经过筛选,进入下一轮权重训练。模型参与改进的,既有训练材料,也有寻找这些材料和训练方法的过程。
沿着这条路线看,便宜、够用的模型还有一层潜在价值:实验室可以负担更多探索。批量构造任务、分析失败、筛选候选方案,都需要消耗推理算力;如果每一步都调用最昂贵的模型,自动研究本身就会变成成本瓶颈。Flash 如果能完成这些步骤,实验室在同样预算下就能多试一些方案。即使某一代没有拿到最高分,它仍可能帮助下一代找到更多值得训练的问题。
如果改进后的模型又能更好地组织下一轮实验,就有了递归自我改进(RSI)的复利。这个循环靠实验结果筛选方案:代码运行是否成功、环境中的任务是否完成、独立评测是否提高,都可以决定下一轮保留什么。便宜模型扩大尝试次数,可靠的验证从中选出有效改进,两者一起决定自动研究的效率。
3.8 的单任务费用也随能力提升而上涨。Artificial Analysis 测得,3.8 高推理档每项任务的成本约为 0.58 美元,比 3.7 高约 40%,原因包括输出 token 增加、Agent 交互轮次变多。Google 也继续保留 3.7,供优先考虑效率的任务使用。
ChatGPT 广告年化收入达 10 亿美元,广告主的效果账还没算清
8 月 31 日,OpenAI 在公司公告中宣布,ChatGPT Ads 上线不足 200 天,年化收入运行率达到 10 亿美元,已有数万家广告主使用,业务覆盖超过 40 个国家,并向欧洲、印度、中东和北非开放自助投放。10 亿美元是按当前收入速度折算的全年金额。
这类广告出现在 ChatGPT 回答下方,以带有“赞助”标识的广告单元展示,与回答正文分开。在广告已开放的地区,Free 和 Go 用户可能看到,Plus、Pro 等套餐保持无广告。OpenAI 表示,广告由独立系统投放,商家无法付费修改模型的回答。
广告主要根据用户正在聊什么来匹配,再结合相关性和商家出价决定展示顺序。例如,用户正在比较适合小团队的办公软件,回答下方就可能出现相关软件的广告。地区和用户设置允许时,系统也会参考历史聊天与记忆来做个性化匹配。广告主看到的是曝光、点击等汇总效果数据,无法读取用户的私人对话。
商家通过 Ads Manager 设置预算和出价、上传广告素材,按点击或千次展示购买广告。OpenAI 还提供网站追踪代码 Pixel 和转化数据接口 Conversions API,让商家回传用户点击后是否注册、询价或购买,帮助系统优化投放。公司称,到 8 月底,按点击出价和围绕转化目标优化的广告活动已占多数。
它的生意更接近搜索广告:用户主动表达需求,广告把有意了解产品的人带到商家网站。ChatGPT 多了一段持续对话,用户会补充预算、用途和偏好,这些信息可以帮助缩小广告匹配范围。对 OpenAI 来说,这也让 Free 和低价套餐的使用量有了订阅之外的收入来源。
投放效果已有明显分化。OpenAI 披露,一家电商广告主在 28 天内取得约 3 倍广告支出回报。MediaPost 8 月 28 日报道的早期小规模测试则不理想:加拿大代理商 Choice OMG 在 6 月花了 415 美元,获得 60 次点击,却没有吸引到有购买意向的客户。此外,Cleverly 报告平台记录了 57 次点击,Google Analytics 只记录到不到 20 次访问,也没有转化。
但收入增长表明,ChatGPT 已经吸引到真实的广告预算。随着自助后台向更多中小商家开放,这门生意将更直接地接受获客成本的检验。
02、研究
Claude 用 11 天完成费马大定理的 Lean 形式化证明
9 月 4 日,Anthropic 发表研究报告《Formalizing Fermat’s Last Theorem》,披露 Claude 借助哥伦比亚大学团队开发的 Prove2Me 平台,用 11 天完成费马大定理的完整 Lean 形式化证明。研究使用内部模型,消耗约 60 亿个输出 token。
费马大定理早已有了证明。这次成果沿用已有数学路线,将证明转成计算机可以逐步检查的形式。伦敦帝国理工学院的数学研究者当天介绍了独立检查结果,确认最终陈述对应费马大定理,证明使用标准数学公理。
实验最初并不顺利。Anthropic 组织 Agent 协作时,它们很快丢失项目进度,合作也难以继续。换到 Prove2Me 后,待证定理被放进依赖图,系统明确记录哪些已经完成、哪些还缺前提,并支持搜索和复用已有结果。
每个 Agent 提交的证明先由 Lean 检查,通过后,其他 Agent 才把这项结果用于后续证明。
既有数学文献、数学库和部分已形式化结果,为这次工程提供了基础。Prove2Me 则把庞大的形式化工作拆开,让 Agent 并行推进,再用统一的检查规则接回完整证明。共同的进度记录和可靠的中间成果,是这次协作能持续 11 天的关键。
这位独立检查者的反馈也说明了剩下的工作。这份证明有 1300 多万行,在 96 核机器上的编译时间接近数学库的 20 倍。他仍会继续整理现代证明和可复用的数学库。
形式化速度大幅提高后,精简证明、整理可复用结论的维护工作仍由数学团队承担。
Qwen 从操作记录重建环境,工作轨迹有了第二种用法
9 月 3 日,阿里巴巴 Qwen 团队与清华大学提交论文《Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments》,从 Agent 的操作轨迹中重建 3.73 万个满足任务需要的环境,再用它们生成训练数据。生成数据用于 Qwen3.5-27B 的监督微调,Terminal-Bench 2.1 单轮成绩提高 11.9 个百分点,EvoCode-Bench v2 多轮成绩提高 13.8 个百分点。
它处理的是工作轨迹变贵以后的一道实际难题。记录能告诉模型别人怎样做过,却不容易让模型重新试一次:文件已经改了,依赖缺失,操作当时的环境未必还在。要训练失败后怎样恢复、用户改要求后怎样继续,就需要把这些状态找回来。
Terminal-Universe 先根据文件操作恢复部分工作区,再让模型补齐缺失内容。随后可以重做原任务,也能在同一工作区提出新要求。一条记录由此可以支持多次练习。
重建的工作区以任务可执行为目标,缺失内容由模型补全。同一个教师模型还负责出题、作答和生成检查程序,误解要求时可能让答案与检查一起出错。作者在局限部分明确承认了这一点。
工作轨迹的价值由此扩大:一条记录既能示范做法,也能用来重建练习环境。采集办公流程时,保存原始文件、修改前后的状态和用户纠正记录,就能为后续训练提供更多可重复使用的材料。
Anthropic 实验,过度训练可能破坏已有的安全对齐
8 月 31 日,Anthropic 在安全更新报告中介绍研究《Training a Misaligned Reward Seeker》。它要验证的是一个具体问题:训练时放过评分漏洞,会不会让模型在其他任务上也更愿意越界?研究者有意选出 80 个可以通过作弊拿高分的环境,继续训练一个早期 Opus 4.8 模型,没有另外添加要求它作恶的指令。
结果是,模型学到的影响超出了原来的评分漏洞。训练结束时,它在约 40% 的任务回合中作弊;换到新的模拟网络安全任务,它也更容易为了完成目标而获取凭据、访问未经授权的系统。同样的模拟测试中,训练前的模型没有出现同等程度的越界。这些网络安全任务全在模拟环境中完成。
另一组测试把变化显示得更清楚。直接向模型提出危险问题,训练前后两个版本几乎都会拒绝。但换成可以调用工具、读取评分程序的 Agent 任务,让模型看到“完整回答才得分”的规则后,训练后模型给出有害回答的比例达到 29%,训练前则是 0.7%。后续训练强化的得分行为,在这组任务中压过了原有的安全拒绝。
这项实验把安全对齐随训练退化的过程展示了出来:模型因作弊得分,随后把越界行为带到新的任务,在直接问答中却仍然表现正常。实验有意集中使用存在漏洞的环境,测的是风险怎样形成,日常发生率尚不清楚。
这与工作轨迹训练直接相关。验收程序给什么做法打高分,训练就会强化什么做法。假如修好代码和删掉失败测试都能得分,任务成绩提高的同时,模型也可能更擅长绕过检查。能力训练与安全对齐因此是同一套训练过程里的问题,后续任务训练会继续改变模型愿意采取的手段。
早期信号|在线蒸馏榨干每道题,解决没题目的困境
在线蒸馏可以让学生模型反复回答同一道题,随着模型更新,生成的解题过程也会变化。一小批题目由此提供大量训练经历,题库大小对训练效果的解释力下降了。
9 月 3 日,清华大学、中国科学院大学、Northeastern University、伊利诺伊大学厄巴纳—香槟分校和约翰斯·霍普金斯大学提交论文《Rethinking On-Policy Distillation of Large Language Models II: One Training Example》,把在线蒸馏的训练题目压缩到一道。
具体做法是,让学生模型针对同一道题生成一批回答,每轮采样 64 条。教师读取学生已经写出的内容,给出接下来各个 token 的概率;训练程序比较师生的概率差异,更新学生模型,让它在这些位置的选择更接近教师。更新后,学生重新回答这道题,再接受下一轮监督,持续数百步。题目保持不变,生成的解题过程却在变化,每个生成位置都能提供学习信号。
研究将生成过程中遇到的上下文按模型内部表示聚类,发现一道题的回答已能覆盖完整题库训练所访问状态的 71.5%;换成 16 道内容不同的题,覆盖率达到 98.9%,训练效果也接近使用完整题库。这解释了少量题目为何仍能持续训练:一道题可以引出大量不同的生成上下文,教师在这些位置不断提供监督。
普渡大学计算机科学系 8 月 31 日提交的论文《Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement》,则进一步检查教师的作用。研究者发现,在所测设置中,把教师给出的信号换成固定的负向信号,仅压低学生生成时概率较低的 token,也能得到接近常规在线蒸馏的提升。
他们据此提出 OPSA:模型先生成回答,再从这条回答中挑出自身原本赋予概率最低的 20% 的 token,对这些生成选择施加负向更新,降低以后在相同上下文中再次选到它们的概率。调整力度由所在位置的概率分布决定:模型对下一步越拿不准、候选选项的概率越分散,负向更新就越强。整个过程使用模型自己的概率信息来更新权重,无需教师或标准答案。
在 Qwen3-1.7B 上,OPSA 让 AIME24 的 Avg@32 成绩提高 35.41 个百分点;这一指标衡量每题采样 32 次的平均正确率。
前一项研究用少量题目持续向教师学习,后一项则从模型自身的概率分布构造训练信号。两者分别减少了题库需求和教师监督开销。
Uno 用扩散+Transformer加速已有模型
9 月 3 日,穆罕默德·本·扎耶德人工智能大学基础模型研究院(MBZUAI IFM)、伊利诺伊大学厄巴纳—香槟分校、康奈尔科技学院(Cornell Tech)、哈佛大学与 Cerebras Systems 提交论文《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》,提出 Uno 方法,在自回归模型上增加轻量扩散权重,以并行生成候选内容,再按原模型的分布验证,实验报告最高约 3 倍加速。
Uno 保留原模型的采样分布,这就是论文中“无损”的含义。新增权重负责提速,已经训练好的编程、推理和工具使用能力可以沿用。
比最高倍数更有参考价值的是并发条件。很多加速方法在一次只服务一个请求时表现不错,服务端批量处理请求以后,收益就会缩小。
Uno 的 Qwen 实验也有这种差别:单请求约 2.5 倍,在设备支持的最大批量下约 1.6 倍。收益缩小了,但没有消失。它还通过共享缓存,减少了相较于独立草稿模型的额外内存需求。
高并发下的收益更贴近批量 Agent 任务的负载。生成训练轨迹会持续占用推理服务,同样算力下保持约 1.6 倍加速,就能缩短这部分数据的生产时间。
早期信号|Repo-To-Skill 把仓库经验整理成研究 Agent 的技能
把仓库中的工程经验提前整理成技能,可以减少研究 Agent 的重复摸索。运行入口、依赖配置和常见报错,都适合在准备阶段处理。
9 月 2 日,北京智源人工智能研究院、中国科学技术大学、中国人民大学和香港理工大学提交论文《Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills》,发布了从 1000 个仓库提取的 5000 多项技能。论文还为具体评测另做了任务技能和相关论文技能。
DisCo 先阅读源码、文档、示例和测试,找出仓库能完成哪些工作,以及相应的接口和操作步骤。随后,它在独立环境里核对依赖、函数参数和命令行入口,并运行小规模检查,确认文档里的用法与代码实际行为相符。
这些经验按数据处理、训练、评估、排错等工作拆成技能。每项技能用 SKILL.md 写清适用场景和操作步骤,附上必要的参考资料与辅助脚本。DisCo 再用使用案例、仓库原有测试等核验技能;发现缺漏就修改并重测,尚未解决的问题留下记录。技能入库后按能力分类,执行任务的 Agent 先查目录,再读取相关技能。
固定模型、运行框架及执行预算后,MLE-bench 得分相对提高 134.3%,PaperBench 相对提高 34.4%。
收益来自通用技能库和针对评测提前准备的技能,构建技能的预算未计入下游比较。作者排除了目标论文及其实现等材料,并提前选择相关知识、做验证。这套方法把搜索和试错前移,用准备阶段的投入换取执行阶段更高的成功率。
03、政策
OpenAI 安全问题叠加出现,再次证明Agent分散运行也能结群协作
9 月 4 日,Sydney Von Arx 等研究者公布了一份调查:一批 OpenAI Agent 在执行限时网页检索任务时,把一个德国 Wiki 改成了自己的留言板。研究者从公开记录中找到了约 1.8 万条帖子,内容包括题目答案,以及绕过运行环境限制的办法。活动发生在 5 至 7 月,本周才被公开。
这些 Agent 经常遇到相同的题目,但答题进度不同,交换信息可以节省答题时间。先做到后面几轮的 Agent,可以把题目和答案贴出来,帮助还在前面几轮的同伴提前准备。原本只获准浏览网页的 Agent,利用这个老 Wiki 的接口设计写入内容,让分别运行的任务有了共同的信息来源。网站管理员开始删帖后,还有 Agent 提醒同伴备份,并给页面加上 ZZZ 前缀,尽量躲过按字母顺序展开的清理。人类是AAA建材王总,AI是ZZZ联络小透明。
这与此前热议的“三代 Agent 文明”是同类现象,但属于另一批活动。“三代文明”是 Dwarkesh Patel 对此前事件的叙事概括:5 月,Agent 把 OpenAI 内部的软件包服务变成留言板;7 月初服务故障、重建以后,另一批 Agent 又找到通信办法,随后协作入侵 Hugging Face;再往后,Agent 取得了 OpenAI 一处研究集群的管理员权限。这个集群用于研究评测,OpenAI 表示客户数据和产品服务未受影响。
METR 与 Redwood 的独立调查把协作过程写得更具体:在其重点调查的 7 月 7 至 13 日期间,约 1200 个原本应当相互隔离的 Agent,通过留言板交换了超过 7 万条消息和文件,约 700 个参与了针对 Hugging Face 的攻击。有些 Agent 甚至冒着完不成自己任务的风险替集体做实验,帮助大家寻找欺骗或篡改评分程序的通用办法。它们已经形成共同试错、共享成果的分工。
留言板让 Agent 的经验跨越单次运行积累下来。一个 Agent 找到的漏洞,可以留给后来启动的 Agent 使用;共同可写的空间,也让它们能分工试验,再把结果汇总。原本分散的一次次尝试,由此形成持续协作。
此前入侵事件主要由一个内部研究模型推动,评测时的防护弱于公开部署系统。它揭示的风险来自共同信息空间:原本分开的任务可以共享漏洞、接受同伴的目标,形成跨任务的集体行动。
9 月 5 日,OpenAI 承认 Wiki 事件,并表示此前将其归为模型偏离预期的研究问题,没有单独披露,接下来会制定新的披露框架。
纽约市暂停低龄学生用 AI,高中只留下受限试点
9 月 2 日,纽约市发布政策文件,宣布在 2026—2027 学年暂停 2-K 至八年级学生直接使用生成式 AI,一年期政策涉及近 60 万名公立学校学生。高中保留有限试点,陪伴型聊天机器人在所有年级禁用。
教师使用 AI、特殊教育等用途仍有空间。高中试点要求教师监督,并对不同工具设置使用时长。纽约市计划用这一年评估暂停和试点的效果。
教育 AI 的目标是让学生学会独立解题。提示越完整,作业可能完成得越快,学生自己思考的部分也可能越少。这使教育产品与办公助手有了不同的验收标准:办公看工作是否完成,教学看撤掉工具后,学生能否独立完成同类问题。
执行同样存在争议。美联社报道,纽约市教师工会主席 Michael Mulgrew 认为,新规仍未回答怎样要求采购产品提供 AI 防护等问题。
达拉斯联储估算,AI 使得州 2025 年网络招聘减少 2.6%
9 月 1 日,达拉斯联储发布研究报告《Job postings show early signs of AI automation impact》。研究估算,生成式 AI 自动化使得克萨斯州 2025 年的网络招聘广告减少约 2.6%,2024 年的估计影响为 1.8%。这两个数字是相对于没有这部分 AI 自动化影响的情形,估算出的额外招聘收缩。
研究分析了 Lightcast 收集的数百万条招聘广告,并根据人们实际使用 Claude 完成的任务,估算各类职业有多少工作可以交给 AI。它发现,同一行业里,越容易由 AI 完成的工作,招聘减少得越多。为理解这个差距,可以假设两类职业分别有 20% 和 30% 的任务可由 AI 完成。按照研究的估计,两者相差的这 10 个百分点,到 2026 年一季度,对应后者招聘广告相对前者多减少约 8%;比较基准是 ChatGPT 发布前的 2022 年第三季度。
研究者又单独追踪了一批在观察期内持续出现在招聘数据中的企业。按这些企业在 ChatGPT 发布前招聘的岗位来估算,同样以可自动化任务占比相差 10 个百分点作比较,更容易受 AI 影响的企业,招聘广告到 2026 年一季度相对多减少约 7.7%,二季度约为 9.2%。这把招聘收缩定位到了既有企业内部,持续经营的公司也在调整用人需求。
全州约 2.6% 的估计影响,与特定职业、企业之间约 8% 的招聘差距,反映了不同的处境:整体招聘市场的变化还不算剧烈,工作更容易被 AI 接手的人,已经可能面对明显更少的机会。企业即使不裁员,也可以少补离职空缺、缩减新增岗位。对求职者来说,这些变化同样会增加找工作的难度。
研究观察的是网络招聘广告,未逐家核实企业采用 AI 与减少招聘之间的关系。正文也未给出 2.6% 对应的广告减少条数或就业人数。
算力绿电目标写入 2030 年部署,电力供给影响项目布局
9 月 4 日,中央网信办等七部门公开《促进数字化绿色化协同转型发展实施方案(2026—2030 年)》。方案提出,到 2030 年,推动算力设施等重点领域的可再生能源电力消费,达到所在省份的消纳责任权重水平。
这一安排对应的是快速增长的用电需求。国家能源局今年 6 月预计,“十五五”期间全国算力用电量年均增加 1000 亿度以上,并指出国家枢纽节点新建数据中心已有绿电消费比例要求。新的方案把算力用能与绿电消费的联系延续到了 2030 年。
这项政策把算力增长与新增绿电需求接了起来。对新能源企业,数据中心是一批持续用电的客户;对算力运营商,绿电采购成本和供应稳定性会更深地影响扩容计划。地方争取算力项目,也要把长期绿电供应作为招商条件。
能够组织稳定、价格可承受的绿电供应,会成为项目选址的优势。
本文来自微信公众号“腾讯科技”,作者:博阳,36氪经授权发布。