今天两条主线:一是开源追赶——Z.ai 的开源模型 GLM-5.2 被第三方评测排到总榜第三,只输给 Claude Fable 5 与 Opus 4.8,「开源只能当备胎」的旧叙事被撕开口子;二是AI 安全突然成了主战场,OpenAI 与 Gray Swan 不约而同把红队和「打补丁」推向规模化。底下还有一条暗线:当模型越来越像通用商品,护城河正从「模型多强」挪向「谁更会做 evals」。
开源阵营今天交了一份让人意外的答卷,顺带把「评测怎么算」也吵上了台面。
Z.ai 放出的开源权重模型 GLM-5.2 被评测机构 Artificial Analysis 排到总榜第三(1524 Elo),仅次于 Claude Fable 5 和 Opus 4.8,是当前最强开源模型,且支持最高 100 万 token 上下文。在真实编码任务里它比 Opus 4.8 慢、调用工具更多,但更便宜(约 $0.41 vs $0.81),还顺手清理了死代码。AINews 与 AI Valley 都重点报道,有人称这是 Agent 领域的「DeepSeek 时刻」。
读原文 →日本 Sakana 推出 Fugu:一个接口在背后学习「选模型、分派、校验、综合」,Vercel 很快把 Fugu Ultra 接进了 AI Gateway。但批评者指出,它本质是「路由器+预设多步流程」,在 SWE-Bench Pro 上比 Opus 落后约 10 分,还拿匿名的「模型 A/B/C」对比、不报 token 与成本。争论从「编排有没有用」转向了「这种系统到底该怎么评测、怎么披露」。
读原文 →AI Valley 援引泄露消息称,Anthropic 的 Claude Sonnet 5 最快下周发布,带 100 万 token 上下文,编码、视觉与复杂工作流处理都有提升。属未证实传闻,仅作观察。
读原文 →🔍 深度解读:开源逼近闭源,真正动摇的是「护城河在模型本身」这个假设。如果顶尖能力可以被开源平替、还更便宜,竞争就会从「谁的模型强」转向「谁的产品、数据飞轮、分发和工程更强」。而 Fugu 的争议是同一枚硬币的另一面——当大家都说自己「逼近前沿」,评测的可信度本身就成了战场(这条线在后面「评测即护城河」会再出现)。
今天安全的信息密度最高:一边把「打补丁」做成规模化,一边把红队做成专门的模型。
OpenAI 扩展了 Daybreak 安全计划:开放完整版 GPT-5.5-Cyber(号称在 CyberGym 上达到 SOTA)、Codex Security 插件,以及面向关键开源软件的「Patch the Planet」。据称已扫描 3000 万+ 次提交、覆盖 3 万+ 代码库,cURL、Go、Python 等都在范围内。重点是思路转变——从「找漏洞」走向闭环自动修复(再由人工复核)。
读原文 →在 Latent Space 播客里,OpenAI 董事 Zico Kolter 与 Gray Swan CEO Matt Fredrikson 指出:抗越狱的鲁棒性不会随规模自然变好,只能靠专门的安全训练——他们的基准显示模型能力(如 GPQA 分数)与被攻破率几乎不相关。为此 Gray Swan 训了一个小模型 Cygnal 夹在用户、大模型和工具调用之间做策略过滤。他们的自动红队系统在限定任务上,已能比熟练的人类红队找出更多破绽。
读原文 →嘉宾沿用 Simon Willison 的框架:当「读了不可信外部数据 + 能接触私密信息 + 有外发能力」三者同时成立,提示注入就变得危险,而带电脑操控的 Agent 恰好把三条全占了。他们几乎断定:第一起大型公开的提示注入事故迟早发生、且发生时没人会意外(这正是「灰天鹅」的含义),并会催生 AI 保险与合规需求。
读原文 →🔍 深度解读:安全这件事今天有个共同信号——从「人找漏洞」升级到「机器规模化地修与攻」。OpenAI 把修补做成流水线,Gray Swan 把红队做成专门训练的模型,两边都在说同一句话:Agent 普及后攻击面爆炸,靠提示和「更大的模型」兜不住,得有独立的过滤层、红队层和事故预案。对要落地 Agent 的团队,这是从「能不能用」转向「敢不敢上生产」的关键一跳。
钱还在涌入,但开始算账:算力中间商和「自有模型」成了两个新故事。
Reflection AI 据报与 SpaceX 签了 63 亿美元的 GB300 算力大单,这是继 Anthropic、Google 之后 SpaceX 的第三笔 GPU 出租。分析师 Jamin Ball 把 SpaceX 的算力合约加总到约 23.2 亿美元/月,年化约 280 亿美元,差不多是 CoreWeave 当前营收的两倍——「neocloud」算力中间商,正成为夹在模型公司与硬件供给之间的一层关键生意。
读原文 →Latent Space 的 swyx 认为,大家都没把 SpaceX「既是 neocloud 又是 neolab」的账算对:他称 SpaceX 已通过算力合约大致收回了对 Cursor 投资的一半,若 Composer 3 给力则全部覆盖,「一边领跑模型、一边卖算力」是个独特而有效的组合。
读原文 →Baseten 官宣 Series F(正文称 15 亿美元),CEO 称企业越来越想拥有自己的智能层——跑开源或专用模型、用自有数据做后训练、掌控持续学习,而不只是调别人的 API。客户包括 Cursor、Notion、Harvey、Abridge 等。这反映出:更强的开源模型 + 更好的基础设施,正把「后训练」从前沿实验室的专长,变成应用公司的基本功。
读原文 →🔍 深度解读:这两条和开头的开源新闻是连着的。开源把「模型」这件商品的价格往下压,钱就会往上下游两端跑——上游是算力(SpaceX 把 GPU 出租做成中间商生意),下游是「拥有并调校自己的模型」(Baseten)。短期不影响前沿继续烧钱,但会加速「从卖模型,到卖算力 / 卖产品 / 卖后训练能力」的转向。
从平台到个人用法,Agent 正在从「能力演示」变成「每天怎么干活」。
谷歌宣布 Interactions API 正式可用,成为 Gemini 模型与 Agent 的新默认接口:一套 API 同时管模型和 Agent,支持后台异步执行、托管 Agent,还带一个隔离的远程 Linux 沙箱 Antigravity,并配了可安装的「技能」教编码 Agent 用新 SDK。等于谷歌给「Agent 运行框架」这个难题,交了一份一方答卷。
读原文 →在 Every 的 AI & I 播客里,Anthropic Labs 负责人、Instagram 联创 Mike Krieger 说他把 Claude Fable 5 当成一个可委派的队友:复杂任务常常晚上布置下去让它自己跑、第二天再收,连远程服务挂掉这种意外它也会先搭脚手架绕过、回头再修。这逼他重做了提示与任务拆解——更多前期架构规划、并行开很多个会话,并第一次用上 Fable 宽幅的「努力档位」。
读原文 →Vercel CEO Guillermo Rauch 宣布,Claude Design 的产出现在可以一键导出到 Vercel,把 Claude 的设计生成直接接进部署流程。
读原文 →在 Peter Yang 的播客里,Bin 与 Jake 展示了开源工具 HyperFrames:把 HTML 一键变成过去要花大几千美元才能做出的产品发布视频,可以从任意网址 one-shot 生成;Jake 还给出了配合 Codex 或 Claude Code 的五步出片流程。
读原文 →🔍 深度解读:一个平台信号 + 一个真实用法,拼出了 Agent 的当下。平台层(谷歌)在把「harness/运行框架」做成一方能力;个人层(Krieger)则示范了高水平开发者怎么用——重心从「写提示」前移到「设计任务、并行托付、事后验收」。换句话说,会用 Agent 正在变成一种新的工程手艺;连「把网页变成发布视频」这种过去外包的活,现在也被开源工具 + 编码 Agent 一口气接管了。
当模型趋同,「谁更会评测」反而成了分水岭——但裁判本身也未必可靠。
Box CEO Aaron Levie 认为,几乎所有模型与 Agent 的进展都是 evals 的下游——从开源后训练、应用层到企业级 Agent 部署皆然,他预测「做评测的能力」会成为未来每家企业的核心能力,把用好 AI 的公司和用不好的分开。
读原文 →一项覆盖 21 个裁判、9 家厂商、约 54 万次判定的审计发现:常用的精确匹配一致率会明显高估裁判的可靠性。换成 Cohen's kappa 后,MT-Bench 上的一致性掉了 33–41 分,裁判排名也大变。对把「裁判模型」当内部评测基建的团队,这是一记方法论警钟。
读原文 →🔍 深度解读:把今天串成一句话——模型在变成通用商品(开源追平),于是护城河上移到「评测」。Levie 说全都是 evals,但同一天的审计又提醒:连裁判模型本身都不够可靠。所以真正稀缺的,不是再多一个榜单,而是「可信、可复现、贴合自己业务」的评测能力。这也呼应了上面 Fugu 的争议:谁能把 evals 做扎实,谁才有资格说自己「逼近前沿」。