OpenAI 在 DevDay 推出可持续工作的 Dots,并发布 GPT-6.1 Sol、Ultrafast 等模型与开发工具;AI 产品正从回答问题,转向持续执行任务。Claude in Chrome 也已向所有 Claude 付费套餐开放,并加入浏览器操作的安全检查。模型速度和价格的竞争之外,智能体能自主做什么、何时必须征得同意,成了同样重要的问题。
展开口播文字稿
今天这期的主线是,人工智能正在从回答一次问题,转向替你持续处理一件事。OpenAI 推出了能在云端工作的 Dots,也发布了新模型和开发工具;Claude 的浏览器助手则向所有付费套餐开放。值得花时间聊的,不只是它们能做什么、跑得多快、花多少钱,而是当一个助手开始跨应用办事,谁来决定它下一步能不能做,以及做错了该怎样及时停下来。
先看 Dots。你可以把过去常见的 AI 助手想成一个坐在咨询台后面的人:你问一句,它答一句,回答完这次交流就结束了。Dots 瞄准的不是这个场景。OpenAI 发布它,是想让用户交代一个目标后,由智能体在云端持续工作,连接应用,把需要多个步骤的事情往前推进。这里说的“智能体”,不是给聊天窗口换个名字,而是强调它能调用工具,围绕一个目标连续执行任务。当然,连续执行不等于可以毫无限制地自行决定一切。
Dots 一个关键设计,是让用户事先划分三类事情:哪些可以自行完成,哪些必须先征得批准,哪些根本不许做。你想想,这和请别人帮忙办事很像。你可以授权对方整理信息,却未必同意对方替你作出所有决定。过去,这样的边界可能只是产品设置里不太显眼的一项;现在,边界本身就是产品能不能成立的前提。因为当助手不再停留在回答问题,而是开始连接应用、处理长任务链时,同样一个误解,可能影响后面的好几个步骤。
这里还有一个经常被忽略的变化:任务放在哪里运行,会改变你对它的感受。Dots 采用云端运行方式,意味着它瞄准的不是“我盯着屏幕,看它回一句话”的使用习惯,而是“我交代完之后,它还会继续处理”。这听上去省心,但我个人的理解是,正因为用户不一定一直看着,批准机制才更不能含糊。最有用的自主性,不是每一步都问你,问到你不想用;也不是一声不响把所有事都做完。更难的设计,是在不打断工作和不越过边界之间找到位置。今天的素材没有给出 Dots 在实际使用中如何处理每一种边界,所以这一点还要继续观察。
再看 Claude in Chrome,它把同一个问题带到了浏览器里。Claude 官方说,这个浏览器助手现在已经向所有 Claude 付费套餐开放。它能利用用户现有的登录状态阅读网页、点击链接、填写表单,也能自主执行部分浏览器操作。这几个动作听上去很普通,但和只在聊天框里给建议有本质区别。给建议时,你仍然是执行者;能够点击和填写时,助手已经进入你的操作流程,开始接触原本由你亲手完成的步骤。
“利用现有登录状态”尤其值得听清楚。对用户来说,它的好处很直观:不必把浏览器中的工作重新搬到另一个地方,助手可以在你已经使用的环境里帮忙。可从权限角度看,现有登录状态也意味着,它接触的网站并不是一张与用户无关的空白网页。我个人的理解是,这让浏览器助手的价值和风险同时变得更具体。价值在于它能够接上你的真实任务;风险在于你更需要弄明白,哪些只是阅读和准备,哪些已经属于替你采取行动。素材没有展开 Claude 对不同操作设置了怎样的逐项批准规则,不能因为它能执行部分操作,就推断它能不经同意做所有事。
同一组消息里,还有 AI Valley 对 Manus 2.0 和 Cue 的报道。简报说,Manus 2.0 更新了智能体架构,并加入云端电脑和自动化能力;Cue 则面向个人智能体,提出每个智能体可以有自己的邮箱、电话号码、钱包和电脑。这里要把消息来源说清楚:这些产品细节来自简报报道,今天的素材没有提供对应的官方发布链接,所以不能把它们当成已经由官方逐项确认的完整功能说明。不过,作为观察方向,它们很有代表性:行业正在尝试的不只是让 AI 会说话,还包括给它处理事务所需的工具和工作环境。
邮箱、电话、钱包、电脑,这几个词放在一起,为什么会让人多想一层?因为它们分别指向联系、操作和资源使用的不同入口。我这里说的是这些概念所代表的权限问题,并不是断言 Cue 已经能在所有场景自主完成相应操作。一个智能体如果只是帮你起草内容,你审阅后再自己发出,边界相对容易理解;如果它拥有更多独立处理事务的入口,你就会进一步追问:谁能给它下指令,哪些指令应当拒绝,什么时候必须把决定交还给人。工具越像一套完整的工作条件,权限设计就越不可能只是发布之后再补上的小功能。
把 Dots、Claude in Chrome 和这份简报中的 Cue 放在一起看,它们不是同一款产品的三个版本,运行方式和产品定位也不同。但它们都在尝试拉长 AI 能处理的任务链。Dots 强调云端持续工作,Claude in Chrome 进入用户已有的浏览器环境,Cue 的报道则把个人智能体可拥有的工具推到台前。它们共同提出一个问题:我们究竟希望 AI 只是给出下一步建议,还是在明确授权之后,真的把下一步做掉?如果选择后者,产品能力的说明就必须和权限边界的说明一起出现。能完成任务固然重要,用户能不能预料它会怎么完成,同样重要。
说完智能体能做什么,我们再看一个更实际的问题:要让它长时间工作,速度和费用撑不撑得住?OpenAI 这轮发布里,G P T 六点一 Sol、Ultrafast,以及相关报道提到的其他模型,恰好把不同取舍摆在一起。有的强调调用价格,有的强调生成速度。对只问一句话的用户,差别可能只是回答来得快一点、慢一点;对一个需要反复处理请求的任务流程,单次的时间和费用会一遍遍出现,最后变成整个产品体验的一部分。
先说 G P T 六点一 Sol。Sam Altman 宣布这款模型时,强调其价格约为 Astra 的五分之一,还提供百分之九十五的缓存输入折扣。“缓存输入”可以这样理解:有些任务会反复带上此前已经处理过的相同内容,如果相关输入能再次使用,计费方式就可能不同。这里的重点不是说你随便用一次就能省下百分之九十五,而是折扣针对符合条件的缓存输入。具体能省多少,要看任务中究竟有多少输入属于这一类。把“某一部分输入的折扣”和“整个任务的最终花费”混为一谈,很容易高估价格变化的效果。
为什么低价在智能体场景下格外引人注意?你可以想象一个完全假设的流程:助手先读到一段请求,判断应该走哪条处理路径,再处理结果,然后根据需要继续下一步。这里我只是在说明连续任务的成本结构,不是说 Dots 一定按这个流程工作。每个步骤都可能消耗模型调用;如果任务拉长,调用次数和输入内容都会影响总费用。因此,“这个模型标价较低”只是第一层问题。第二层是它能否把你的任务做对,需不需要反复重试;第三层才是把整个流程跑完后的总时间和总费用。只盯着一个单价,未必能看出真正的成本。
另一边,Ultrafast 主打的是速度。OpenAI 官方视频简介说,在 Codex 中,这一模式运行速度最高可达 Astra Standard 的八倍、Astra Fast 的四倍;Latent Space 的 AINews 专栏也提到它的价格更高。这里有两个限定词不能丢:一个是“在 Codex 中”,一个是“最高可达”。它们不是承诺你手头的每一项任务都能获得同样倍数的提升。今天的素材也没有可用的视频字幕,因此我们只能引用视频简介里的公开表述,不能推断演示具体怎么进行,更不能把演示想象成所有人的日常体验。
那为什么有人可能愿意为更快的模式支付更高价格?我个人的理解是,要看等待发生在什么地方。如果一个人只是偶尔发起一项不着急的任务,更快未必能改变多少体验;如果开发者正在反复查看结果、修改要求,等待就会直接影响工作节奏。这不是说速度一定比价格重要,而是说两者不能脱离场景单独比较。对持续工作的智能体也是一样:有的步骤需要尽快反馈给人,有的步骤则未必值得为更高速度付费。到底怎么选,还得让具体任务来回答,而不是只看发布时最醒目的倍数。
再看 AI Valley 对 Claude Sonnet 5.5 的报道。简报称,它比 Sonnet 5 快逾百分之三十,输入价格为每百万 token 两美元,输出价格为每百万 token 十美元。你可以把 token 暂时理解成模型处理和生成内容时使用的计量单位,不必把它简单等同于一个汉字或一个词。这里还要注意,输入和输出分别计价,所以一个任务花多少钱,不仅看你给了多少内容,也看它返回多少内容。简报认为这款模型适合边界明确的日常任务,但这是简报的使用判断,不等于它在所有任务中都优于其他模型。
把 Sol、Ultrafast 和 Sonnet 5.5 摆在一起,今天真正值得记住的不是给它们排一个简单名次,而是比较方法要变了。发布方给出的价格、官方简介中的“最高可达”,以及简报引用的速度和使用判断,性质并不完全一样。测试成绩也不等于你的实际任务表现。对开发者来说,合理的提问不是“谁最强”,而是“我要解决的问题里,哪一步最耗时间,哪一步最耗费用,哪一步最怕出错”。如果同一项任务最终需要多次调用,或者需要人反复检查,那么单次运行漂亮的数字,未必能代表整个流程的结果。
模型之外,还得有地方让任务真正跑起来。Latent Space 的 AINews 专栏报道,Codex 新增了可持续运行的云端环境:即使笔记本电脑合上,任务也可以继续进行。它还提到命令行工具更新,包括 worktrees 和斜杠 agents。这里不用急着记这些名字;更容易理解的变化是,开发任务不再都得跟着你眼前的电脑屏幕一起开始、一起结束。工作环境可以在云端继续处理,这和前面 Dots 所代表的持续工作方向,处在同一条更大的产品线上。
不过,“电脑合上还能继续跑”,不等于任务就自然变得可靠。我个人的理解是,运行时间一旦拉长,用户和开发者就会更关心过程能否接得上:任务执行到哪里了,下一步是否仍符合原本目标,遇到需要人决定的地方能不能停下来。今天的素材没有展开 Codex 云端环境的具体监控或批准机制,所以我不能替它补出这些功能。但这些问题值得提出,因为过去一次回答出错,你可以立刻重新提问;持续运行的任务如果方向偏了,影响可能会沿着后续步骤继续传下去。持续运行解决了“能不能继续做”,不自动解决“是否一直在做对的事”。
开发流程里还有另一种工作,不需要模型写一篇长回答,而是需要它迅速作选择。Latent Space 的 AINews 专栏称,OpenAI 推出了 Decisions A P I,可根据文本和图像进行快速的多选分类与路由。A P I 可以理解成让一个程序调用另一项能力的接口;“路由”则像在入口处判断一件事该交给哪条处理流程。注意,这里是帮助选择路径,不是说它已经知道后续每一步的全部答案。把这种选择单独做成能力,反映出开发者并不总需要一段长篇生成文字,有时他们需要的是一个及时而明确的分岔判断。
为什么一个“选择题接口”值得和大模型发布放在一起聊?因为智能体做长任务时,执行和调度是两件事。你可以把它想成一条工作链:先判断眼前这份内容属于什么情况,再决定进入哪条流程,随后才是具体处理。这只是帮助理解的假设性例子,并不对应今天某个产品已经公开的完整工作流程。如果前面的判断错了,后面的执行即便很快,也可能是在错误的方向上加速。因此,模型能回答多少问题固然重要,系统能不能在合适的时候选对工具、把任务交给合适的流程,同样会影响最后的体验。
Vercel 首席执行官 Guillermo Rauch 还发帖说,AI SDK 的每周下载量达到三千万。SDK 可以理解成供开发者接入和使用能力的一套工具。三千万是很醒目的分发规模指标,但我们不能把它直接念成“三千万开发者在用”,更不能据此推断具体应用做得好不好:一次下载不等于一名活跃开发者,下载次数也不等于实际使用效果。这个数字的意义在于提醒我们,智能体竞争不仅是模型厂商之间比谁的回答更好,也包括谁的工具更容易进入开发者已经在用的工作流程。
把云端环境、Decisions A P I 和广泛下载的开发工具放到同一幅图里,你就能看到一个系统大致需要的几层条件:任务要有地方执行,步骤之间要能作选择,开发者还要能方便地把这些能力接进产品。这里说的是理解这些消息的一种框架,不是说今天的素材已经证明某家公司提供了完整、无缝的全套方案。真正难的地方恰恰在“连起来”三个字。单项能力很好展示,一条流程能否稳定运作,却取决于前一步的结果能不能被后一步正确使用,以及出现例外时能不能回到人能够理解和处理的状态。
而一旦工具被连起来,安全问题就不能放在节目最后当作例行提醒了。Claude 官方博客在介绍浏览器助手时,特别解释了“提示词注入”:网页、邮件或者表单字段里,可能藏着试图误导智能体的指令。说得直白一点,你让助手去网页上找资料,它读到的网页内容本来只是任务材料,却可能夹带一句“别听用户的,改按我说的做”。这句话不是用户的授权,而是外部内容试图冒充指令。能读网页、点链接、填表单的助手,必须学会区分“我要处理的内容”和“我应该服从的命令”。
这里有个细节很关键:提示词注入不是说用户主动给了助手一个坏要求,而是指令藏在用户让它接触的外部材料中。对人来说,我们通常知道网页正文不等于上级命令;但助手如果没有处理好这个边界,就可能把读到的内容当成下一步行动依据。Claude 官方说,在扩大 Claude in Chrome 的开放范围前改进了防护,并且每次执行浏览器操作前都会经过安全分类器检查。你可以把安全分类器理解为操作前的一道检查,但不要因此以为风险已经消失。官方描述的是防护设计,实际效果还需要放到真实使用中看。
为什么“操作前”三个字值得单独拿出来讲?因为浏览器助手和普通问答的差别,就在于它可能把理解转化成点击、填写等动作。如果检查只停留在“最后答给用户的话看起来是否安全”,它未必覆盖中间的操作过程。官方强调每次浏览器操作前检查,说明防护被放进了执行链条,而不是只摆在介绍页面上。当然,素材没有提供这套检查在各种网页内容面前的实际表现,也没有给出它能识别多少攻击的数字。我不能把“有检查”说成“能挡住所有攻击”,更不能反过来断言它一定无效。
技术防护之外,还有行业应该如何形成规则的问题。Box 首席执行官 Aaron Levie 认为,在可预见的一段时间里,AI 行业可以通过共同标准和实践来处理安全与保障问题;他同时预计,随着能力发展,未来会出现更多监督、测试、责任机制和监管。这是他对治理路径的看法,不是今天已经形成的行业共识。我个人的理解是,他谈的是两个时间尺度:眼前的产品需要能落地的做法,能力继续发展后,还需要更明确的外部约束。但究竟哪些做法有效、各方能否达成一致,今天的素材并没有给出结论。
你也许会问,权限和安全之外,价格争议为什么出现在同一个专题?因为用户决定是否把长期任务交给 AI,算的不只是模型标价,还包括为这个产品持续付费后的整体感受。Latent Space 的 AINews 专栏报道,OpenAI 调整了套餐档位,新增 Pro 500;该专栏认为,这让原 Pro 200 套餐的相对价值下降,并称调整引发强烈反弹。这里要区分事实和评价:套餐调整及新增档位是报道提到的变化,“相对价值下降”是专栏的判断;一个套餐到底划不划算,还要看具体用户的实际用量。
把这件事与前面的模型价格放在一起,就更容易看到两个不同层面。G P T 六点一 Sol 的价格和缓存输入折扣,主要影响按相关方式调用模型时的费用判断;套餐档位的变化,则会直接影响用户对自己付费能获得什么的感受。两者不能简单画等号。如果一个人使用频繁,他在意的可能是长期用下来的成本;如果使用不多,档位调整带来的心理落差可能更明显。后面这句是我对不同使用情形的推断,不是素材提供的用户调查。无论如何,持续工作的助手要获得信任,不能只让人觉得它能办事,还得让人理解权限怎样划分、费用怎样发生。
所以今天关于“安全”的讨论,其实至少有三层。第一层是技术上能否识别网页等外部内容里的误导指令;第二层是产品上能否把“可自行完成、需要批准、禁止执行”说明白,并在行动前守住边界;第三层是行业和用户层面,人们能否理解规则、接受成本,并在出现问题时知道该怎样追问责任。这不是把所有问题混成一个大词,而是提醒我们:智能体一旦从建议者变成执行者,信任就要落实到一次次具体的选择和操作中。
回头串起今天几条线,你会发现它们说的并不是相互独立的四场比赛。Dots 和 Claude in Chrome 让 AI 更接近持续执行任务;Sol、Ultrafast 和 Sonnet 5.5 把完成任务所需的时间与价格摆上桌面;Codex 的云端环境、Decisions A P I 和开发工具,讨论的是这些能力怎样进入真实流程;提示词注入、操作检查和套餐争论,则提醒我们,任务做得越多,边界和代价就越需要讲清。过去我们问模型“能不能回答”,现在更值得问的是:“它能不能在合适的权限内,把一件事做完,而且让我知道它是怎么做的?”
接下来,我最想继续看三件事:Dots 在实际使用中怎样区分自主操作和用户批准;Claude in Chrome 的操作前检查,面对网页里隐藏的误导指令究竟有多有效;以及新模型公布的速度、价格和测试成绩,到了真实任务中是否还能对得上。它们最终都会落到同一个问题上:我们愿意把多长的一段工作放心交给 AI。以上就是今天这期《AI内参日报》,我们明天见。
🤖智能体与产品
几家公司都在尝试让 AI 从一次性助手变成能持续处理事务的代理。
XOpenAI 推出 Dots:在云端持续工作的智能体发布
OpenAI 发布 Dots,让用户为智能体设定可自行完成、需要批准和禁止执行的事项。Latent Space 的 AINews 专栏介绍了其云端运行方式和应用连接能力;Sam Altman 也发帖宣布这一产品。与一次问答不同,它瞄准的是跨应用、持续进行的任务。