过去几年,大模型行业一直围绕一个问题不断向前推进:如何让模型变得更聪明。更大的参数规模、更长的上下文窗口、更强的推理能力、更快的响应速度、更低的推理成本,构成了这一轮人工智能技术竞争最重要的主线。 但到了9月份至今,产品形态正在发生一个值得关注的变化。Cue、Muse、GrokBot以及OpenAI刚刚推出的Dots,都开始明显摆脱传统Web聊天产品的形态。它们越来越重视桌面应用、手机应用、后台运行、长期记忆、跨应用操作和持续执行。这些智能体后端甚至专门构建了运行Agent和用户数据的安全虚拟机;OpenAI则将Dots定义为可以持续运行、主动完成多步骤工作的Agent。 表面上看,这是AI产品从浏览器走向桌面APP+手机APP协同,手机APP更像遥控器,桌面app则成为任务、上下文数据处理、调度和云端计算资源的协调中心。 但真正发生变化的并不是入口,而是交互模型。 过去是: 用户提出问题 → AI回答 → 用户继续操作。 现在正在变成: 用户提出目标 → Agent接受任务 → Agent持续执行 → 用户在需要的时候查看结果。 AI正在从“回答问题”,转向“替你完成事情”。 这可能是大模型产品从聊天时代进入Agent时代之后,最重要的一次产品范式变化。 Agent需要的不是更大的上下文,而是持续存在的状态这是一个很重要的变化。 传统AI的上下文,主要来自用户在一次交互中主动提供的信息。Agent的上下文,则越来越来自用户真实的工作环境。 Agent的上下文,则越来越来自用户真实的交互工作运行环境。 用户打开了哪些文件,最近修改了什么文档,参加了什么会议,收到哪些邮件,浏览了哪些资料,正在推进什么项目,这些信息共同构成了一个动态状态。 因此,Agent真正需要解决的并不是简单的“上下文窗口越来越大”,而是: 如何持续知道用户所处的状态。 这也是桌面应用和手机应用突然变得重要的原因。 浏览器中的AI需要等待用户打开网页、输入问题。 而一个真正运行在桌面或手机上的Agent,可以在获得授权之后持续连接用户的文件、应用、日历、消息和任务。 Cue Desktop已经允许Agent在Mac本地运行代码、访问终端和管理本地Agent;Meta的Muse则可以在获得授权后处理文件、Messages、Calendar和Notes。 这意味着AI开始从一个“被打开的应用”,变成一个“持续存在的工作环境”。 为什么桌面和手机突然变得重要这并不只是因为App比Web更好用。 更深层的原因是,Agent需要进入用户真实的数字环境。 一个人真正的数字生活从来不只发生在浏览器里。 它分散在: 文件系统 邮件 日历 即时通信 Office 浏览器 IDE 照片 笔记 各种专业软件
传统聊天机器人只能等待用户把这些信息复制给它。 Agent则希望直接获得经过授权的访问能力。 于是桌面应用的重要性就出现了。 它可以成为一个连接层,把原来彼此分散的信息和操作环境连接起来。 因此,今天很多AI公司突然“偏执”地做桌面App,并不只是为了获得一个新的用户入口。 它们真正需要的是: 进入用户工作的现场。 本地与云端的分工也正在发生变化这又带来了另一个变化。 如果Agent要处理越来越多的个人信息,就不可能把所有原始数据都毫无选择地上传到云端。 文件、邮件、聊天记录、代码、浏览内容甚至个人生活信息,都可能包含敏感数据。 因此未来更合理的架构很可能不是“全部本地”或者“全部云端”,而是本地与云端之间形成更加明确的分工。 本地负责: 数据发现 权限控制 隐私过滤 上下文预处理 本地文件操作 敏感信息识别
云端负责: 大规模推理 长时间任务 高算力处理 多模型协作 大规模搜索 复杂任务执行
Meta的Muse已经非常明确地采用了这种思路:Agent运行在独立的Secure VM中,用户数据和服务凭据也被隔离在这个环境中,并通过独立的安全机制控制其访问互联网的行为。 这说明Agent产品开始面对一个过去聊天机器人并不需要面对的问题: AI不仅要回答问题,还要拥有一台“可以替用户工作的电脑”。 用户说什么,正在变得不如用户做什么重要这是Agent时代另一个容易被低估的变化。 传统模型主要理解用户说了什么。 Agent开始理解用户正在做什么。 例如一个用户说: “我要写董事会报告。”
聊天机器人得到的是一句话。 Agent可能同时看到: 最近修改的PPT、财务数据、相关邮件、最近参加的会议以及正在推进的项目。 于是“我要写董事会报告”不再只是一个Prompt。 它成为一个工作状态的入口。 这意味着未来AI理解人的方式会发生变化: 从理解语言, 逐渐走向理解行为。 语言仍然重要,但行为提供了更多真实信息。 一个人说自己重视什么,与一个人长期实际做什么,并不总是一致。 对于Agent而言,后者可能更有价值。 从个人记忆到个人数字分身当Agent长期观察一个人的工作方式之后,它自然会积累越来越多的信息。 它知道: 你喜欢什么样的表达方式 你通常如何做决策 你如何组织文件 你习惯什么时候处理邮件 你过去如何解决类似问题 哪些事情通常需要你亲自确认
这些信息逐渐形成一个越来越完整的个人行为模型。与静态画像和静态文件数据相比,基于认知、决策、行动偏好的抽象和建模,更有价值。 于是一个有趣的变化出现了。 Agent不再只是“记得你说过什么”。 它开始“知道你通常会怎么做”。 这就是数字孪生真正有价值的地方。 但这里也存在一个更深的问题: 它究竟是在重放你,还是你开始重复它? 最开始,是Agent学习你。 它根据过去的行为模仿你。 后来,你开始参考Agent。 它告诉你过去类似的问题是怎么处理的。 再后来,Agent开始参与决策和执行。 你的行为影响Agent,Agent的建议又反过来影响你的行为。 于是形成一个循环: 你 → Agent → 你 → Agent。 到这个阶段,所谓“数字分身”已经不是简单复制一个人。 它开始成为人的认知和行动的一部分。 这可能是Agent真正值得关注的长期变化。 从同步回答到异步委托如果说上下文变化解决的是“Agent如何理解你”,那么异步执行解决的就是“Agent如何替你工作”。 今天的AI交互仍然非常强调即时反馈。 用户提出一个问题。 然后等待模型回答。 但现实中的工作很少如此。 一个任务可能需要几十分钟、几个小时甚至几天。 它可能需要: 搜索资料 分析文件 调用多个工具 修改文档 等待外部信息 进行多轮验证
这类任务没有必要要求用户一直守着聊天窗口。 更合理的模式是: 提出需求 → Agent开始工作 → 用户离开 → Agent完成 → 主动通知。 OpenAI的Dots正是沿着这个方向设计的:它可以持续运行,接受用户交代的项目和任务,并在需要用户介入时再寻求确认。Meta的Muse同样强调可以在App关闭后继续处理任务。 这意味着AI第一次真正接近了“后台工作”。 用户不再需要陪着AI完成任务。 AI开始陪着用户完成任务。 Agent开始拥有自己的任务队列异步执行继续发展,就会产生一个非常自然的结果: Agent需要管理任务。 什么事情正在做? 什么事情等待执行? 什么事情已经完成? 什么事情需要用户确认? 什么事情因为外部条件发生变化而暂停? 这时候Agent的内部运行逻辑已经越来越不像聊天机器人,而更像一个持续运行的任务系统。 它需要: 任务管理、状态管理、调度、权限、依赖关系、异常处理和结果通知。 因此,Agent真正成熟之后,用户看到的可能仍然只是一个聊天界面,但背后运行的已经是一个复杂的任务执行系统。 这也是为什么Agent产品的评价标准会逐渐变化。 过去我们问: 它回答得准不准? 未来可能更关心: 它能不能把事情做完? 从对话驱动走向事件驱动这一步再往前,就会出现更大的变化。 传统聊天产品必须等待用户发起请求。 成熟的Agent则可以开始等待事件。 例如: 合同还有七天到期。 项目进度连续三天没有变化。 某个客户回复了邮件。 某项指标出现异常。 一个任务已经满足下一步执行条件。 Agent不需要等用户重新打开聊天框。 它可以主动触发任务。 这意味着AI开始从“对话驱动”走向“事件驱动”。 它不再只是回答: “你问我什么?”
而开始处理: “现在发生了什么?”
以及: “接下来应该做什么?”
这也是Agent与传统聊天机器人之间真正的分水岭。 Agent也不一定亲自完成所有事情还有一个容易被忽略的变化。 未来的Agent不一定需要自己完成所有工作。 它可能根据任务选择不同的模型、工具和执行环境。 一个模型负责搜索。 另一个模型负责分析。 另一个模型负责代码。 本地模型处理敏感数据。 云端Agent负责长时间执行。 Agent真正承担的角色,就从“一个模型”变成了“一个任务协调者”。 用户不需要知道背后调用了几个模型。 就像今天用户使用搜索引擎时,不需要知道背后运行了多少台服务器。 用户只需要告诉系统: 我要完成什么。 至于谁来完成,Agent负责决定。 AI的价值开始从Token转向结果这也是商业模式正在发生变化的地方。 过去AI产品很容易围绕: Token数量 上下文长度 模型等级 推理次数 API调用量
建立商业模式。 但这些指标并不是用户最终关心的东西。 一个企业真正关心的是: 报告有没有完成? 代码有没有交付? 客户有没有跟进? 问题有没有解决? 流程有没有跑通? 成本有没有下降? 因此Agent时代真正有意义的指标,很可能从“模型用了多少Token”,逐渐转向“任务完成了多少”。 这意味着AI商业模式可能从模型能力订阅,逐渐走向结果和工作价值。 用户购买的不是更多的计算。 而是更少的工作。 竞争正在从模型能力转向工作入口因此,Cue、Muse、GrokBot、Dots这些产品值得关注的地方,并不是它们又推出了一个新的AI App。 真正值得关注的是: AI开始争夺用户真实工作的入口。 过去,互联网产品争夺的是流量入口。 移动互联网产品争夺的是应用入口。 搜索引擎争夺的是信息入口。 而Agent开始争夺的是: 任务入口。 用户不再需要自己打开十几个应用寻找下一步应该做什么。 他只需要提出一个目标。 Agent负责理解目标、寻找信息、调用工具、执行任务并返回结果。 软件开始围绕“用户要完成什么”重新组织。 而不是让用户自己理解“应该打开哪个软件”。 Agent最终改变的,可能不是软件,而是人与软件的关系过去几十年的软件发展史,本质上是不断要求人学习软件。 人需要知道: 哪个菜单在哪里。 哪个按钮应该点击。 哪个系统负责哪项工作。 不同软件之间如何切换。 Agent出现之后,这种关系可能逐渐反过来。 人表达目标。 Agent理解目标。 Agent调用软件。 Agent处理数据。 Agent完成任务。 人只在关键节点进行确认。 这意味着软件的复杂性开始被Agent吸收。 用户不需要学习所有工具。 Agent替用户理解工具。 这才是从Chat到Agent真正深刻的变化。 从“第二个自己”开始重新理解Agent如果沿着这条路径继续往下推演,最终会出现一个非常有意思的问题。 一个真正长期工作的Agent,会越来越了解一个人。 它知道你的过去。 理解你的习惯。 知道你的工作。 参与你的决策。 替你执行任务。 甚至在你没有打开它的时候仍然在工作。 那么它到底是什么? 它不是简单的聊天机器人。 也不是传统意义上的软件工具。 它更像一个持续存在的“第二个自己”。 但这个第二个自己又不是静态复制。 最开始,是它学习你。 后来,是你参考它。 再后来,是你们共同形成新的行为模式。 所以Agent时代真正值得关注的,不只是AI会不会替我们完成工作。 更重要的问题是: 当一个Agent越来越像你,并越来越多地替你行动时,你与它之间的边界会发生什么变化? 这可能才是Cue、Muse、GrokBot、Dots这些产品背后真正值得观察的长期变量。 从这个意义上说,Agent并不是聊天机器人的又一次升级。 它正在把人工智能从一个“你主动打开并向它提问的工具”,变成一个“持续存在、理解你的状态、接受你的委托并主动完成工作的伙伴”。 而这也意味着,大模型时代下一阶段真正的竞争,可能已经不再是谁的模型更大、回答更快。 而是谁能够更好地理解一个人正在做什么,并最终真正替这个人把事情做好。 这才是Agent、智能从高大上的科技变得对普通人更有用的时代真正开始的地方。 如果你还是觉得这些AI好厉害,但你又不编码,没啥任务值得每个月$20/¥150元,那是另一个话题,智能能不能便宜人人可得无处不在。 |