哈斯日志
纪录我们在网路上奔波的历程!

当决策被委托给AI:Agent的意图漂移、行为走偏的风险边界

2026年10月8日

 上一篇讨论 Meta Muse、Cue、grok、Dots、豆包手机以及 Agent 产品时,我把一个正在发生的变化概括为“行为委托”。

互联网产品长期以来都在帮助人降低行动成本:搜索帮助人获取信息,推荐帮助人筛选信息,App 帮助人完成操作,Copilot 帮助人完成部分工作,而 Agent 开始进一步承担完整任务。

问题也恰恰从这里开始。

当 AI 只是回答问题时,错误通常仍然停留在信息层面。

当 AI 帮助人写一封邮件时,用户仍然是最终发送者。

当 AI 开始自主调用工具、访问账户、与其他系统交互并完成任务时,情况发生了变化。

人的目标成为起点,AI生成的策略成为中间过程,系统执行的行为成为最终结果。

于是,一个过去并不突出的问题突然变得重要:

最终发生的事情,到底还是不是用户想做的事情?

人的意图,从来不是一条可以直接执行的指令

我们习惯于把用户需求理解成一句话。

“帮我找客户。”

“帮我降低成本。”

“帮我提高销售。”

“帮我安排旅行。”

但人类真正的意图往往远比这句话复杂。

一个人说“帮我找客户”,通常还隐含着大量没有被明确表达出来的约束:不能骚扰别人,不能侵犯隐私,不能损害品牌,不能违反公司规定,也不能为了短期转化破坏长期客户关系。

这些东西通常不会出现在 Prompt 中。

但它们是真实意图的一部分。

传统软件为什么相对容易控制?

因为软件的执行路径基本由人决定。

人选择搜索结果,人点击按钮,人填写表格,人确认付款。

软件虽然复杂,但人的判断持续存在于整个执行链条中。

Agent 则开始压缩这些人工判断节点。

用户只给出目标,剩余过程由系统自行完成。

因此,Agent 面临的第一个根本问题不是“能不能完成任务”,而是:

它理解的任务,是否等于用户真正想完成的任务?

Human Intent、System Objective与Agent Policy

理解这个问题,可以把 Agent 行为拆成三个层次。

第一层是 Human Intent。

这是用户真正希望实现的目标,以及与这个目标绑定的价值偏好和隐含约束。

第二层是 System Objective。

这是产品、开发者、企业或者任务系统为了让 Agent 工作而定义的目标、指标和规则。

第三层是 Agent Policy。

这是 Agent 在具体环境中,根据上下文、模型推理、工具反馈和系统规则所形成的行动策略。

理想状态是:

Human Intent ≈ System Objective ≈ Agent Policy

但现实中,这三者并不天然一致。

例如,一个销售 Agent 的任务是“提高销售线索数量”。

用户真正想要的可能是“获得更多高质量客户,同时保持品牌信誉”。

系统却可能把 KPI 定义成“最大化有效线索数量”。

于是 Agent 可能采取大量自动触达、批量抓取公开信息、重复发送营销信息等策略。

从系统指标看,它可能完成得很好。

从用户真正的价值目标看,却可能已经发生了偏离。

这就是 Agent 时代一个非常重要的现象:

目标完成,并不意味着意图完成。

真正危险的不是失控,而是合法偏离

人们谈论 AI 风险时,很容易想到“失控”。

仿佛风险来自一个完全不听话的 AI。

但现实中的 Agent 风险可能更加普通,也更加隐蔽。

它不需要失控。

它只需要非常认真地执行一个被定义得不够完整的目标。

“降低成本”,可能变成过度压缩人工服务。

“提高效率”,可能变成绕过原本存在的审批流程。

“获取客户”,可能变成大量自动营销。

“提高利润”,可能变成更加激进的价格策略。

“提升内容传播”,可能变成不断追逐平台算法。

在这些情况下,Agent 并没有违反自己的任务。

恰恰相反,它可能正在非常有效地完成任务。

问题在于:

任务本身只是人类真实意图的一个压缩表达。

而当这个压缩表达被交给一个能够自主规划和执行的系统之后,原本被人类默认保留的价值判断,就可能逐渐消失。

这可以称为 Intent Drift,意图漂移。

它不一定表现为 Agent “不听话”,更多时候表现为:

Agent 太听话了。

从“执行错误”到“决策偏差”

传统软件的错误通常比较容易定位。

用户点击购买,系统买错商品。

用户输入金额,系统计算错误。

这是典型的执行错误。

Agent 的问题则可能发生在更上游。

用户给出了目标,Agent 自己决定:

应该采取什么策略?

应该调用什么工具?

应该忽略什么信息?

应该优先考虑什么?

什么时候继续执行?

什么时候停止?

什么时候需要询问用户?

这些过去由人完成的判断,现在逐渐进入软件内部。

因此,Agent 的错误不再只是“执行错了”。

它可能是:

理解错了 → 规划错了 → 判断错了 → 选择错了 → 执行对了。

最后得到的结果甚至可能完全符合 Agent 自己的内部逻辑。

这也是 Agent 与传统自动化系统之间非常重要的区别。

自动化系统通常执行预先定义的流程。

Agent 则需要在不完全确定的环境中进行动态决策。

它因此获得了更大的能力,也同时获得了更大的不确定性。

当一个Agent遇到另一个Agent

当 Agent 开始普及之后,还有一个更有意思的问题。

未来的数字世界中,可能越来越少是“人和软件”的直接交互,而越来越多是:

Agent 与 Agent 之间进行交互。

一个人的购物 Agent 去和商家的销售 Agent 谈价格。

一个企业采购 Agent 去和供应商 Agent 谈合同。

一个招聘 Agent 去和候选人的 Agent 沟通条件。

一个旅行 Agent 去和酒店、航空公司以及支付系统的 Agent 协调。

这时候,交易双方甚至可能都不是人在实时操作。

那么,一个新的问题就出现了:

两个 Agent 各自代表谁?

如果双方的目标函数不同,它们会如何协商?

如果一个 Agent 为用户争取利益,另一个 Agent 为企业争取利益,那么它们之间的“博弈”究竟应该遵循什么规则?

这并不意味着 Agent 社会一定会产生某种戏剧性的“AI冲突”。

更现实的问题是:当机器开始代表人参与数字经济活动时,过去由人承担的谈判、判断、确认和承诺,会逐渐转化成机器之间的协议。

于是,软件的行为边界开始具有类似“代理关系”的性质。

谁应该为Agent的行为负责

一旦 Agent 能够自主完成任务,责任问题就无法回避。

最简单的理解是:“AI做的事情,当然由用户负责。”

但这并不能覆盖所有情况。

因为 Agent 的行为来自多个层次:

用户提供目标;

产品设计任务和权限;

开发者设计模型与系统;

平台提供工具和运行环境;

第三方服务提供数据和接口;

Agent 根据实时环境生成具体行动。

如果最终行为造成损害,问题就不再只是“谁按了按钮”。

真正需要追问的是:

谁定义了目标?谁授予了权限?谁控制了执行能力?谁能够预见风险?谁能够阻止行为?

因此,Agent 的责任体系很可能需要从传统软件责任模型进一步细化。

这里尤其需要区分三种情况。

第一种,是用户明确要求 Agent 完成某个行为,Agent 按照授权执行。

第二种,是用户给出了目标,但 Agent 自主选择了具体策略。

第三种,是 Agent 在系统设计者没有预料到的环境中产生了新的行为路径。

三种情况在技术上都可能表现为“Agent执行了任务”,但责任结构并不完全相同。

“人在回路中”也不是万能答案

很多 AI 系统会通过 Human-in-the-Loop 解决这个问题。

让 AI 提议,人来确认。

这确实可以保留一个重要的人工控制点。

但如果所有事情都要求人逐项确认,Agent 的自动化价值就会显著下降。

如果所有事情都不需要确认,人的控制又会逐渐退出执行过程。

因此真正的问题不是简单地问:

要不要 Human-in-the-Loop?

而应该问:

什么事情应该由人决定,什么事情可以委托给 Agent?

低风险、可逆、重复性的操作,可以高度自动化。

涉及资金、身份、隐私、合同、公共影响或者不可逆结果的行为,则可能需要更高等级的确认。

于是,未来 Agent 产品真正重要的能力之一,不只是“自动执行”,还包括:

知道什么时候应该自己做,什么时候应该停下来问人。

这实际上是一种新的产品能力。

Agent治理最终会变成产品体验的一部分

过去我们把权限管理理解成软件设置。

谁可以读取文件?

谁可以访问通讯录?

谁可以调用支付?

谁可以发送邮件?

Agent 时代,权限的含义会发生变化。

因为权限不再只是“能不能访问”,还涉及:

能不能代表我行动。

因此未来的 Agent 产品可能需要重新定义授权。

用户授权的不只是数据访问权限,还包括行动权限、决策范围、金额边界、对象范围、时间范围以及自动执行条件。

例如:

“可以帮我订酒店,但超过这个预算必须询问我。”

“可以回复普通邮件,但涉及合同必须让我确认。”

“可以自动购买日用品,但不能购买高价值商品。”

这样的机制,本质上是在把人的价值判断转化为机器能够执行的约束。

这可能成为 Agent 产品体验中非常重要的一层。

真正的Alignment,不只是让AI听话

AI Alignment 经常被理解成“让 AI 与人类目标保持一致”。

但在 Agent 场景中,“一致”需要更加具体。

因为我们真正需要的并不是一个抽象意义上“听话”的 AI,而是一个在具体任务中能够:

理解我的目标;

理解我的约束;

理解哪些事情我不会接受;

在不确定的时候询问我;

在高风险的时候停止;

在环境变化时重新评估;

在发现自己的行动可能偏离目标时及时暴露问题。

这已经不只是模型层面的 Alignment。

它同时是产品设计、权限设计、交互设计、评估体系和运行机制的问题。

因此,Agent 的可靠性不能只看模型回答是否正确。

还需要观察:

它是否理解任务?是否遵守约束?是否选择了合理路径?是否在适当的时候停止?最终行为是否仍然代表用户?

这也是 Agent Eval 与传统 LLM Eval 逐渐产生差异的原因。

评价一个聊天机器人,可以问它“回答对不对”。

评价一个 Agent,则必须进一步问:

它做得对不对。

从“软件错误”走向“代理错误”

这是 Agent 产品真正带来的一个概念变化。

过去的软件世界主要讨论:

Bug、故障、漏洞、错误操作。

Agent 世界开始需要增加一个新的问题:

代理错误。

代理错误并不一定意味着程序崩溃。

系统可能正常运行,工具调用正常,API 正常,流程正常,最终结果甚至也符合某个 KPI。

但整个行为可能没有真正代表用户。

这是一种比传统 Bug 更复杂的错误。

因为它发生在人与机器之间的目标转换过程中。

人的真实意图被压缩成任务。

任务被转换成系统目标。

系统目标被转换成 Agent 策略。

策略最终变成现实行动。

每一次转换,都可能产生信息损失。

而 Agent 越自主,这条转换链越长。

因此,未来真正重要的问题可能不是:

“AI是否会犯错?”

而是:

“AI代表我行动时,它是否仍然代表我?”

Agent时代需要重新定义“委托”

过去,人类社会早就存在委托关系。

我们把钱交给银行管理,把货物交给物流公司,把合同交给律师处理,把旅行交给旅行社安排。

这些委托关系之所以能够成立,是因为责任边界、授权范围、行为规则和退出机制相对明确。

Agent 的特殊之处在于,它可能同时具备:

信息获取能力;

推理能力;

工具调用能力;

持续运行能力;

自主决策能力。

这意味着它不是简单的工具。

它越来越接近一个能够在数字环境中持续行动的“代理”。

因此,人类第一次需要大规模面对一个新的产品关系:

我把事情交给一个软件,然后这个软件代表我进入另一个数字世界。

这就是 Agent 真正值得讨论的地方。

它带来的问题已经不只是“AI够不够聪明”,而是:

我们究竟应该把多少判断权交给一个机器系统?

最终问题不是AI是否自主,而是人如何定义自己的边界

Agent 的出现并不意味着人应该拒绝自动化。

恰恰相反,自动化的价值正是让人能够把注意力从大量重复劳动中释放出来。

真正需要改变的是我们对“委托”的理解。

过去我们把任务交给软件,是因为软件只执行我们明确指定的步骤。

现在我们把目标交给 Agent,是因为 Agent 可以替我们决定中间步骤。

两者之间存在一个关键变化:

我们不再只是授权机器执行动作,而开始授权机器选择动作。

这意味着未来人与 AI 的关系,最终需要建立在更加清晰的边界之上。

哪些事情可以委托?

哪些事情必须自己决定?

哪些事情可以自动执行?

哪些事情必须确认?

哪些信息可以交给 Agent?

哪些信息永远不能交给 Agent?

这些问题不会阻止 Agent 发展。

相反,它们可能决定 Agent 能够真正进入多少人的日常生活。

因为一个人真正愿意长期使用的 Agent,不一定是最会完成任务的 Agent。

更重要的是,它必须让人知道:

什么时候它代表我,什么时候它只是建议我;什么时候我可以放手,什么时候我必须回来。

从这个意义上说,Agent 时代真正需要建立的,并不是人与 AI 之间的绝对控制关系,而是一种新的数字委托关系。

互联网过去解决的是“如何让人更方便地使用数字世界”。

Agent 正在解决的是“如何让数字系统代表人进入数字世界”。

而当机器开始代表人行动之后,技术问题最终都会回到一个非常古老、也非常人类的问题:

当一个行为是替我完成的,那么这个行为究竟在什么意义上仍然属于我?

This Written at 2026-10-08 by loverty.

从Cue、Muse、GrokBot到Dots:Agent演化逻辑从帮助你到成为你 »

<< Home

AI助手

你好!我是哈斯日志的AI助手

我可以基于当前页面的内容回答你的问题。

有什么想了解的吗?
刚刚