从智能驾驶看 Agent

发布日期
2026/06/22
主题
AI、Product Design
摘要
从智能驾驶的感知、决策与 SR 视图出发,讨论 Agent 如何展示能力边界、行动过程与人机信任。

之前做过智能驾驶的交互设计,现在接触 Agent 后发掘其中的相似性。

无论是控制物理实体的智能驾驶,还是操作数字环境的 Agent,均由感知、理解、决策、行动与反思五大环节构成。

感知层

  • 智能驾驶采集传感器点云与视觉图像
  • Agent 解析用户 Prompt、工程代码库、检索上下文与外部数据。

理解层

  • 智能驾驶进行目标识别与动态轨迹预测
  • Agent 意图识别、上下文关联、依赖关系建模、知识库检索

决策层

  • 智能驾驶计算变道、避让与制动路径
  • Agent 执行思维链推理(CoT)与任务分解。

行动层

  • 转向角度、油门开度、制动压力
  • 工具调用(API 请求、终端命令、文件改写、UI 点击)

反思层

  • 智能驾驶回传 Corner Case 训练数据
  • Agent 反思机制、短期/长期记忆、偏好对齐

SR 的意义

我在做智驾交互时曾和同事们讨论过 SR 视图的价值,当时我们推到了两个极端去思考这个问题。

  • 智驾能力很弱:驾驶者更多的是看路而非看屏幕,屏幕上显示的实时渲染画面对于驾驶者来说没有价值
  • 智驾能力很强:驾驶者可以做更多的娱乐(就像我们曾对副驾屏这个形态产生的疑惑一样“为什么我不玩手机呢?”)而不用紧盯着屏幕

最后我们的结论是,SR 主要体现的是

  1. 戳破黑盒、了解边界:
    • 人需要知道机器到底看见了没有、打算干什么,从而决定”这一刻我该信它,还是该准备接管”。​
  2. 信息降噪、情绪价值:
    • 它把复杂的道路信息做了很大程度的简化,只去渲染重要的信息,只去声明他当前以及下一步将要做的动作

当然,也会有代价,用户的负担。实测研究发现人们在面对几种不同的观察路面的方式,去处理紧急情况时,SR 的的关注次数最多、接管时间最长,因为人们需要去花费脑力去翻译这个渲染画面。

回看 Agent

当前 AI Agent 界面设计正在重演智能驾驶的交互演进路径。Agent 的「SR 视图」体现为思维链展示、终端操作日志、工具调用序列以及代码 Diff 预览。

  1. LLM能力极低时:人类必须逐行审查 CoT 与终端命令,监督成本超过直接编写代码或手动调用的成本。
  2. LLM能力极高时:Agent 具备全局可靠性,用户采用异步交付模式,仅需消费最终产物,无需了解中间过程。
  3. 能力过渡期(现状):系统处于半自主状态,人类承担「实时监督者与应急接管者」的角色。

场景的区别

但是我想还是有区别的。 人类的价值

  • 在智能驾驶时人类需要介入是因为安全保障。
  • 在与 Agent 协同过程中,人类介入的目的在于通过适时干预引导 Agent 生成符合预期的结果 信息披露的不同
  • SR 的披露是可以不那么全面,因为用户不需要屏幕提供全部信息,屏幕只需要提供”路面之外”的那部分——机器的状态和意图。我有写一篇聊这件事[[AI 是否正模糊了创作与消费的边界?]]
  • 而 Agent 信息的披露是唯一的窗口,搜到了什么、读了哪些文件、改动了哪里他只存在信息里,用户没有挡风玻璃外的世界参照。