首页 > 教程攻略 > ai资讯 >车载AI Agent产品开发:如何通过大模型实现“座舱代言人”?

车载AI Agent产品开发:如何通过大模型实现“座舱代言人”?

来源:互联网 时间:2026-08-26 21:51:12

佐思汽研发布了《2024年车载AI Agent产品开发与商业化研究报告》。这份报告里提到了一个很有意思的观点:如果把OpenAI对AI的五个级别划分作为标尺,那么AI Agent恰好站在第三级的位置。

OPEN AI对AI的分类方式

来源:OPEN AI

话说回来,2023年火得一塌糊涂的大模型,受限于交互方式和工具调用能力,最多也只能摸到L2推理者的门槛。对比之下,把车载Agent作为发展汽车AI体系的一个主攻方向,就显得格外合理了。Agent最核心的竞争力在于,能通过主动智能和各类工具、大模型的调用,把大模型在真实场景里那些“掉链子”的地方补上,从而让座舱的智能化水平再上一个台阶。

Agent是情感座舱代言人

“情感座舱”这个概念喊了也有年头了。其实,真正让“情感座舱”落地,靠的还是大模型上车。在此之前,语音助手只能在触发特定条件后,从预设的情感语料库里翻出几句台词跟你聊天,但在真实的对话场景里,几乎没法跟上人类的聊天逻辑。车载Agent上车之后就不一样了。它集成了多个大模型底座,对环境的识别更精准,工具库接口也更多,泛化能力大大增强。这样一来,它就能应付各种复杂场景下的聊天问答,真正扮演起那个提供温暖陪伴的“座舱代言人”。

部分Agent在不同场景下的情感关怀示例

整理:佐思汽研

目前主流的情感交互场景设计,重点都放在了情绪识别、用户记忆和行为编排这几个领域。一些主机厂和Tier1也拿出了能提升Agent情感价值的技术或产品。

部分主机厂、Tier1的Agent情感技术/产品

整理:佐思汽研

以小爱同学为例,它的“情感对话系统”构建包括三个步骤:

小爱同学“情感对话系统”构建步骤

整理:佐思汽研

混合策略疏导模型包含情感状态增强编码器、混合策略学习模块、多因素感知解码器三个重要组件

来源:小米

马耳他大学数字游戏研究所则提出了一个情感框架,在训练过程中引入行为奖励和情感奖励机制,帮助Agent更好地理解人类的情绪,实现更自然的交互。

基于情感奖励的情感框架

来源:马耳他大学数字游戏研究所

提升用户体验需要解决的痛点

想象一下,智能座舱不仅能听懂并执行你的指令,还能主动预测你的需求,像个贴心的私人助理。比起买了传统车还得自己挨个摸索功能,谁不想要一个“动动嘴”就能搞定一切的座舱“代言人”呢?Agent主打的就是个省时省事。

理想同学对车主景点推荐需求的响应(被动推荐)

来源:理想

尽管现在市面上已经上车的Agent,大部分还停留在助手、陪伴以及罗列具体场景功能的阶段。但和大模型相比,Agent的潜力无疑更大。它那种可以激发的自主性和突出的工具使用能力,让它更符合“主动智能”这个标签,甚至能弥补大模型在实际应用中的种种限制。

大模型与Agent的部分区别

整理:佐思汽研

不过,要想让车载Agent真正做到“主动智能”、让用户体验到真正的价值,技术上的路还很长。Agent必须在主动感知、数据处理、状态识别这些环节上做得更精确,准确理解环境,判断车内人的真实需求,再根据不同环境采取不同策略。这其中,最大的难点之一就是Agent对用户需求的准确判断。和被动交互不同,主动意图识别没有直接的语音指令,在识别环境、人员、车辆状态时,未必能通过向量特征匹配找到和当前场景高度相似的描述,预设的方案也未必符合车内人员的真正意图。

主动推荐动作的生成示意图

来源:佐思汽研

目前,很多推荐功能只是执行预设的指令,这反而限制了Agent的“主动智能”能力,导致推理环节常常出现痛点。比如,Agent如果不能准确理解当前场景,就可能做出不合预期的推荐——在错误的时间推荐音乐或导航。结果就是影响用户体验,让Agent在用户眼中成了个“猜测机器”。

Agent“无效推荐”案例1

Agent“无效推荐”案例2

整理:佐思汽研

此外,Agent在接收语音指令的感知环节也有不少痛点。根据佐思汽研的不完全统计,车主使用车载Agent时,提到频率最高的痛点主要是唤醒失败、识别错误和误唤醒。

不完全统计下的车载Agent使用痛点分析

整理:佐思汽研

在统计的120个痛点案例中,唤醒失败、识别错误、误唤醒的提及频率分别达到19、18、17次,占比分别为16%、15%、14%。其他痛点还包括不支持可见可说、不识别方言、延迟响应、不支持语义澄清、不支持连续指令等,总计89个语音环节的痛点,占本次统计调研的74.2%。

另外,Agent架构或场景设计不合理也会带来问题,比如场景触发条件不准确、大模型需要二次唤醒、长短期记忆失效、根据车主习惯做出的推荐动作不符合预期等。这些问题的背后,指向的是Agent在场景设置、架构部署、记忆模块、反思模块上的局限性。

总结一下,用户的痛点多集中在感知和推理这两个环节:

  • 感知:

    “叫不醒”(唤醒失败)、“瞎回答”(误唤醒)、“听不懂”(识别错误)、“啥也不会”(不支持可见可说)、“耳背”(延迟响应)等。
  • 推理:

    “睁眼瞎”(物体识别错误)、“乱推荐”(自主推荐不符合用户预期)等。

快速响应的多Agent框架

为了让“代言人”在座舱里实现全方位的功能,Agent在多元化场景下的服务框架设计变得至关重要。Agent框架的构建方式很灵活,可以是最简单的“接收器+执行器”架构,也可以构建更复杂的多智能体架构。设计原则其实很简单:只要在特定场景下能解决用户问题,那就是好框架。作为一个合格的“座舱代言人”,车载Agent除了要像一个独立思考的个体自己做决定、解决问题外,还得像人一样,快速、自然地采取人类的行为模式。

蔚来的Nomi就是个典型案例。它采用了多智能体架构,在不同场景下调用不同工具,由多个分工明确的Agent各司其职,共同完成理解需求、决策裁决、执行任务、反思迭代的完整流程。多智能体架构让Nomi不仅能快速响应,还能做出更像人类的自然反应,与汽车的其他功能无缝融合,让体验更加流畅。

蔚来Nomi Agent采用多智能体架构

来源:蔚来

相比单Agent系统,多Agent系统更适合执行复杂指令。它就像一个小型社区,每个“Agent”都有自己的任务,但又可以协作完成更复杂的工作。比如,一个Agent负责理解你的指令,另一个负责决策,还有专门的Agent去执行任务。这种设计让车载AI Agent系统更灵活,能处理更多样化的任务。澳大利亚联邦科学与工业研究组织(CSIRO)就提出过一种同时采用协调Agent和执行Agent的多Agent系统:

一种多Agent系统框架示例

来源:CSIRO

整个Agent框架分为6个模块:感知交互模块、推理模块、工具使用模块、多Agent协作模块、反思模块以及价值对齐模块。这几乎囊括了主流的Agent设计模式,覆盖了从主动感知、推理决策、工具调用到生成执行、反思迭代并与人类价值对齐的完整流程。这个框架的特点是引入了多Agent系统,由不同的Agent分别扮演分发、决策、执行的角色,可以充分发挥各自的优势,提升任务执行的效率。

此外,在多元化场景下,Agent的部署方式和工具调用能力也直接影响着用户需求的执行速度和准确性。还是以蔚来Nomi为例:

Nomi Agents分别在端侧和云端部署。端侧搭载端侧模型,与SkyOS深度融合,能及时调用原子能力,进行跨域资源调度,加快响应速度;云端搭载Nomi GPT,连接更多云端工具资源接口,进一步加强了Nomi Agents的工具调用能力。Nomi Agents架构布置在SkyOS中间件层,通过与SkyOS的结合,调用原子API、硬件/软件、数据的过程更加自然协调,也更加迅速。

Nomi Agents在SkyOS中的布置

来源:蔚来