首页 > 教程攻略 > ai资讯 >字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互

字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互

来源:互联网 时间:2026-08-05 14:21:10

8月5日,字节跳动正式端出了原生音视频全双工大模型SeedRealtime,并且已经在豆包App全量上线。用户把豆包更新到最新版本后,就能通过“打电话”功能进入视频通话界面,体验实时音视频AI交互——说白了,就是边看、边听、边聊。

字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互

SeedRealtime采用统一端到端架构设计,原生融合了音频、视频和文本三种模态。这意味着模型能在连续的多模态信息流中,同步完成感知、理解、决策与表达,真正实现“边看、边听、边说”的实时交互。与传统上依赖ASR、视觉模型、TTS等多个模块串联的级联系统相比,它减少了多模块带来的延迟和信息损耗,也不再用外部VAD来判断轮次——整个交互过程更流畅、更自然。

字节方面透露,SeedRealtime主要实现了三项核心能力:音视频联合理解、主动交互能力,以及更自然的对话节奏。简单来说,模型能结合画面、声音和时序信息来理解用户的意图。比如,它可以通过视觉信息消除同音词的歧义,识别用户的手势和指代对象,还能持续跟踪画面变化,在目标出现时主动提醒用户——这就不再是那种“你问一句、它答一句”的被动式对话了。

在最新展示的多个应用案例中,SeedRealtime的表现相当亮眼:在多人聚会场景中,它能识别不同人物的身份,并持续对应各自的发言者;帮助外国游客实时理解中文菜单和服务员的介绍;在博物馆里持续观察镜头画面,识别到指定文物后主动提醒;辅助用户操作咖啡机,并根据画面变化实时纠错;在阅读论文时持续监测翻页过程,一旦指定章节出现就自动提示。这些场景的共同点,是模型需要同时处理视觉、听觉和文本信息,并实时做出判断和反应。

更典型的是在复杂环境下,SeedRealtime能根据多模态信息判断何时回应、何时保持沉默。最新演示中,在机场这样的嘈杂场景里,模型能区分用户与旁人的对话,避免因背景噪声或无关聊天误触发回应;在儿童学习场景中,它能持续跟随用户互动,不受背景电话等声音的干扰——这种“懂分寸”的能力,是传统级联系统很难做到的。

字节披露的端到端人工评测结果显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少了约50%,抢话、回应延迟以及背景噪声误触发等情况都明显下降。同时,单次对话能够完整、流畅进行的概率也有所提升——数据说话,效果还是挺扎实的。

最后,字节表示未来还会继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力,以及工具调用能力。目标很明确:推动AI从传统问答交互,进一步发展到能够在真实场景中持续理解环境,并协助完成实际任务。这或许才是下一代AI交互的真正方向。