首页 > 教程攻略 > ai资讯 >Vivix - Vivix推出的首个实时交互多模态基座模型

Vivix - Vivix推出的首个实时交互多模态基座模型

来源:互联网 时间:2026-07-26 14:08:42

Vivix是什么

先说说Vivix到底是什么。它是一家由前商汤高管刘宇创立的AI新锐公司,推出的全球首个实时交互多模态基座模型,包含两个版本:

Vivix-A1

Vivix-W1

。这两款模型都采用了约30B激活参数的统一流式架构,把多模态参考、原生交互和流式视频生成整合在一起。用户可以通过语音、文字、触控等方式直接介入,实时改变AI角色的动作和剧情走向。端到端首次反应延迟低于1.7秒,推理成本在一年内降低了两个数量级,已经接近主流视频平台CDN带宽成本,甚至能在消费级GPU上实现实时推理。

Vivix的主要功能

你可能会好奇,这跟咱们熟悉的AI视频工具有什么区别?Vivix的核心能力,可以拆解成几个关键点:

  • 实时全双工交互

    :AI角色在说话或行动时,用户随时可以插话、换话题,角色立刻响应,不需要等它把当前轮次说完。真正实现人机双向对话,而不是你问一句它答一句的“单行道”。
  • 全身角色与动作生成

    :角色不仅能说话,还能实时行走、转身、拿东西、与环境互动,支持写实人物、3D角色和动漫形象等多种风格。这可不是简单的“嘴型同步”,连肢体动作都跟上了。
  • 原生音画联合生成

    :画面、对白、环境音和音效同步生成,不需要单独加一个音频模型来处理,口型、动作和声音匹配度很高,视听一体化输出。
  • 多模态动态参考

    :支持语音、文字、图片等多种输入方式,而且图片可以在互动过程中动态加入,角色会根据新素材实时调整讲解内容和动作表现。
  • 原生多镜头叙事

    :模型可以自主切换视角、移动镜头,处理对白节奏和人物反应,实现电影级的实时导演能力,叙事感很强。
  • 流式持续生成

    :采用小段流式生成方式,上一段内容作为下一段基础,支持故事长期演进而不漂移,长时间交互不会有断裂感。
  • 极低延迟响应

    :流式调度器处理新输入最短只需要300毫秒,用户输入到画面首次可见反应平均低于0.6秒,端到端首次反应时间(TTFR)低于1.7秒。
  • 消费级GPU实时运行

    :通过MJD多维联合蒸馏、原生NVFP4训推协同与VMI推理引擎优化,30B参数模型也能在消费级显卡上实现实时推理。

如何使用Vivix

如果你对Vivix感兴趣,上手其实很简单:

  • 访问官网申请内测

    :前往Vivix的官网 https://vivix.ai/ 或API开放平台提交体验申请。
  • 选择模型与场景

    :根据需求选择

    Vivix-A1

    (角色实时交互)或

    Vivix-W1

    (互动叙事/世界生成)。
  • 输入参考素材

    :上传角色图片、场景描述或语音指令,确定故事或角色的初始状态。
  • 实时互动介入

    :通过语音、文字、点击或触控与AI角色/故事进行双向交流,随时改变剧情或角色行为。
  • 动态调整与导出

    :在流式生成过程中追加新图片或修改指令,系统会实时重定向后续内容,不需要从头生成。

Vivix的核心优势

从技术细节来看,Vivix有几个让人印象深刻的优势:

  • 极低延迟

    :流式调度器响应新输入最短只需300毫秒,用户输入到画面首次可见反应平均低于0.6秒,端到端TTFR低于1.7秒。这个延迟水平,已经接近人类对话的反应速度了。
  • 消费级GPU实时运行

    :通过MJD多维联合蒸馏、原生NVFP4训推协同与VMI推理引擎,将30B参数模型压缩到2步推理,消费级显卡单卡就能跑出超过10,000 video tokens/s的速度。
  • 成本大幅降低

    :推理与基础设施成本在一年内降低了约100倍,实时生成成本已经接近YouTube每小时约0.2美元的CDN带宽成本。
  • 非级联原生架构

    :摒弃了传统ASR+LLM+TTS拼接管线,采用端到端原生多模态生成循环,交互更自然,延迟更低。
  • 长期一致性保障

    :通过局部连续性衔接和全局序列先验,维持人物、背景、声音和动作的长期稳定,避免长时间生成后画面漂移——这是很多生成式AI难以攻克的难题。

Vivix的同类竞品对比

说到竞品,智谱的GLM-Realtime是目前最直接的对比对象。两者都是多模态模型,但定位侧重点不太一样。

模型定位上

,Vivix是全球首个实时交互多模态基座模型,而GLM-Realtime是端到端音视频通话多模态模型。Vivix更强调“生成式”能力,AI实时生成角色动作、场景和镜头叙事;GLM-Realtime更侧重“理解式”,可以实时理解用户摄像头画面并语音回应。

核心架构方面

,Vivix采用统一流式架构,约30B激活参数,端到端原生多模态生成循环;GLM-Realtime是端到端多模态模型,跨文本/音频/视频实时推理。

延迟表现

上,Vivix的流式调度器300毫秒,画面首次可见小于0.6秒,端到端TTFR低于1.7秒;GLM-Realtime强调“近乎实时”,具体数值未公开。

生成模态

方面,Vivix支持画面+对白+环境音+音效同步生成(音画联合),而GLM-Realtime只支持语音+文本输出(基于视频理解)。Vivix还支持全身角色行走、转身、拿取物品、物理交互,GLM-Realtime则侧重理解用户视频,没有角色生成功能。

硬件要求

上,Vivix可以在消费级GPU上实时运行,单卡跑超10,000 video tokens/s;GLM-Realtime是云端API调用,没有本地硬件要求。

定价方面

,Vivix的推理成本一年内降低了约100倍,接近CDN带宽成本;GLM-Realtime按分钟计费,音频0.18–0.3元/分钟,视频1.2–2.1元/分钟。

特色功能

上,Vivix具备电影级多镜头自主切换、角色风格自定义(写实/3D/动漫)、环境物理交互等能力;GLM-Realtime则提供清唱功能、Function Call工具调用、口语陪练、面试模拟等实用功能。

Vivix的适用人群

那么,Vivix到底适合谁?

  • 游戏&开发者

    :需要构建开放世界剧情、实时NPC交互与动态叙事的游戏工作室,Vivix的实时交互和动作生成能力几乎是量身定制。
  • 直播与内容创作者

    :希望打造实时互动数字人、虚拟主播或沉浸式直播体验的团队,Vivix能大幅降低制作门槛。
  • 房产与电商营销

    :需要AI销售/导购进行线上带看、商品展示与实时答疑的企业,Vivix的实时交互和多模态能力可以提升用户体验。
  • 教育与文旅机构

    :开发虚拟导览、互动讲解、沉浸式研学内容的机构,Vivix的角色生成和叙事能力能让内容更生动。
  • AI研究者与开发者

    :关注实时多模态生成、流式架构与低延迟推理技术的前沿技术人员,Vivix的技术架构本身就是一个值得研究的案例。