Vivix发布首个实时互动大模型:重塑AI多模态交互新范式

type
status
date
slug
summary
tags
category
icon
password
网址
在过去的一年里,“实时”成为了人工智能(AI)领域最炙手可热的词汇之一。从实时语音通话到实时换脸,技术的发展看似日新月异。然而,仔细剖析现有的多数“实时”应用,我们会发现它们本质上依然是“半双工”的请求-响应模式:用户给出一个指令,系统经过计算返回结果,在模型输出期间,用户无法介入;而在用户操作时,模型则处于停滞状态。这种缺乏即时双向互动的机制,限制了AI在更复杂场景下的应用。
为了打破这一瓶颈,AI创新企业 Vivix 正式发布了两款激活参数约 30B 的模型:Vivix-A1(开放世界演员)Vivix-W1(开放世界剧情)。这两款模型不仅关注“生成速度的提升”,更致力于解决“模型在持续生成音视频的同时,能否随时接收并响应用户的新输入”这一核心问题。想要获取更多关于前沿AI大模型的深度技术解析,欢迎访问 AIGC.bar——您的一站式 AI门户AI资讯 平台。

统一多模态参考:Vivix-A1与W1的双子星架构

Vivix 此次推出的双模型架构,分别从“角色”和“故事”两个维度重构了实时互动体验。
Vivix-A1 是一个面向交互式 AI 角色的实时全双工模型。传统的数字人通常只能“把话说出来”,而 A1 则实现了让数字人“把事情做出来”。该模型支持完整的全身角色与动作生成,数字人不仅能说话,还能行走、感知环境音、产生情绪波动、甚至与周围物体进行物理交互。由于 A1 并非简单的 ASR(语音识别)+ LLM(大语言模型)+ TTS(语音合成)的级联拼接,而是原生的多模态生成循环,因此用户在交互过程中的语音打断,可以让角色的动作和回应随之即时改变,无需重新生成。
Vivix-W1 则专注于“互动叙事”。它的核心能力是生成一段持续演进的音视频故事。在 W1 驱动的场景下,用户可以通过语音、文字、点击或触控持续介入,实时改变故事的走向。镜头的切换、角色的即时反应、对白以及环境音都在同一个生成过程中被原生协调,交互响应延迟低于 1 秒。
在设计逻辑上,A1 是 W1 的基础能力单元。人类在消费视频和游戏内容时,绝大部分注意力都集中在角色身上。A1 先解决了单个角色的行动力与实时响应问题,W1 才能在此基础上扮演“导演”的角色,协调多个角色之间的事件、对白和镜头关系,推动宏大叙事的展开。

因果生成与MJD蒸馏:如何让视频模型随时“接招”

要实现真正的实时流式互动,Vivix 在算法层面攻克了多项业界公认的难题。
传统的视频生成模型大多采用 clip-based(基于片段)的架构,依赖双向 Attention 机制。这种机制需要看完整个输入才能规划输出,虽然画质优秀,但无法在生成过程中插入新的交互指令。为了解决这个问题,A1 和 W1 采用了因果生成(Causal Generation)架构。模型不需要全局信息兜底,而是逐帧向前推导。这种“走一步看一步”的设计让模型随时能接住新输入,但对模型在线维护角色身份、物体关系和动作连贯性的能力提出了极高要求。
此外,视频扩散去噪通常需要 4 到 8 步,直接减少步数会导致画面动态性下降和细节丢失。为此,Vivix 设计了 MJD(Multidimensional Joint Distillation)多维联合蒸馏框架。该框架根据去噪阶段的能力分布进行联合压缩,将扩散过程从 8 步成功压制到 2 步,在维持运动表现和长期稳定性的同时,极大提升了生成速度。

极致降本增效:FP4训练量化与VMI推理引擎

在算力成本居高不下的今天,如何在消费级显卡上低成本运行一个接近 30B 参数的大模型,是技术落地的关键。
常见的 4-bit 量化在语言模型上表现良好,但在视频扩散模型中,一步的微小偏差会沿着时间轴无限放大,导致后续画面严重漂移。Vivix 的解决方案是“量化感知训练”,以 Blackwell NVFP4 GEMM 为目标推理路径,在训练阶段就让模型适配 4-bit 数值分布,并加入去噪误差校正机制。测试数据表明,其 FP4 推理相对 BF16 基线,生成质量几乎无损。
在系统调度层面,Vivix 推出了 VMI(Vivix Model Infra)推理引擎。VMI 将多模态编码和逐帧解码拆分为两个独立服务:编码端负责大 batch 吞吐,解码端负责极低延迟的实时链路。当用户中途发出新指令时,系统直接在解码链路中追加输入,无需中断当前生成。通过 CUDA Graphs 统一提交和 Mega Kernel 计算通信融合,VMI 在消费级 GPU 上跑出了单卡超 10,000 video tokens/s 的优异成绩,PCIe 带宽利用率超 88%。

实时互动AI的未来应用与商业变现

Vivix 带来的技术突破,为多个垂直行业提供了全新的 AI变现 想象空间:
  1. 直播电商:数字主播不再被固定在机位上对口型。A1 生成的主播拥有完整的全身动作,能走动、转身并与商品互动。运营人员可以通过语音实时调整主播的动作,实现自然的无缝切换。
  1. 虚拟伴侣:在 AI 女友等场景中,角色的动作、表情与声音达到了原生同步。由于绕过了传统的级联架构,手势、视觉信号和语音语义在多模态空间中被统一建模,带来了极具沉浸感的“活人感”。
  1. 互动影视与游戏:用户输入一句话即可开启故事,并通过持续的交互改变剧情走向。镜头调度和角色对白实时产出,彻底告别了预设分支的死板体验。
根据官方实测,在消费级显卡配置下,该系统的首帧延迟(TTFF)小于 0.6 秒,端到端延迟(TTFR)小于 1.7 秒,原生打断响应仅需 300-900 毫秒,而实时推理成本低于每小时 1 美元。这标志着高品质的实时互动 AI 已经具备了大规模商业化落地的可行性。

结语

Vivix 发布的实时互动模型,代表了大模型从“离线生成”向“实时流式交互”演进的重要里程碑。尽管在复杂运动和极致画面质感上仍有优化空间,但其全双工、低延迟、低成本的特性,已经为未来的 AGI 交互模式指明了方向。
如果您想持续关注 openaichatGPTclaude 等全球顶尖AI大模型的最新动态和 AI日报,请锁定 AIGC.bar,我们为您提供最前沿的 AI新闻、技术拆解与 Prompt 提示词教程,助您在人工智能时代抢占先机。
Loading...

没有找到文章