Vivix 是一个围绕实时互动多模态模型搭建的 AI 创作平台,核心产品是三个模型与运行时:负责生成全身交互式 AI 角色的 Vivix-A1、负责流式互动叙事的 Vivix-W1,以及把离线控制、实时生成和智能调度合在一起的实时视频运行时 Vivix IVI。它的定位不是生成一段固定视频,而是让角色和故事在运行过程中持续响应输入。目前 Vivix-A1 已经开放 API,开发者可以直接接入。
做实时数字人或者互动内容的人,过去的做法大多是把语音识别、大语言模型、语音合成串成一条级联管线。这条管线的问题很实际:用户说完话要等每一环依次跑完,延迟叠起来,对话节奏就断了;用户中途插话,系统要么听不见,要么得停掉重新生成;声音、表情、动作分别由不同模块产出,拼在一起总有对不上的痕迹。想要角色走动、拿东西,更是要额外做大量动画和状态管理。Vivix 的解法是把这些放进一个原生多模态模型里,语音、文字、图片在统一信号空间建模,感知直接驱动行为。角色在持续生成音视频的同时能接住新输入并即时改变内容,不需要中断重来。这一点对直播和陪伴类场景是决定性的。
最适合用 Vivix 的是需要实时双向交互的团队:做直播电商的,想要数字主播全身出镜、边走边展示商品,运营还能在直播中语音调整话术;做虚拟伴侣或 AI 社交的,需要动作、表情、声音自然同步,用户随时打断角色也能接住;做互动影视、游戏 NPC 或智能客服的,也能对上号。反过来,如果你的需求只是批量生成固定脚本、固定机位的口播视频,不需要观众参与,那这类全双工实时能力用不上,选普通的视频生成工具更划算。同样,想把模型完整
📬 不错过下一款好工具
每周精选推送,随时退订
这是你的产品?认领并提升曝光 →
实际接入的流程围绕会话展开。开发者先到 Vivix 的开放平台注册账号,在开发者后台创建 API Key,请求统一走 https://api.vivix.ai 并携带 Bearer 认证。接着按需求选模型系列:A 系列对应实时 Avatar 交互或脚本驱动的 Avatar 视频,W 系列对应互动叙事,具体有 vivix-a1-stream、vivix-w1-stream 等型号。然后通过 REST 接口创建会话,配置模式、角色形象图、音色、人设指令和语音识别方式,拿到会话标识后用 WebSocket 控制通道建立连接,音画输出经 RTC 流传输。运行时把用户的语音或文字写入对话上下文,Avatar 实时生成回复,以语音、视频和逐字字幕流式输出,中途可以随时打断。生成过程中还能通过控制接口切换角色形象、发送动作指令或直接插入脚本音频,不用中断重来。W1 的世界玩法则以事件驱动剧情,事件在生效前可以取消,会话支持暂停和恢复,随时插入新事件改变故事走向。比如做互动短剧时,观众点了一个选项,后台就插入一个事件,剧情当场拐弯。
价格方面,参考资料只提到模型推理成本低于每小时 1 美元,没有给出面向开发者的具体计费档位,具体套餐与额度以官网当前公示为准。接入入口是官网和 platform.vivix.ai 开放平台。
判断该不该选 Vivix,看交互是不是你产品的核心。需要角色能听、能说、能全身行动,用户随时插话、剧情随时改向的场景,比如直播带货、AI 陪伴、开放世界 NPC,它的全双工架构和低于 1 秒的交互延迟正好对症。如果需求停在单向内容生产,比如批量出营销短视频、做图文素材,那应该看普通的视频生成或图像生成工具,实时会话能力对这类任务是多余的。
参考资料仅提到模型推理成本低于每小时 1 美元,未给出面向开发者的具体计费档位,价格方案以官网当前公示为准。