Tavus 的 Griffin 模型在1分钟通话中让近半测试者误认真人
Tavus 的 Griffin 模型在1分钟视频通话中让48%参与者误认为真人,此前系统最高仅2%。在 Tavus 所述的 Nvidia 独立音频视频对话拟人测试中 Griffin 获3.83分接近人类3.92分,预览版 Griffin-Lite 已开放给选定测试者。Tavus 成立于2020年,从营销视频扩展至实时对话。
Tavus 的 Griffin 模型在1分钟视频通话中让48%参与者误认为真人,此前系统最高仅2%。在 Tavus 所述的 Nvidia 独立音频视频对话拟人测试中 Griffin 获3.83分接近人类3.92分,预览版 Griffin-Lite 已开放给选定测试者。Tavus 成立于2020年,从营销视频扩展至实时对话。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,支持通过自然语言提示创建自定义角色声音并逐行指导场景对话。
推荐理由:原文展示了从静态预设到动态创意工作室的转变,提供了多语言角色定制与场景对话控制的具体能力。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,旨在提升实时语音对话的智能与并行推理能力。
推荐理由:原文给出了两款实时语音模型在推理与工具调用上的具体基准表现,读者可据此评估其在生产级语音智能体中的适用性。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化文本。据 Artificial Analysis 测量,流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写时间较前代 Chirp 3 改善 70%;模型支持 85 种以上语言自动检测、自定义词汇和最多三位说话人区分。
推荐理由:官方给出 WER、延迟与多语言等量化指标,并列出两套 API 与产品落地入口,便于判断语音转写能力边界。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升多语言质量。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与自部署延迟数据,可据此评估自建语音链路的成本与可行性。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量与提示词遵循度、结构感知更好,人声表达与情感更细腻且发音改善,同时可更便捷地控制输出节奏与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:原文给出 70+ 语言、连续生成语音和几秒延迟等关键指标,读者可据此判断实时语音翻译的可用边界。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表现力和质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1211 Elo 分数。
推荐理由:官方给出 Elo 1211 与音频标签控制方式,可据此判断语音生成在可控性上的进展。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,具备情感表达与零样本跨语言音色适配能力。
推荐理由:Mistral 首款 TTS 模型给出参数量、延迟与定价,并公开与 ElevenLabs 的对比评测,便于判断企业语音栈的选型空间。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文本模型。
推荐理由:官方给出两款语音转写模型的延迟、错误率与价格对比,可据此判断实时语音应用的落地成本。
Mistral 发布 Voxtral 语音理解模型,提供 24B 生产级和 3B 本地与端侧两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。
推荐理由:Mistral 开源语音理解模型,给出两种尺寸、32k 上下文与 API 定价,可据此判断开源语音方案的落地成本。