跳到正文

#语音

今日 1 条
今天9月29日周二
  1. The Decoder77

    ElevenLabs 发布 Eleven v4 语音模型与 v4 Turbo

    ElevenLabs 推出新一代语音模型 Eleven v4 及其面向实时语音智能体的 v4 Turbo 版本,提升了情感标签遵循精度并增强了长文本声音一致性。新模型单次请求支持最多 10,000 字符且覆盖超 90 种语言,Turbo 版音频生成延迟缩短至约 150 毫秒。两款模型已在 API、ElevenAgents 与 ElevenCreative 上线,并提供限时折扣活动。

    推荐理由:新架构提升了上下文理解与长音频音色一致性,读者可借此评估其在长篇配音与低延迟语音智能体中的落地成本与表现。

9月23日周三
9月16日周三
9月10日周四
  1. OpenAI News75

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,并支持自定义声音以及电话协议集成。

    推荐理由:该模型在 API 中支持全双工语音交互与电话集成,为开发者构建实时语音应用提供了新的官方原生接口。

8月27日周四
8月11日周二
  1. Hugging Face Blog71

    NVIDIA 开源 Magpie 多语言 TTS 模型

    NVIDIA 开源 364M 参数的多语言语音合成模型 Magpie TTS,支持英语、中文、韩语、现代标准阿拉伯语等 12 种语言并开放权重。模型采用帧堆叠与局部 Transformer 架构降低解码步数,在 B200 GPU 单流运行下首音频延迟为 32ms,64 并发下吞吐达 320 倍实时。

    推荐理由:模型通过开源权重与帧堆叠架构将单流首音频延迟压缩至最低 32 毫秒,为自建低延迟多语言语音智能体提供了完整可控的落地参考栈。

7月30日周四
  1. Google DeepMind65

    Google DeepMind 在 Flow Music 中推出音乐生成模型 Lyria 3.5

    Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,全面升级音乐性、歌词、人声表现和创作控制。新模型支持更复杂的旋律结构与发音更准、情感更自然的人声,同时增强了歌词生成的提示词遵循度,并允许用户直接调整输出的节奏与时长。

    推荐理由:模型在旋律、歌词、人声以及节奏和时长控制上的升级,为创作者在音乐生成工具中微调成品提供了更细致的调节空间。

6月9日周二
4月16日周四
  1. Google DeepMind72

    Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持通过自然语言音频标签精确控制语音风格、节奏和表达,并原生支持多说话人对话与 70 多种语言。

    推荐理由:该模型通过自然语言行内标签实现对语调和语速的精细调度,为构建多角色对话系统提供了更具成本效益的语音方案。

3月24日周二
  1. Mistral AI81

    Mistral AI 发布 4B 多语言语音合成模型 Voxtral TTS

    Mistral AI 正式发布多语言文本转语音模型 Voxtral TTS,采用基于 Ministral 3B 的流匹配架构,总参数量为 4B,支持英语、法语、阿拉伯语等 9 种语言的情感化语音生成。

    推荐理由:原文披露了基于自研编解码器与流匹配的架构细节及延迟数据,读者可据此评估端到端语音智能体的落地成本。

2月5日周四
7月15日周二
  1. Mistral AI81

    Mistral AI 发布开源语音理解模型 Voxtral

    Mistral AI 发布开源语音理解模型系列 Voxtral,提供 24B 与 3B 两种尺寸,采用 Apache 2.0 协议在 Hugging Face 开源并同步上线 API。

    推荐理由:原文给出了 24B 与 3B 两种尺寸的开源权重与低成本 API,读者可以据此评估本地端侧部署与长语音智能体工作流的可行性。