跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

16条精选相关主题多模态AI 视频产品更新

最新精选

第 1–16 条 · 共 16 条
9月25日周五
  1. Google DeepMind74

    Google DeepMind 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,为原生实时对话模型提供低延迟的流式视频虚拟形象。该功能支持自然表情和精准唇形同步,可在 97 种语言间无缝切换,并支持在保持对话流畅的同时于后台异步调用工具执行复杂任务。输出内容均默认嵌入 SynthID 水印防伪,即日起在 Gemini Enterprise 开放可用。

    推荐理由:原文展示了流式视频形象与后台异步工具调用的结合,读者可以据此评估实时数字人在企业端交互场景中的落地可行性。

9月23日周三
9月16日周三
9月10日周四
  1. OpenAI News75

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,并支持自定义声音以及电话协议集成。

    推荐理由:该模型在 API 中支持全双工语音交互与电话集成,为开发者构建实时语音应用提供了新的官方原生接口。

8月27日周四
8月21日周五
  1. Hugging Face Blog71

    Hugging Face 量化语音识别模型的基准过拟合现象

    Hugging Face 针对语音识别模型刷榜和基准过拟合现象提出三种量化测试,并评估了 11 个主流开源 ASR 模型。实测显示部分基准高分模型会直接复现参考文本里的历史标注错误,在音频数字被静音时仍有 30% 至 40% 的概率猜出被抹去的数字,甚至依赖背景声学线索切换不同数据集的拼写习惯。

    推荐理由:该研究量化了语音模型利用声学线索迎合测试集的过拟合行为,为评估模型真实泛化能力提供了实用检测方法。

8月11日周二
  1. Hugging Face Blog71

    NVIDIA 开源 Magpie 多语言 TTS 模型

    NVIDIA 开源 364M 参数的多语言语音合成模型 Magpie TTS,支持英语、中文、韩语、现代标准阿拉伯语等 12 种语言并开放权重。模型采用帧堆叠与局部 Transformer 架构降低解码步数,在 B200 GPU 单流运行下首音频延迟为 32ms,64 并发下吞吐达 320 倍实时。

    推荐理由:模型通过开源权重与帧堆叠架构将单流首音频延迟压缩至最低 32 毫秒,为自建低延迟多语言语音智能体提供了完整可控的落地参考栈。

7月30日周四
  1. Google DeepMind65

    Google DeepMind 在 Flow Music 中推出音乐生成模型 Lyria 3.5

    Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,全面升级音乐性、歌词、人声表现和创作控制。新模型支持更复杂的旋律结构与发音更准、情感更自然的人声,同时增强了歌词生成的提示词遵循度,并允许用户直接调整输出的节奏与时长。

    推荐理由:模型在旋律、歌词、人声以及节奏和时长控制上的升级,为创作者在音乐生成工具中微调成品提供了更细致的调节空间。

7月1日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cerebras 将 Gemma 4 引入实时语音 AI 流水线

    Hugging Face 联合 Cerebras 推出基于 Gemma 4 31B 的实时语音到语音开源流水线,大幅降低语言模型推理与多轮交互延迟。该级联系统采用完全模块化设计,整合 Nvidia Parakeet 语音识别、Cerebras 加速的 Gemma 4 推理以及阿里 Qwen3TTS 文本转语音,重点优化高分位延迟瓶颈。

    推荐理由:原文展示了通过专用推理芯片与模块化开源模型串联消除长尾延迟的方案,为具身智能与实时语音助手的架构设计提供了落地参考。

6月9日周二
4月30日周四
  1. Google DeepMind65

    Google DeepMind 发布 AI co-clinician 医疗协作研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。

    推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。

4月16日周四
  1. Google DeepMind72

    Google DeepMind 推出 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持通过自然语言音频标签精确控制语音风格、节奏和表达,并原生支持多说话人对话与 70 多种语言。

    推荐理由:该模型通过自然语言行内标签实现对语调和语速的精细调度,为构建多角色对话系统提供了更具成本效益的语音方案。

3月24日周二
  1. Mistral AI81

    Mistral AI 发布 4B 多语言语音合成模型 Voxtral TTS

    Mistral AI 正式发布多语言文本转语音模型 Voxtral TTS,采用基于 Ministral 3B 的流匹配架构,总参数量为 4B,支持英语、法语、阿拉伯语等 9 种语言的情感化语音生成。

    推荐理由:原文披露了基于自研编解码器与流匹配的架构细节及延迟数据,读者可据此评估端到端语音智能体的落地成本。

2月5日周四
7月17日周四
  1. Mistral AI81

    Mistral AI 为 Le Chat 推出深度研究、语音模式与项目空间等多项功能

    Mistral AI 宣布为助手 Le Chat 推出一系列重大更新,包括提供结构化研究报告的 Deep Research 预览版,以及由新模型 Voxtral 驱动的低延迟语音模式。新版本还集成了推理模型 Magistral 以支持原生多语言深度思考,并增加用于归类管理对话与文件的 Projects 功能,同时携手 Black Forest Labs 支持直接通过提示词进行图像连续编辑。

    推荐理由:原文集中展示了深度研究、语音和推理模型等多项能力更新,读者可以了解该助手在工作流组织与多模态交互上的最新进展。

7月15日周二
  1. Mistral AI81

    Mistral AI 发布开源语音理解模型 Voxtral

    Mistral AI 发布开源语音理解模型系列 Voxtral,提供 24B 与 3B 两种尺寸,采用 Apache 2.0 协议在 Hugging Face 开源并同步上线 API。

    推荐理由:原文给出了 24B 与 3B 两种尺寸的开源权重与低成本 API,读者可以据此评估本地端侧部署与长语音智能体工作流的可行性。