跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

4条精选相关主题多模态AI 视频产品更新

最新精选

第 1–4 条 · 共 4 条
9月25日周五
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar 实时数字人功能

    Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,将实时语音对话与低延迟视频流生成结合,实现具备精准口型同步与表情交互的虚拟数字人体验。

    推荐理由:结合实时音视频生成与异步工具调用,展示了企业级多模态对话智能体在保持不间断交互上的产品演进。

9月23日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音合成模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,支持通过自然语言提示词从零定制角色声音并进行逐行台词导演。

    推荐理由:原文详细展示了双角色剧本编排、自然语言声音定制与安全水印机制,读者可以据此评估语音合成在播客与配音场景的落地可行性。

9月16日周三
  1. Google DeepMind82

    Google DeepMind 推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时对话模型

    Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。

    推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。

9月10日周四