Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音合成模型
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,支持通过自然语言提示词从零定制角色声音并进行逐行台词导演。
推荐理由:原文详细展示了双角色剧本编排、自然语言声音定制与安全水印机制,读者可以据此评估语音合成在播客与配音场景的落地可行性。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,支持通过自然语言提示词从零定制角色声音并进行逐行台词导演。
推荐理由:原文详细展示了双角色剧本编排、自然语言声音定制与安全水印机制,读者可以据此评估语音合成在播客与配音场景的落地可行性。
小米推出 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 具备 1.02T 总参数和 42B 激活参数,并公开了强化学习训练配方与环境代码。本期综述同时汇总了 Jev 决策模型应用、Hugging Face tokenizers v1 RC 等推理与训练工具升级,以及千问 Qwen-Image-2.1 开源模型的相关进展。
Microsoft Research 发布开放权重模型 GigaPath-Flash 和 GigaTIME-Flash,旨在降低病理基础模型用于大规模研究的计算成本。