语音 AI 初创公司 ElevenLabs 估值翻倍至 $22B
语音 AI 初创公司 ElevenLabs 宣布允许员工在 $22B 估值下套现部分已归属股权,较 2 月融资时的 $11B 估值翻倍。本次 $300M 员工要约收购由 Wellington 与 T. Rowe Price 联合领投,旨在通过流动性留住人才防止流向竞争对手。
语音 AI 初创公司 ElevenLabs 宣布允许员工在 $22B 估值下套现部分已归属股权,较 2 月融资时的 $11B 估值翻倍。本次 $300M 员工要约收购由 Wellington 与 T. Rowe Price 联合领投,旨在通过流动性留住人才防止流向竞争对手。
AWS 推出在 Amazon SageMaker AI 上基于 vLLM-Omni 深度学习容器(DLC)部署 Qwen3-TTS 的实时语音生成方案。该方案利用 SageMaker 双向流式传输(HTTP/2 WebSocket),通过单个持久连接流式输入文本并实时返回 24 kHz PCM 音频块。
AWS 介绍了如何通过 Amazon SageMaker JumpStart 将开源语音生成模型 Qwen3-TTS-12Hz-1.7B-Base 部署为托管实时推理端点。
Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,将实时语音对话与低延迟视频流生成结合,实现具备精准口型同步与表情交互的虚拟数字人体验。
推荐理由:结合实时音视频生成与异步工具调用,展示了企业级多模态对话智能体在保持不间断交互上的产品演进。
Meta 在 Connect 2026 大会上围绕 Muse 个人 AI 智能体推出多项软硬件更新,Muse 现已支持语音、实时视频及 Mac 端 Computer Use,并发布了响应延迟低于 1 秒的 Muse Realtime Avatar 模型。
Simon Willison 开发了 Gemini 3.8 TTS Playground 交互工具,支持用户自带 API Key 测试 Google 新发布的 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts 文本转语音模型。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,支持通过自然语言提示词从零定制角色声音并进行逐行台词导演。
推荐理由:原文详细展示了双角色剧本编排、自然语言声音定制与安全水印机制,读者可以据此评估语音合成在播客与配音场景的落地可行性。
Ringg 借助 OpenAI 的 GPT-5.6 驱动多语言 AI 智能体,可解决高达 65% 的客户通话。该方案覆盖语音、聊天、WhatsApp 和 Web 渠道,相比 GPT-4.1 成本降低了 90%。
TypeSafe 推出基于 RLCD 训练的决策模型 Jev,专用于分类、评分和路由等结构化决策,而非生成自由文本。该模型相比传统 LLM 提速 20-200 倍、成本降低 40-400 倍且输出 token 免费,具备并行采样与无幻觉等特性。同期动态还包括 Periodic Labs 发布材料科学模型 Neon 以及 Google 上线 Gemini 3.8 Live。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。
推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。
OpenAI 在 API 中上线 GPT-Live-1 模型,提供自然的全双工语音对话交互。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。
推荐理由:原文给出了新模型的全双工语音与电话支持能力,开发者可以据此评估语音交互方案的集成路径。