在 SageMaker AI 上使用 vLLM-Omni 构建实时语音应用(第一部分)
AWS 推出在 Amazon SageMaker AI 上基于 vLLM-Omni 深度学习容器(DLC)部署 Qwen3-TTS 的实时语音生成方案。该方案利用 SageMaker 双向流式传输(HTTP/2 WebSocket),通过单个持久连接流式输入文本并实时返回 24 kHz PCM 音频块。
AWS 推出在 Amazon SageMaker AI 上基于 vLLM-Omni 深度学习容器(DLC)部署 Qwen3-TTS 的实时语音生成方案。该方案利用 SageMaker 双向流式传输(HTTP/2 WebSocket),通过单个持久连接流式输入文本并实时返回 24 kHz PCM 音频块。
AWS 介绍了如何通过 Amazon SageMaker JumpStart 将开源语音生成模型 Qwen3-TTS-12Hz-1.7B-Base 部署为托管实时推理端点。
Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,将实时语音对话与低延迟视频流生成结合,实现具备精准口型同步与表情交互的虚拟数字人体验。
推荐理由:结合实时音视频生成与异步工具调用,展示了企业级多模态对话智能体在保持不间断交互上的产品演进。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,支持通过自然语言提示词从零定制角色声音并进行逐行台词导演。
推荐理由:原文详细展示了双角色剧本编排、自然语言声音定制与安全水印机制,读者可以据此评估语音合成在播客与配音场景的落地可行性。
Ringg 借助 OpenAI 的 GPT-5.6 驱动多语言 AI 智能体,可解决高达 65% 的客户通话。该方案覆盖语音、聊天、WhatsApp 和 Web 渠道,相比 GPT-4.1 成本降低了 90%。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。
推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。
OpenAI 在 API 中上线 GPT-Live-1 模型,提供自然的全双工语音对话交互。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。
推荐理由:原文给出了新模型的全双工语音与电话支持能力,开发者可以据此评估语音交互方案的集成路径。