Condé Nast 如何借助 Amazon Bedrock 构建多模态视频检索方案
康泰纳仕(Condé Nast)基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建了多模态视频检索方案,覆盖超 140,000 个视频。该方案采用 TwelveLabs Marengo 嵌入模型联合编码字幕、画面和音频,支持自然语言与图像检索并精确定位时间戳。新系统将编辑团队的内容检索耗时从平均每次 250 分钟大幅缩短至 2 分钟以内。
康泰纳仕(Condé Nast)基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建了多模态视频检索方案,覆盖超 140,000 个视频。该方案采用 TwelveLabs Marengo 嵌入模型联合编码字幕、画面和音频,支持自然语言与图像检索并精确定位时间戳。新系统将编辑团队的内容检索耗时从平均每次 250 分钟大幅缩短至 2 分钟以内。
Simon Willison借助 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可识别人脸并自动模糊,避免分享可识别陌生人面孔的照片。工具使用 Google 的 MediaPipe C++ 库,经 @mediapipe/tasks-vision 编译为 WebAssembly,并采用 BlazeFace 人脸检测模型。
Microsoft Research介绍 Quine,这一面向生物学复杂性的AI研究系统结合生物多模态世界模型与交互式科研工具链。在与哈佛和MIT的Broad研究所合作中,团队用 Quine 对数千种化合物排序,并在胰腺导管腺癌研究的湿实验中验证了多个高排名候选物;从缩小搜索范围到筛出候选物并进行实验验证,整个过程耗时一个周末。
成立一年来,Microsoft Research Asia – Singapore通过前沿AI研究、深化本地合作与人才培养,推动研究成果走向现实应用。该实验室与新加坡医疗体系合作,探索多模态医疗AI和自进化诊断智能体,支持临床决策及疾病诊断、风险评估和个性化护理研究。其研究还覆盖金融、教育和科技领域,并聚焦东南亚情境下可靠、可信的AI系统。
AWS 推出在 Amazon SageMaker AI 上基于 vLLM-Omni 深度学习容器(DLC)部署 Qwen3-TTS 的实时语音生成方案。该方案利用 SageMaker 双向流式传输(HTTP/2 WebSocket),通过单个持久连接流式输入文本并实时返回 24 kHz PCM 音频块。
用户可在 Amazon SageMaker AI 上基于 AWS vLLM-Omni 深度学习容器(DLC),实现从文本生成图像并转为短视频的工作流。方案使用同个容器镜像分别部署用于 FLUX.2-klein-4B 图像生成的实时端点,以及用于 Wan2.1-VACE-1.3B 视频生成的异步推理端点。
AWS 介绍了结合 Amazon Nova Act 和 Amazon Bedrock AgentCore 构建智能体驱动合成监控的方案,以解决传统 Selenium 或 Playwright 依赖 DOM 选择器容易因前端 UI 改动而失效的问题。
在 Amazon SageMaker HyperPod 上利用开源 RL 框架 SkyRL 与 GRPO 算法训练 Qwen3-VL-8B,可将 64 迷宫评估集的解决率从 43.75% 提升至 95% 以上。
Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,将实时语音对话与低延迟视频流生成结合,实现具备精准口型同步与表情交互的虚拟数字人体验。
推荐理由:结合实时音视频生成与异步工具调用,展示了企业级多模态对话智能体在保持不间断交互上的产品演进。
Meta 在 Connect 2026 大会上围绕 Muse 个人 AI 智能体推出多项软硬件更新,Muse 现已支持语音、实时视频及 Mac 端 Computer Use,并发布了响应延迟低于 1 秒的 Muse Realtime Avatar 模型。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,支持通过自然语言提示词从零定制角色声音并进行逐行台词导演。
推荐理由:原文详细展示了双角色剧本编排、自然语言声音定制与安全水印机制,读者可以据此评估语音合成在播客与配音场景的落地可行性。
invideo 借助 GPT-6 Astra 将色彩校正与调色效率提升至 3 倍,并能以更高精度规划视频剪辑。此外,该工具可在一天内制作出 50 个自定义特效。
小米推出 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 具备 1.02T 总参数和 42B 激活参数,并公开了强化学习训练配方与环境代码。本期综述同时汇总了 Jev 决策模型应用、Hugging Face tokenizers v1 RC 等推理与训练工具升级,以及千问 Qwen-Image-2.1 开源模型的相关进展。
Microsoft Research 发布开放权重模型 GigaPath-Flash 和 GigaTIME-Flash,旨在降低病理基础模型用于大规模研究的计算成本。
Microsoft Research推出MindTopo基准,评估多模态大语言模型对拓扑关系的静态推理和交互规划能力。测试涵盖连续性、分离、顺序、包围和打结,结果显示模型在静态识别任务中的表现明显强于交互规划。规划失误常发生在感知之后,模型会在多步操作中丢失结构关系或提出违反环境规则的动作。