Condé Nast 如何借助 Amazon Bedrock 构建多模态视频检索方案
康泰纳仕(Condé Nast)基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建了多模态视频检索方案,覆盖超 140,000 个视频。该方案采用 TwelveLabs Marengo 嵌入模型联合编码字幕、画面和音频,支持自然语言与图像检索并精确定位时间戳。新系统将编辑团队的内容检索耗时从平均每次 250 分钟大幅缩短至 2 分钟以内。
康泰纳仕(Condé Nast)基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建了多模态视频检索方案,覆盖超 140,000 个视频。该方案采用 TwelveLabs Marengo 嵌入模型联合编码字幕、画面和音频,支持自然语言与图像检索并精确定位时间戳。新系统将编辑团队的内容检索耗时从平均每次 250 分钟大幅缩短至 2 分钟以内。
用户可在 Amazon SageMaker AI 上基于 AWS vLLM-Omni 深度学习容器(DLC),实现从文本生成图像并转为短视频的工作流。方案使用同个容器镜像分别部署用于 FLUX.2-klein-4B 图像生成的实时端点,以及用于 Wan2.1-VACE-1.3B 视频生成的异步推理端点。
Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,将实时语音对话与低延迟视频流生成结合,实现具备精准口型同步与表情交互的虚拟数字人体验。
推荐理由:结合实时音视频生成与异步工具调用,展示了企业级多模态对话智能体在保持不间断交互上的产品演进。
invideo 借助 GPT-6 Astra 将色彩校正与调色效率提升至 3 倍,并能以更高精度规划视频剪辑。此外,该工具可在一天内制作出 50 个自定义特效。
Higgsfield AI 借助 GPT-6 Astra 在一天内上线了新的视频功能,降低了小型企业制作视频广告的门槛。借助该模型,Higgsfield AI 能够更快速地将新的创意工具推向市场。