Condé Nast 如何借助 Amazon Bedrock 构建多模态视频检索方案
康泰纳仕(Condé Nast)基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建了多模态视频检索方案,覆盖超 140,000 个视频。该方案采用 TwelveLabs Marengo 嵌入模型联合编码字幕、画面和音频,支持自然语言与图像检索并精确定位时间戳。新系统将编辑团队的内容检索耗时从平均每次 250 分钟大幅缩短至 2 分钟以内。
康泰纳仕(Condé Nast)基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建了多模态视频检索方案,覆盖超 140,000 个视频。该方案采用 TwelveLabs Marengo 嵌入模型联合编码字幕、画面和音频,支持自然语言与图像检索并精确定位时间戳。新系统将编辑团队的内容检索耗时从平均每次 250 分钟大幅缩短至 2 分钟以内。
AWS 的教程演示如何用 Amazon Bedrock Knowledge Bases 和合成理赔文档构建可通过自然语言查询、返回引用答案的理赔助手。流程涵盖从 Amazon S3 摄取文档、使用 AgenticRetrieveStream 检索、进行多轮追问和元数据过滤,并通过 grounding 检查约束回答。
推荐理由:教程将文档摄取、AgenticRetrieveStream 检索、元数据过滤和引用与 grounding 检查串成实现流程,并以合成语料提供评估基线。
Amazon Bedrock AgentCore Runtime Instances 教程展示如何部署由三个智能体组成的音乐制作流水线,让它们通过同一 runtimeSessionId 在单台 GPU 实例上协作。
推荐理由:示例把共享会话、持久卷与独立运行时部署串成一套流程,展示多智能体如何跨阶段交接文件,并在长任务中恢复执行。
AWS 为 Amazon Quick 梳理提示词工程基础,涵盖明确具体需求、补充业务上下文、用示例约束输出等通用方法。文章还介绍 CRISPE 框架,帮助组织复杂请求;这是两部分系列的第一部分,后续将讲解 Research、Flows、Sight、Chat Agents 和 Action Integrations 的组件技巧。
AWS 分享 Amazon Quick 各组件的提示词编写方法,帮助用户获得更具体、可执行的结果。Quick Research 建议明确研究目标、受众和问题,并筛选信息来源;Quick Flows 应写清触发条件、执行步骤和输出要求,也可通过后续对话逐步调整;Quick Sight 查询则应说明业务问题、指标、维度和可视化偏好。
AWS 展示了一个用 Amazon Quick 和 Amazon Bedrock AgentCore 构建的合同智能平台,将合同 PDF 中的信息抽取为结构化数据,以支持跨合同汇总和单份合同查询。
AWS 推出在 Amazon SageMaker AI 上基于 vLLM-Omni 深度学习容器(DLC)部署 Qwen3-TTS 的实时语音生成方案。该方案利用 SageMaker 双向流式传输(HTTP/2 WebSocket),通过单个持久连接流式输入文本并实时返回 24 kHz PCM 音频块。
用户可在 Amazon SageMaker AI 上基于 AWS vLLM-Omni 深度学习容器(DLC),实现从文本生成图像并转为短视频的工作流。方案使用同个容器镜像分别部署用于 FLUX.2-klein-4B 图像生成的实时端点,以及用于 Wan2.1-VACE-1.3B 视频生成的异步推理端点。
AWS 介绍了结合 Amazon Nova Act 和 Amazon Bedrock AgentCore 构建智能体驱动合成监控的方案,以解决传统 Selenium 或 Playwright 依赖 DOM 选择器容易因前端 UI 改动而失效的问题。
AWS 介绍了跨账户自动化管理 Amazon Textract 适配器生命周期的方法,提供 CloudFormation 和 Terraform 模板与多阶段处理流水线。
Simon Willison 演示了结合 Claude Opus 5.5 和 Claude Code 快速制作演讲幻灯片动态素材的全流程。他提供参考照片与提示词让 Claude Opus 5.5 生成了包含 20 多只像素鸮鹦鹉跳舞互动的 HTML5 Canvas 网页,随后指示本地 Claude Code 调用 Playwright 编写自动化脚本模拟点击并录制成 15 秒视频。
GitHub Copilot app 的 canvases 可按自然语言描述生成自定义工作流界面,并由用户与智能体共同操作和更新。用户在智能体会话中运行 `/create-canvas`,描述工作流、界面操作和智能体操作即可创建;生成的 canvas 可保存为扩展,也可从 Awesome Copilot 使用社区分享的扩展。
推荐理由:文章把创建 canvas 的提示词拆成工作流、界面可执行操作和智能体操作三部分,并说明共享状态如何支持双方同步修改,提供了可迁移的设计思路。
AWS 推出结合 Amazon EKS、EFA 与 DeepEP 扩展大规模 MoE 模型强化学习(RL)训练的架构方案,将训练吞吐量提升 40%。该方案针对 RLHF 与 GRPO 等后训练流程,协调分布式 rollout 推理与策略训练的异构计算负载。同时利用 DeepEP 优化跨节点的专家并行(EP)all-to-all 通信,缓解大规模扩展时的网络带宽瓶颈。
在 Amazon SageMaker HyperPod 上利用开源 RL 框架 SkyRL 与 GRPO 算法训练 Qwen3-VL-8B,可将 64 迷宫评估集的解决率从 43.75% 提升至 95% 以上。
AWS 团队分享了智能体助手 NarrateAI 在 Amazon Bedrock 上的工程实践,通过五项协同技术实现 99.3% 的数值准确率并兼顾实时流式响应。系统采用自适应流水线编排将调用量减少 72%,通过跨账号多模型故障转移解决 API 限流,并基于生产者-消费者架构实现逐段实时评估与两阶段数据校验,将评估等待延迟降低 86.8%。
推荐理由:原文详细拆解了流式段落评估与两阶段数值校验的工程架构,读者可以据此设计低延迟高准确率的大模型质检流水线。
AWS 介绍了如何通过 Amazon SageMaker JumpStart 将开源语音生成模型 Qwen3-TTS-12Hz-1.7B-Base 部署为托管实时推理端点。
Datacor 在 TrackAbout 方案中集成 Amazon Quick Sight,为管理着 2750 万资产和每月超 72.5 万份账单的气体与焊接分销商构建自助式租赁分析系统。该方案通过自动化跨云管道将运营数据定时同步至 AWS Quick Sight SPICE 引擎,提供交互式仪表板与生成式 BI 自然语言查询能力。业务用户无需提 IT 工单即可实时分析车队利用率与收入回收等指标。
Runway 的 GWM Worlds 2 研究预览通过 WorldPrompt,让用户设定模拟环境并创建可实时提示的时间戳事件。它以连续 720p、24 fps 视频和 48,000 Hz 音频呈现交互世界,模型经过 WorldPrompt 微调、自回归后训练和蒸馏。文章还讨论了误差累积、上下文管理和长期记忆等挑战,以及用模拟环境测试 Agent 和机器人等用途。
GitHub 在 GitHub Copilot app 重建了 Pull Request 视图,使超大型 diff 也能保持流畅渲染与滚动。团队用一个包含 2,200 个文件、超过 100 万行改动和 400 多条行内评论的开源 PR 检验性能。实现上将确定的代码行几何与动态评论区块分开处理,并结合延迟测量、滚动锚点校正和自动化性能检测。
该交互式工具通过具体示例解析 Shadow roots 与 Shadow DOM 的工作原理。内容演示了样式封装、继承、slots、parts 以及 JavaScript 访问机制,展示 shadow roots 如何构建带有私有样式和元素的隔离 DOM 树,并以受控方式与页面 DOM 交互。该演示由针对 Fable 5.1 Medium 的提示词生成。
《麻省理工科技评论》公布了美墨边境“虚拟墙”监控塔死亡地图的调查方法,历时 15 个月分析了 2015 年以来的近 4000 起移民死亡案例与数百座监控塔部署记录。团队通过公开记录申请获取多地报告,使用 Anthropic Claude API 批量提取坐标并人工核验,结合卫星图像确定塔台上线时序,并通过 30 米高程网格进行了视线遮挡分析。
ChatGPT Work 与 Codex 的分析功能可帮助团队全面掌握 AI 的使用情况与支出成本。同时,该功能还能协助识别团队培训需求,并将 AI 采用情况与实际业务成果紧密挂钩。
GitHub 日本和韩国市场营销负责人用 GitHub Copilot、GitHub Issues 和 GitHub Actions 自动化活动流程,使活动可从单个 GitHub Issue 建立,并自动筛查报名者、处理会后工作。
推荐理由:文章把活动运营拆成 Issue 表单、标签触发的 Actions 与 Markdown 技能,并加入 DRY_RUN 和审查流程,提供了可迁移的自动化搭建思路。
OpenAI 分享了其在线存储系统 Habitat 的架构演进历程。该系统已从一个 Python 库发展为全球分布式存储平台,目前支撑着超 10 亿 ChatGPT 用户以及每秒 22M 次请求。
GitHub Copilot app 的内置差异、终端和浏览器面板,让用户无需离开应用即可审查智能体的代码变更、运行代码并测试界面。网站示例中,用户可以运行 `npm run dev`,再用 Pick & Polish 选择界面元素并让智能体调整。确认功能可用后,用户可以在 Copilot app 中接受修改并创建 pull request。
César de la Fuente 实验室利用 Codex 与 ChatGPT 检索现存及已灭绝生物的基因组,搜寻候选抗菌分子以对抗耐药性感染。
麻省理工学院(MIT)研究人员利用 GPT-5.6 Sol 结合 Codex,实现了自主运行量子计算实验、分析实验结果以及校准量子比特(qubits)。该工作展示了大模型在量子计算实验流程自动化中的具体应用。
GitHub Copilot app 支持通过并行智能体会话同时执行多个开发任务。每个会话运行在独立的 Git worktree 上并保留各自上下文,彼此互不干扰且无需等待上一个任务完成。开发者可以在统一的会话视图中跟踪各项任务进度并集中审查结果,降低多任务切换成本。
推荐理由:原文介绍了利用 Git worktree 隔离机制实现多智能体并行执行的具体机制,有助于开发者优化多任务协同工作流。