持久化工作流基础设施初创公司 Restate 完成 2000 万美元 A 轮融资
为 AI Agent 与多步骤工作流提供持久化执行引擎的初创公司 Restate 宣布完成 2000 万美元 A 轮融资,由 Singular 领投,Redpoint Ventures 与 Capital One Ventures 参投。
为 AI Agent 与多步骤工作流提供持久化执行引擎的初创公司 Restate 宣布完成 2000 万美元 A 轮融资,由 Singular 领投,Redpoint Ventures 与 Capital One Ventures 参投。
AWS 宣布 Claude Sonnet 5.5 正式上线 Amazon Bedrock 与 Claude Platform on AWS。该模型针对明确范围的编码与知识工作进行了优化,具备更快的生成速度和更低的单任务成本,支持生成架构图等更精细的文档。开发者可通过 Bedrock 控制台、Anthropic SDK 或 AWS SDK(Boto3)调用 global 推理配置文件接入使用。
推荐理由:原文梳理了 Sonnet 5.5 在 Bedrock 上的适用场景与调用代码,开发者可据此评估其与 Opus 5.5 的分工配合。
xAI 旗下前沿模型 Grok 4.7 正式上线 Amazon Bedrock,支持 500K context window、图像输入以及 low、medium、high 和 xhigh 四档推理力度配置。
推荐理由:文章详细梳理了该模型在云端的推理配置与调用路径,开发者可以据此评估长流程智能体开发与推理成本控制。
康泰纳仕(Condé Nast)基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建了多模态视频检索方案,覆盖超 140,000 个视频。该方案采用 TwelveLabs Marengo 嵌入模型联合编码字幕、画面和音频,支持自然语言与图像检索并精确定位时间戳。新系统将编辑团队的内容检索耗时从平均每次 250 分钟大幅缩短至 2 分钟以内。
Microsoft Research 的机器学习系统为美国本土 66,935 座变电站预测空间天气引发的电网风险,可提前 30–60 分钟生成地点级风险估计。系统结合太阳风观测、AE 和 Dst 指数预报,以及各站位置和地质条件,评估显示其对重大事件的检出率为 76.5%。文中展示的是代表性风暴情景下的模型输出;作者指出,系统投入电网运行前还需要结合公用事业单位和运营数据进一步验证。
CoreWeave宣布在CoreWeave Cloud提供NVIDIA Vera Rubin NVL72,并推出用于训练、评估和改进模型与智能体的CoreWeave Forge。
推荐理由:文章将Vera Rubin NVL72的云端可用性与Cognition实测、Forge训练至生产闭环结合,呈现智能体工作负载从算力部署到持续改进的具体路径。
DeepSeek与华为合作推出面向华为昇腾芯片的开源编程工具,核心是TileLang,另包括计算库和芯片间数据传输库。双方还优化了由128颗昇腾950芯片组成的超节点。文章指出,完善软件生态是国产芯片竞争中的重要环节,并讨论了CUDA生态优势与相关基准测试的局限。
Cerebras Systems 联合创始人兼 CEO Andrew Feldman 将在 TechCrunch Disrupt 2026 探讨 AI 算力、能源及硬件基础设施的扩展瓶颈。Cerebras 主打晶圆级计算并已推出最新一代 CS-4,曾在 5 月 IPO 募资 $5.5 billion,并与 OpenAI 签署协议在 2026 至 2028 年间部署 750 MW 系统。
Amazon Bedrock 现已在印度提供 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过印度地理跨区域推理处理请求。
HPE主张,企业在AI需求稳定且规模足够时,应评估自有容量是否比按请求付费更经济,并将AI容量转化为可持续利用的业务资产。Deloitte数据显示,员工获得AI的比例在2025年上升5%,至少40%的AI项目已投入生产的企业占比预计将在六个月内翻倍。要实现投资价值,企业还需推动工作负载上线、治理使用并持续提高容量利用率。
AWS 推出在 Amazon SageMaker AI 上基于 vLLM-Omni 深度学习容器(DLC)部署 Qwen3-TTS 的实时语音生成方案。该方案利用 SageMaker 双向流式传输(HTTP/2 WebSocket),通过单个持久连接流式输入文本并实时返回 24 kHz PCM 音频块。
用户可在 Amazon SageMaker AI 上基于 AWS vLLM-Omni 深度学习容器(DLC),实现从文本生成图像并转为短视频的工作流。方案使用同个容器镜像分别部署用于 FLUX.2-klein-4B 图像生成的实时端点,以及用于 Wan2.1-VACE-1.3B 视频生成的异步推理端点。
AWS 介绍了跨账户自动化管理 Amazon Textract 适配器生命周期的方法,提供 CloudFormation 和 Terraform 模板与多阶段处理流水线。
AWS 推出结合 Amazon EKS、EFA 与 DeepEP 扩展大规模 MoE 模型强化学习(RL)训练的架构方案,将训练吞吐量提升 40%。该方案针对 RLHF 与 GRPO 等后训练流程,协调分布式 rollout 推理与策略训练的异构计算负载。同时利用 DeepEP 优化跨节点的专家并行(EP)all-to-all 通信,缓解大规模扩展时的网络带宽瓶颈。
在 Amazon SageMaker HyperPod 上利用开源 RL 框架 SkyRL 与 GRPO 算法训练 Qwen3-VL-8B,可将 64 迷宫评估集的解决率从 43.75% 提升至 95% 以上。
AWS 团队分享了智能体助手 NarrateAI 在 Amazon Bedrock 上的工程实践,通过五项协同技术实现 99.3% 的数值准确率并兼顾实时流式响应。系统采用自适应流水线编排将调用量减少 72%,通过跨账号多模型故障转移解决 API 限流,并基于生产者-消费者架构实现逐段实时评估与两阶段数据校验,将评估等待延迟降低 86.8%。
推荐理由:原文详细拆解了流式段落评估与两阶段数值校验的工程架构,读者可以据此设计低延迟高准确率的大模型质检流水线。
AWS 介绍了如何通过 Amazon SageMaker JumpStart 将开源语音生成模型 Qwen3-TTS-12Hz-1.7B-Base 部署为托管实时推理端点。
Datacor 在 TrackAbout 方案中集成 Amazon Quick Sight,为管理着 2750 万资产和每月超 72.5 万份账单的气体与焊接分销商构建自助式租赁分析系统。该方案通过自动化跨云管道将运营数据定时同步至 AWS Quick Sight SPICE 引擎,提供交互式仪表板与生成式 BI 自然语言查询能力。业务用户无需提 IT 工单即可实时分析车队利用率与收入回收等指标。
Google 将于 10 月 1 日发射首颗名为 MVP 的实验卫星,正式启动 Project Suncatcher 轨道 AI 数据中心的在轨验证。该卫星由 Planet Labs 制造,体积约为冰箱大小,配有约 1 千瓦功率的太阳能电池板,内部集成了 4 颗 Google 自研 TPU 加速器,用于测试在太空环境中运行 AI 模型训练与推理任务。
Microsoft Research 的研究显示,将机器人 Physical AI 推理卸载至边缘或云端 GPU,可提升移动操作任务表现并延长续航。使用较轻 GPU 时,语义映射与规划速度最多下降 383%,导航及时检测障碍物的能力下降 30%,VLA 模型准确率下降 50%。
推荐理由:文章将移动操作任务的实测结果与 Kubernetes 工具链结合,呈现了推理卸载对机器人性能和续航的影响,以及相应的部署方式。
GPT-6 改进了 Prompt Caching 机制,支持更高的缓存命中率、全新诊断工具以及显式断点控制。这些改进可帮助开发者在调用过程中更精确地管理缓存,从而降低请求延迟和使用成本。
推荐理由:GPT-6 优化了 Prompt Caching 机制并增加了显式断点与诊断工具,有助于开发者在复杂调用场景中进一步降低延迟和成本。
NVIDIA推出NVIDIA DSX Ready认证计划,面向符合适用NVIDIA DSX AI工厂参考设计要求的合作伙伴产品与解决方案,首批涵盖BESS和CDU。首批获得认证的包括Hitachi Energy、LG Energy Solution和Tesla的BESS,以及LG Electronics、LiquidStack和Vertiv的CDU;后续还将扩展至其他基础设施和软件类别。
NVIDIA指出,Physical AI要实现规模化部署,必须在硬件、软件、AI、运行环境及部署生命周期各层持续保障安全。面对动态环境、AI行为风险和持续更新,安全验证还需结合仿真、合成数据与真实场景测试。NVIDIA Halos覆盖自动驾驶汽车与机器人开发、验证和部署环节,提供全栈安全系统。
NVIDIA 撰文指出 AI 安全是一个具备明确控制与责任主体的工程问题,需要贯穿模型、工作流线束与运行时的整个 Agent 栈建立强制边界。文章提出安全策略必须独立于智能体推理逻辑由运行环境强行约束,并介绍了用于沙箱隔离与资源管控的开源安全运行时 NVIDIA OpenShell 以及行业联盟的协同防御实践。
Simon Willison 发布 llm-keys-ui 0.1 插件,用于在通过手机控制远程编码智能体时向机器配置 API 密钥,避免直接在对话窗口中明文粘贴。用户可通过 `uvx --with llm-keys-ui llm keys-ui --all` 命令启动 Web 界面输入密钥,远程环境后续可直接通过命令行读取并使用。
NVIDIA 公布 MLPerf Inference v6.1 评测结果,Vera Rubin NVL72 系统在 Qwen3-VL 上吞吐量最高达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上吞吐量提升最高达 2.5 倍。
推荐理由:原文给出了新一代机架在主流推理模型上的基准吞吐数据,读者可以据此评估大规模算力集群的推理能效与扩展收益。
Emerald AI、Google 与 NVIDIA 联合成立 AI 能源管理联盟(AEMA),旨在推动可根据电网条件动态管理用电的弹性 AI 数据中心。联盟遵循技术中立与基于性能的原则,致力于制定故障穿越与应急响应标准、加快设施并网并优化成本分摊。通过将算力设施转变为可调度的电网资源,加速 AI 基础设施的可持续扩展。
曼彻斯特大学利用 NVIDIA Earth-2 生成式框架构建了英国全境空气污染预测模型,分辨率达 2-3 平方公里。该模型在 Isambard-AI 超算的单节点 8 张 GPU 上仅用 2 天便完成训练,并可在搭载 GB10 Grace Blackwell 超级芯片的 DGX Spark 桌面系统上运行推理。团队计划开源相关训练数据与工作流。
NVIDIA 在 AI Infra Summit 上详细介绍了面向 AI 工厂的 DSX 架构套件,通过动态电力分配与电网需求响应提升每兆瓦的计算产出。云服务商 Lambda 在 HGX B200 服务器上的实测显示,利用 DSX MaxLPS 动态调度,集群在相同电力预算下的 Token 吞吐量提升了 24%,每瓦性能提升 23%。
OpenAI 分享了其在线存储系统 Habitat 的架构演进历程。该系统已从一个 Python 库发展为全球分布式存储平台,目前支撑着超 10 亿 ChatGPT 用户以及每秒 22M 次请求。
Microsoft Research 发布 Skala-1.1,并扩大 Skala 在计算化学软件中的可用范围。Skala-1.1 使用比首个公开版本多 2.5 倍的数据训练,在 GMTKN55 的 55 个类别中有 32 个排名第一,加权平均误差为 2.8 kcal/mol。
K-Search 扩展了 MLX 后端,并用结构化 CUDA-to-MLX 转译知识优化 Apple Silicon 内核。Attention 内核达到原生 MLX Attention 的 0.97 倍速度;在 M1 Max 上,Mamba SSM 内核的 prefill 速度最高约为社区版 mlx-lm 的 20 倍,decode 表现则相近。