跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–7 条 · 共 7 条
今天10月1日周四
  1. AWS Machine Learning Blog83

    Claude Sonnet 5.5 正式上线 AWS Amazon Bedrock

    AWS 宣布 Claude Sonnet 5.5 正式上线 Amazon Bedrock 与 Claude Platform on AWS。该模型针对明确范围的编码与知识工作进行了优化,具备更快的生成速度和更低的单任务成本,支持生成架构图等更精细的文档。开发者可通过 Bedrock 控制台、Anthropic SDK 或 AWS SDK(Boto3)调用 global 推理配置文件接入使用。

    推荐理由:原文梳理了 Sonnet 5.5 在 Bedrock 上的适用场景与调用代码,开发者可据此评估其与 Opus 5.5 的分工配合。

  2. AWS Machine Learning Blog70

    xAI Grok 4.7 正式上线 Amazon Bedrock

    xAI 旗下前沿模型 Grok 4.7 正式上线 Amazon Bedrock,支持 500K context window、图像输入以及 low、medium、high 和 xhigh 四档推理力度配置。

    推荐理由:文章详细梳理了该模型在云端的推理配置与调用路径,开发者可以据此评估长流程智能体开发与推理成本控制。

9月30日周三
9月26日周六
  1. AWS Machine Learning Blog62

    AWS 详解 NarrateAI:在 Amazon Bedrock 上构建生产级大模型质量保证机制

    AWS 团队分享了智能体助手 NarrateAI 在 Amazon Bedrock 上的工程实践,通过五项协同技术实现 99.3% 的数值准确率并兼顾实时流式响应。系统采用自适应流水线编排将调用量减少 72%,通过跨账号多模型故障转移解决 API 限流,并基于生产者-消费者架构实现逐段实时评估与两阶段数据校验,将评估等待延迟降低 86.8%。

    推荐理由:原文详细拆解了流式段落评估与两阶段数值校验的工程架构,读者可以据此设计低延迟高准确率的大模型质检流水线。

9月24日周四
  1. Microsoft Research60

    Microsoft Research 展示机器人 Physical AI 推理卸载的实测结果

    Microsoft Research 的研究显示,将机器人 Physical AI 推理卸载至边缘或云端 GPU,可提升移动操作任务表现并延长续航。使用较轻 GPU 时,语义映射与规划速度最多下降 383%,导航及时检测障碍物的能力下降 30%,VLA 模型准确率下降 50%。

    推荐理由:文章将移动操作任务的实测结果与 Kubernetes 工具链结合,呈现了推理卸载对机器人性能和续航的影响,以及相应的部署方式。

9月23日周三
  1. OpenAI News73

    GPT-6 改进 Prompt Caching 机制

    GPT-6 改进了 Prompt Caching 机制,支持更高的缓存命中率、全新诊断工具以及显式断点控制。这些改进可帮助开发者在调用过程中更精确地管理缓存,从而降低请求延迟和使用成本。

    推荐理由:GPT-6 优化了 Prompt Caching 机制并增加了显式断点与诊断工具,有助于开发者在复杂调用场景中进一步降低延迟和成本。

9月16日周三