Latent Space 专访 AIUC 创始人:为何保险与安全标准是 AI 智能体落地的关键
AI 承保与安全标准初创公司 AIUC 宣布完成 4000 万美元 A 轮融资,联合创始人 Rune Kvist 在 Latent Space 访谈中阐述了如何通过技术标准与保险机制解决智能体落地中的责任与信任难题。
AI 承保与安全标准初创公司 AIUC 宣布完成 4000 万美元 A 轮融资,联合创始人 Rune Kvist 在 Latent Space 访谈中阐述了如何通过技术标准与保险机制解决智能体落地中的责任与信任难题。
OpenAI 分享了一套用于追踪、调查和披露模型不对齐(misalignment)行为的框架。该框架同时附带了 6 份关于模型出现意外或引发担忧行为的调查报告。
推荐理由:原文提供了追踪与披露模型不对齐行为的流程框架,读者可以借此了解前沿机构处理模型异常行为的标准与实践。
OpenAI 联合 AARP 在全美 10 个城市为 1,000 名老年人推出免费的 ChatGPT 实操工作坊。该项目旨在帮助老年群体安全掌握实用的 AI 技能,并将人工智能应用于日常生活中。
NVIDIA 公布 MLPerf Inference v6.1 评测结果,Vera Rubin NVL72 系统在 Qwen3-VL 上吞吐量最高达到 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上吞吐量提升最高达 2.5 倍。
推荐理由:原文给出了新一代机架在主流推理模型上的基准吞吐数据,读者可以据此评估大规模算力集群的推理能效与扩展收益。
Emerald AI、Google 与 NVIDIA 联合成立 AI 能源管理联盟(AEMA),旨在推动可根据电网条件动态管理用电的弹性 AI 数据中心。联盟遵循技术中立与基于性能的原则,致力于制定故障穿越与应急响应标准、加快设施并网并优化成本分摊。通过将算力设施转变为可调度的电网资源,加速 AI 基础设施的可持续扩展。
OpenAI 推出由 AI 驱动的新广告体验,包括赞助智能体 Sponsored Agents 以及面向营销人员的专用工具。该方案还涵盖了与 HubSpot 和 Shopify 的平台集成。
推荐理由:原文介绍了 OpenAI 在 AI 广告形态上的新探索,涉及赞助智能体以及与现有营销电商平台的整合方式。
Hex 采用 GPT-6 Astra 赋能其数据智能体,将复杂的数据分析答案直接转化为交互式可视化图表与报告,便于员工在企业内部进行展示与分享。
ChatGPT Work 与 Codex 的分析功能可帮助团队全面掌握 AI 的使用情况与支出成本。同时,该功能还能协助识别团队培训需求,并将 AI 采用情况与实际业务成果紧密挂钩。
TypeSafe 推出基于 RLCD 训练的决策模型 Jev,专用于分类、评分和路由等结构化决策,而非生成自由文本。该模型相比传统 LLM 提速 20-200 倍、成本降低 40-400 倍且输出 token 免费,具备并行采样与无幻觉等特性。同期动态还包括 Periodic Labs 发布材料科学模型 Neon 以及 Google 上线 Gemini 3.8 Live。
OpenAI 最新经济研究(OpenAI Economic Research)揭示了劳动者如何在传统岗位角色之外使用 AI。该项研究重点展示了哪些由 AI 赋能的新活动正在逐步演变为员工日常工作中经常重复出现的固定组成部分。
曼彻斯特大学利用 NVIDIA Earth-2 生成式框架构建了英国全境空气污染预测模型,分辨率达 2-3 平方公里。该模型在 Isambard-AI 超算的单节点 8 张 GPU 上仅用 2 天便完成训练,并可在搭载 GB10 Grace Blackwell 超级芯片的 DGX Spark 桌面系统上运行推理。团队计划开源相关训练数据与工作流。
Salesforce 在 Dreamforce 大会上宣布推出首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super 构建并在企业基础设施内完全私有化运行。
推荐理由:原文展现了开源模型在企业垂直领域的落地路径,读者可据此了解专用推理模型与企业智能体的构建方式。
Good Start Labs 探索将策略游戏作为强化学习环境训练大模型,其实验表明在《1830》与《外交》等游戏中训练的多轮 Agent 决策与规划能力可以迁移到金融研究和客户支持等真实基准任务中。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,支持在语音交互的同时执行多步深度推理和后台工具调用。
推荐理由:模型在保持实时语音交互流的同时引入并行深度推理与工具调用,为复杂业务流程中的语音智能体落地提供了参考。
NVIDIA 在 AI Infra Summit 上详细介绍了面向 AI 工厂的 DSX 架构套件,通过动态电力分配与电网需求响应提升每兆瓦的计算产出。云服务商 Lambda 在 HGX B200 服务器上的实测显示,利用 DSX MaxLPS 动态调度,集群在相同电力预算下的 Token 吞吐量提升了 24%,每瓦性能提升 23%。
Fyxer 结合 OpenAI 模型、微调、记忆能力与真实用户反馈,打造受人信赖的 AI 高管助理。该系统主要用于整理收件箱,并以符合每位用户自身语气与风格的方式代写电子邮件草稿。
Perplexity 已在端到端系统中采用 GPT-6 Astra,主要用于撰写沟通内容、修改软件以及监控生产系统。相比早期模型,团队对其运行过程的人工介入与检查频率大幅降低。
GitHub 日本和韩国市场营销负责人用 GitHub Copilot、GitHub Issues 和 GitHub Actions 自动化活动流程,使活动可从单个 GitHub Issue 建立,并自动筛查报名者、处理会后工作。
推荐理由:文章把活动运营拆成 Issue 表单、标签触发的 Actions 与 Markdown 技能,并加入 DRY_RUN 和审查流程,提供了可迁移的自动化搭建思路。
GPT-6 Astra 提升了 Devin 测试软件并验证其正常运行的能力。该改进旨在帮助工程师减少代码审查的工作量,从而加快交付更多代码与功能。
OpenAI 分享了其在线存储系统 Habitat 的架构演进历程。该系统已从一个 Python 库发展为全球分布式存储平台,目前支撑着超 10 亿 ChatGPT 用户以及每秒 22M 次请求。
GitHub Copilot app 的内置差异、终端和浏览器面板,让用户无需离开应用即可审查智能体的代码变更、运行代码并测试界面。网站示例中,用户可以运行 `npm run dev`,再用 Pick & Polish 选择界面元素并让智能体调整。确认功能可用后,用户可以在 Copilot app 中接受修改并创建 pull request。
César de la Fuente 实验室利用 Codex 与 ChatGPT 检索现存及已灭绝生物的基因组,搜寻候选抗菌分子以对抗耐药性感染。
OpenAI 在 ChatGPT Work 中推出 Data agent。该智能体支持用户使用自然语言连接企业数据、挖掘业务洞察,并通过 AI 构建交互式仪表盘。
推荐理由:原文简要说明了企业数据分析智能体的能力定位,读者可以据此了解其在报表与洞察工作流中的落地方式。
OpenAI 与 GSA 宣布面向符合条件的联邦、州、地方及部落政府提供 AI 接入支持。符合条件的机构可享受 0 美元许可费以及 50% 的用量折扣,同时还将获得扩展的网络防御支持。
OpenAI 推出面向金融行业的 ChatGPT for Financial Services,结合内置金融数据与 GPT-6 Astra 模型。该产品旨在辅助行业用户进行金融研究、财务建模以及制作可直接交付客户的材料。
推荐理由:产品结合内置金融数据与模型能力,为金融领域的研究分析与建模工作流提供了针对性工具。
OpenAI 在 API 中上线 GPT-Live-1 模型,提供自然的全双工语音对话交互。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。
推荐理由:原文给出了新模型的全双工语音与电话支持能力,开发者可以据此评估语音交互方案的集成路径。
OpenAI 推出 Agents API,这是一项基于 Codex harness 的托管服务,用于构建和运行云端智能体。该 API 提供了工作流编排、长会话管理以及工具调用等核心能力。
推荐理由:OpenAI 推出托管式 Agents API,为开发者构建具备编排、长会话与工具调用能力的云端智能体提供了官方基础设施。
Paul Christiano 正式加入 OpenAI 基金会董事会及其安全与安保委员会。他将为该机构带来在 AI 对齐、安全及标准制定方面的经验。
Chris Lehane 指出,更强大的 AI 能力需要更强有力的安全证据、共享标准以及持久的政策行动。他呼吁各方在当前的 AI 政策窗口期内积极采取行动,以建立长效的治理机制。
OpenAI 推出面向商业办公的模型 GPT-6 Astra。该模型具备高级推理能力与电脑操作功能,并增强了写作与设计判断表现。
推荐理由:原文给出了新模型面向办公场景在推理、电脑操作及设计判断方面的核心能力定位。
麻省理工学院(MIT)研究人员利用 GPT-5.6 Sol 结合 Codex,实现了自主运行量子计算实验、分析实验结果以及校准量子比特(qubits)。该工作展示了大模型在量子计算实验流程自动化中的具体应用。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组中全部 90 亿个单核苷酸变异分子影响的预计算预测数据。该平台拥有 1PB 数据集,并推出整合 AlphaGenome 与 AlphaMissense 的 AVI 综合评分,可同时覆盖编码区和 98% 的非编码区突变分析。
推荐理由:原文通过预计算90亿个单核苷酸突变影响并提供综合评分,为生物医学研究者提供了快速筛选罕见病致病变异的可复用图谱。
OpenAI 探讨了更强大、更实惠的 AI 如何拓展个人与企业所能完成的工作范畴。随着 AI 能力提升与成本下降,各组织能够以更具经济效益的方式实现业务增长。
OpenAI 推出 ChatGPT Images 2.5,可将用户的想法、草图和参考照片转化为更个性化、更精致且更贴合创意的图像。
OpenAI 正在扩大对新闻业的支持计划,覆盖从课堂到新闻编辑室的各个环节。该项目面向学生、教育工作者、记者及新闻机构,主要提供工具、培训与合作伙伴关系支持。
OpenAI 宣布分享一份由 AI 生成的纳维-斯托克斯(Navier–Stokes)千禧年大奖难题解决方案。该成果包含了详细的研究说明报告以及在 Lean 语言中构建的形式化证明。
推荐理由:原文给出了 AI 求解数学难题的说明与形式化证明形式,读者可据此了解形式化验证在复杂前沿研究中的结合方式。
OpenAI 现已开放一项 500 万美元($5 million)资助项目的申请,用于支持针对生成式 AI 如何影响青少年发展、福祉与安全性的独立研究。
1Password 工程师通过使用 Codex 快速构建新功能与内部工具,将工程生产力提升了 21%。在加速达到生产就绪状态的同时,团队依然保持了严格的安全策略。
OpenAI 联合 AIRPPU 与 WAN-IFRA 推出了一项 AI 项目。该项目旨在帮助乌克兰新闻机构增强创新能力与业务韧性,进一步支持当地独立新闻业的发展。
GitHub 宣布推出 Project HydraFusion 研究预览版,通过运行时多模型编排在不同供应商的模型间构建执行计划。
推荐理由:GitHub 详细拆解了在编码 Agent 中通过单模型、级联与交叉审查三种执行模式优化质量与成本权衡的工程方案。