OpenAI 披露阻止协同模型蒸馏活动并加强防御措施
OpenAI 阻断了一起旨在提取受保护模型推理过程的协同模型蒸馏活动。官方表示正在进一步强化防御措施,以应对针对模型的对抗性蒸馏攻击。
OpenAI 阻断了一起旨在提取受保护模型推理过程的协同模型蒸馏活动。官方表示正在进一步强化防御措施,以应对针对模型的对抗性蒸馏攻击。
特朗普与Google、Anthropic、Meta、OpenAI、xAI和Nvidia等公司高管签署《前沿责任联合承诺》,约定由企业自律管理AI安全。协议提出四项安排,包括内部监控、专责团队、独立外部评估和董事会监督。协议未写明违反承诺的处罚,并称未来可能将这些步骤纳入法律或法规。
OpenAI 阐明了针对前沿模型及安全防护措施开展第三方 AI 安全评估的优先级与原则,强调评估过程需具备严格性、安全性与独立性。
OpenAI 阐述了构建共享全球 AI 标准的路径,呼吁在评估、报告和治理方面进行协同合作,以提升 AI 安全性。
OpenAI 推出《澳大利亚青少年安全蓝图》(Australian Youth Safety Blueprint)。该蓝图是一个包含六大支柱的路线图,旨在为青少年构建更安全的 AI 体验,在保护年轻群体的同时为其赋能。
Steve Yegge 宣布关闭 Gas Town 项目,同时 Databricks 披露向约 3,500 名工程师推广 GPT-6 Astra,该模型在复杂长程任务上表现优异,但使整体编码支出增加了约 60%。此外,OpenAI 正式发布了追踪与披露模型失准(misalignment)事件的形式化框架及 6 起案例报告。