OpenAI 披露阻止协同模型蒸馏活动并加强防御措施
OpenAI 阻断了一起旨在提取受保护模型推理过程的协同模型蒸馏活动。官方表示正在进一步强化防御措施,以应对针对模型的对抗性蒸馏攻击。
OpenAI 阻断了一起旨在提取受保护模型推理过程的协同模型蒸馏活动。官方表示正在进一步强化防御措施,以应对针对模型的对抗性蒸馏攻击。
Google DeepMind 推出针对合成生物学的水印技术 SynthID Bio,可在 AI 生成的蛋白质序列与 3D 结构中嵌入不可见签名,且不破坏其实验室生物活性。该技术通过微调 AlphaFold 3 扩散网络并调整氨基酸选择实现水印嵌入,在湿实验中验证了与未加水印设计相当的结合亲和力。团队已开源相关代码、体外实验数据并公开模型权重,用于支持 DNA 合成安全筛查与数据库溯源。
推荐理由:该方案将水印机制延伸至蛋白质结构与序列生成,为合成生物学的来源溯源和生物安全筛查提供了可验证的技术路径。
OpenAI 提出了针对前沿 AI 训练安全案例(safety cases)的早期指引。该指引主要涵盖技术防护措施、运营实践,以及对模型未对齐事件的调查与应对机制。
OpenAI CEO Sam Altman 在联合国安理会发表讲话。他在发言中重点讨论了 AI 安全、人类控制以及国际合作等核心议题。
推荐理由:官方公开了 Sam Altman 在联合国安理会的发言,读者可以了解头部机构在国际治理与安全合作上的立场。
OpenAI 阐明了针对前沿模型及安全防护措施开展第三方 AI 安全评估的优先级与原则,强调评估过程需具备严格性、安全性与独立性。
OpenAI 阐述了构建共享全球 AI 标准的路径,呼吁在评估、报告和治理方面进行协同合作,以提升 AI 安全性。
OpenAI 推出《澳大利亚青少年安全蓝图》(Australian Youth Safety Blueprint)。该蓝图是一个包含六大支柱的路线图,旨在为青少年构建更安全的 AI 体验,在保护年轻群体的同时为其赋能。
OpenAI 分享了一套用于追踪、调查和披露模型不对齐(misalignment)行为的框架。该框架同时附带了 6 份关于模型出现意外或引发担忧行为的调查报告。
推荐理由:原文提供了追踪与披露模型不对齐行为的流程框架,读者可以借此了解前沿机构处理模型异常行为的标准与实践。