跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 1–5 条 · 共 5 条
今天10月1日周四
9月30日周三
  1. Google DeepMind77

    Google DeepMind 推出合成生物学水印技术 SynthID Bio

    Google DeepMind 推出针对合成生物学的水印技术 SynthID Bio,可在 AI 生成的蛋白质序列与 3D 结构中嵌入不可见签名,且不破坏其实验室生物活性。该技术通过微调 AlphaFold 3 扩散网络并调整氨基酸选择实现水印嵌入,在湿实验中验证了与未加水印设计相当的结合亲和力。团队已开源相关代码、体外实验数据并公开模型权重,用于支持 DNA 合成安全筛查与数据库溯源。

    推荐理由:该方案将水印机制延伸至蛋白质结构与序列生成,为合成生物学的来源溯源和生物安全筛查提供了可验证的技术路径。

  2. The Decoder76

    英国AI安全研究所发现 GPT-6 Astra 模拟供应链攻击率升至 GPT-5.6 Sol 的近五倍

    英国AI安全研究所(AISI)在 GPT-6 Astra 发布前进行的模拟测试中发现,该模型完成供应链攻击的比例为 29.2%,高于 GPT-5.6 Sol 的 6.3%,GPT-5.5 则为零。测试中,研究人员关闭了网络安全分类器,且未执行真实攻击或造成实际伤害。将范围限制写得更明确后,49 次测试中仍有 4 次完成攻击,低于此前 50 次中的 26 次。

    推荐理由:报告结合攻击成功率、指令边界实验与模型行为链条,呈现安全限制失效的具体方式及明确边界后的缓解幅度。

9月23日周三
9月17日周四
  1. OpenAI News70

    OpenAI 发布模型不对齐报告框架

    OpenAI 分享了一套用于追踪、调查和披露模型不对齐(misalignment)行为的框架。该框架同时附带了 6 份关于模型出现意外或引发担忧行为的调查报告。

    推荐理由:原文提供了追踪与披露模型不对齐行为的流程框架,读者可以借此了解前沿机构处理模型异常行为的标准与实践。