OpenAI 提出前沿 AI 训练安全案例早期指引
OpenAI 提出了针对前沿 AI 训练安全案例(safety cases)的早期指引。该指引主要涵盖技术防护措施、运营实践,以及对模型未对齐事件的调查与应对机制。
OpenAI 提出了针对前沿 AI 训练安全案例(safety cases)的早期指引。该指引主要涵盖技术防护措施、运营实践,以及对模型未对齐事件的调查与应对机制。
SPEX(Spectral Explainer)与 ProxySPEX 可识别大语言模型中的关键交互,并支持特征、数据和模型组件归因。SPEX利用稀疏性和低阶性,通过策略性消融与解码分离影响模型行为的交互;ProxySPEX进一步利用层级性,在性能与 SPEX 相当时约减少 10x 消融次数。SPEX在上下文扩展至数千个特征时仍保持较高 faithfulness。
研究者提出一种基于分治法(divide and conquer)的异策强化学习(off-policy RL)范式,无需依赖传统的时间差分(TD)学习。该算法将长轨迹拆分为子任务并组合价值,理论上能对数级减少 Bellman 递归次数,避免自举带来的误差累积。该范式已在目标条件强化学习(goal-conditioned RL)中实现,能有效扩展至复杂的长时域任务。
新理论研究证明,word2vec 的学习过程在实际条件下可简化为无权最小二乘矩阵分解,最终学到的表征等价于对特定目标矩阵执行 PCA。从小初始化训练时,模型以离散步骤序列逐步学习正交线性子空间,每步递增嵌入矩阵的秩并降低损失。该学习动力学可求出闭式解,特征直接对应由语料共现统计构成的目标矩阵特征向量。