跳到正文

#数据/训练

今日 0 条
9月29日周二
9月26日周六
  1. AWS Machine Learning Blog41

    在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%

    AWS 推出结合 Amazon EKS、EFA 与 DeepEP 扩展大规模 MoE 模型强化学习(RL)训练的架构方案,将训练吞吐量提升 40%。该方案针对 RLHF 与 GRPO 等后训练流程,协调分布式 rollout 推理与策略训练的异构计算负载。同时利用 DeepEP 优化跨节点的专家并行(EP)all-to-all 通信,缓解大规模扩展时的网络带宽瓶颈。

8月21日周五
3月13日周五
  1. Berkeley AI Research48

    LLM 的规模化交互识别方法

    SPEX(Spectral Explainer)与 ProxySPEX 可识别大语言模型中的关键交互,并支持特征、数据和模型组件归因。SPEX利用稀疏性和低阶性,通过策略性消融与解码分离影响模型行为的交互;ProxySPEX进一步利用层级性,在性能与 SPEX 相当时约减少 10x 消融次数。SPEX在上下文扩展至数千个特征时仍保持较高 faithfulness。

11月1日周六
  1. Berkeley AI Research43

    无需 TD 学习的强化学习

    研究者提出一种基于分治法(divide and conquer)的异策强化学习(off-policy RL)范式,无需依赖传统的时间差分(TD)学习。该算法将长轨迹拆分为子任务并组合价值,理论上能对数级减少 Bellman 递归次数,避免自举带来的误差累积。该范式已在目标条件强化学习(goal-conditioned RL)中实现,能有效扩展至复杂的长时域任务。

9月1日周一
  1. Berkeley AI Research49

    word2vec 究竟学到了什么?

    新理论研究证明,word2vec 的学习过程在实际条件下可简化为无权最小二乘矩阵分解,最终学到的表征等价于对特定目标矩阵执行 PCA。从小初始化训练时,模型以离散步骤序列逐步学习正交线性子空间,每步递增嵌入矩阵的秩并降低损失。该学习动力学可求出闭式解,特征直接对应由语料共现统计构成的目标矩阵特征向量。