跳到正文
原文
AWS Machine Learning Blog· Ashvin Nihalani·· 12 天前AI 评分31

AWS 如何基于 Amazon EKS、EFA 与 DeepEP 扩展 MoE 强化学习,吞吐提升 40%

Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput

AI 导读

AWS 提出基于 Amazon EKS、EFA 和 DeepEP 的架构,用于加速 MoE 模型的大规模强化学习后训练,吞吐量提升 40%。该方案针对 RLHF、PPO、GRPO 等工作负载,解决 rollout 生成与策略训练的资源平衡、跨数百个加速器的高吞吐通信,以及 Expert Parallelism 带来的动态 all-to-all token 路由通信开销等问题。

来源:AWS Machine Learning Blog · aws.amazon.com