跳到正文
原文
AWS Machine Learning Blog· Ashvin Nihalani·· 6 天前

基于 EFA 和 DeepEP 在 Amazon EKS 上扩展 MoE 强化学习,吞吐量提升 40%

Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput

SI 导读

AWS 结合 Amazon EKS、EFA 与 DeepEP,为大规模 MoE 模型的 RLHF/GRPO 强化学习后训练提供架构方案,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 循环,通过 DeepEP 优化 Expert Parallelism 的 all-to-all 通信,缓解跨节点带宽瓶颈。

SI 评分33

来源:AWS Machine Learning Blog · aws.amazon.com

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有