AWS Machine Learning Blog· Nilesh PS·· 6 天前
在 Amazon SageMaker HyperPod 上用 SkyRL 加速多模态 RL 训练
Accelerate multimodal RL training with SkyRL on Amazon SageMaker HyperPod
SI 导读
AWS 展示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型走迷宫,基于 GRPO 从 VisGym SFT 检查点出发,在固定 64 个迷宫的评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
SI 评分28
来源:AWS Machine Learning Blog · aws.amazon.com