AWS Machine Learning Blog· Huibin Shen·· 4 小时前
Amazon SageMaker AI 使用多轮 RL 微调搜索智能体
Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI
SI 导读
在 Amazon SageMaker AI 上使用多轮强化学习(MTRL)微调 Qwen3.6-27B 模型,构建能自主决策检索策略的搜索智能体。该方法通过优化完整多轮轨迹,使小模型兼具前沿模型的可靠性与低成本推理速度。此前单轮 RL 或监督微调难以有效处理多步交互中的依赖关系。
SI 评分39
来源:AWS Machine Learning Blog · aws.amazon.com