跳到正文
原文
AWS Machine Learning Blog· Huibin Shen·· 4 小时前

Amazon SageMaker AI 使用多轮 RL 微调搜索智能体

Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI

SI 导读

在 Amazon SageMaker AI 上使用多轮强化学习(MTRL)微调 Qwen3.6-27B 模型,构建能自主决策检索策略的搜索智能体。该方法通过优化完整多轮轨迹,使小模型兼具前沿模型的可靠性与低成本推理速度。此前单轮 RL 或监督微调难以有效处理多步交互中的依赖关系。

SI 评分39

来源:AWS Machine Learning Blog · aws.amazon.com

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有