跳到正文
原文
Hugging Face Blog·· 29 天前

用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出能力

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

SI 导读

一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做轻量微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准分数从 22.6% 提升到 29.7%。训练可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上跑 OpenAI 兼容服务。

SI 评分38

来源:Hugging Face Blog · huggingface.co

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有