Hugging Face Blog·· 29 天前
用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出能力
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
SI 导读
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做轻量微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准分数从 22.6% 提升到 29.7%。训练可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上跑 OpenAI 兼容服务。
SI 评分38
来源:Hugging Face Blog · huggingface.co