Hugging Face Blog·· 2026-09-03AI 评分35
LFM2.5-350M 模型通过 100 步 GRPO 微调提升结构化输出性能
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
Hugging Face 博客发布指南,使用 TRL 库和 Group Relative Policy Optimization (GRPO) 对 LFM2.5-350M 模型进行微调,在 IFStruct 基准测试中性能提升 7.1%,从 22.6% 提升至 29.7%。微调过程仅需 500 个样本和 100 个训练步骤,适用于免费 Colab 或 Kaggle GPU,代码开源。
来源:Hugging Face Blog · huggingface.co