跳到正文
原文
Hugging Face Blog·· 29 天前AI 评分36

用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准通过率从 22.6% 提升到 29.7%。

来源:Hugging Face Blog · huggingface.co