跳到正文
原文
Hugging Face Blog·· 22 天前AI 评分46

Hugging Face Jobs 上用 LoRA 实现异步 GRPO:靠存储桶和代理绕开 NCCL

Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL

AI 导读

TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,训练与推理分别跑在独立的 Hugging Face Jobs 上。

来源:Hugging Face Blog · huggingface.co