跳到正文
原文
Hugging Face Blog·· 2026-07-06AI 评分22

PRX Part 4:Hugging Face 详解 7B 模型的数据策略

PRX Part 4: Our Data Strategy

AI 导读

Hugging Face 发布 PRX 系列第四篇,详解其 7B 模型的数据策略:预训练数据由公开与内部数据集混合而成,并用 VLM 重新生成图像长描述。团队将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多花约 1 天)。

来源:Hugging Face Blog · huggingface.co