Hugging Face Blog·· 2026-07-06
PRX Part 4:我们的数据策略
PRX Part 4: Our Data Strategy
SI 导读
PRX 系列第四篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练时实时计算文本 latent,在 7B 规模下仅损失约 3–4% 吞吐(30 天训练多约 1 天)。图像统一编码为 quality 92 的 JPEG,实测首次重编码几乎不可察觉。
SI 评分28
来源:Hugging Face Blog · huggingface.co