PRX Part 4:我们的数据策略
PRX 系列第四篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练时实时计算文本 latent,在 7B 规模下仅损失约 3–4% 吞吐(30 天训练多约 1 天)。图像统一编码为 quality 92 的 JPEG,实测首次重编码几乎不可察觉。
PRX 系列第四篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练时实时计算文本 latent,在 7B 规模下仅损失约 3–4% 吞吐(30 天训练多约 1 天)。图像统一编码为 quality 92 的 JPEG,实测首次重编码几乎不可察觉。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温最多降低 0.5°C。
围绕 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准表现,读者可据此判断零样本表格预测能否替代传统树模型流程。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增加 5.5%、总拥有成本(TCO)降低约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并已在公开缓存 trace 上验证。
Google Research 在 COLM 2026 论文《Thinking to Recall》中发现,开启推理能让 Gemini-2.5(Flash、Pro)和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上答出关闭推理时几乎无法召回的事实。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转化为可用的树篱、石墙与矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星影像上预训练的 RSF Vision-Transformer 主干,并用约 247 平方公里标注数据微调,通过双层标注与 Polsby–Popper 紧凑度评分区分林地、树丛与线性植被。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘。该框架基于 f-divergence 与核正则化,支持卡方、KL 和 hockey-stick 等散度,可自动选择最优散度与超参数,无需样本拆分,并在任意样本量下控制假阳性。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。
推荐理由:塞拉利昂预注册随机对照试验给出了 Guided Learning 的量化增益与交互数据,可了解 AI 辅助教学的实际效果与局限。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构能用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可了解其与旧版相比的预测时效变化及接入方式。
Google 发布一套零信任隐私分析方案,将新型单次消息密码学聚合协议与 TEE 结合,使设备无需多轮在线即可提交数据。该方案保证 Google 只能获得匿名化的群体聚合洞察,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 认证则向参与者证明协议按公开代码正确执行。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业解决方案中的新基础能力。该能力从几何与边界条件直接预测物理场,单次前向推理在单 GPU 上以秒级完成,用于设计迭代,传统求解器保留用于验证和边界情况。
推荐理由:Mistral 把物理仿真模型并入企业平台,读者可了解其与传统求解器的分工及工业落地场景。
Mistral 收购 Emmi AI,并正加倍投入面向航空航天、汽车、半导体和能源等行业的基础 Physics AI 研究。其已发布成果包括 AB-UPT,可在单张 GPU 上处理 9M 表面和 140M 体积网格的原始几何数据而无需重新划分网格,以及首个大规模多物理过程端到端深度学习代理模型 NeuralDEM。
Mistral AI 本周签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注物理 AI 与大型工程模型,可把多日计算替换为实时仿真并构建数字孪生,其 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购补齐物理仿真能力,读者可了解其工业 AI 布局与工程智能体方向。
Google 发布 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,读者可据此判断科研编码自动化的落地程度。
剑桥大学 Clare Bryant 教授利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发败血症等重症的分子开关,该工具生成并排序了候选假说,并优先锁定了一个她此前未关注的蛋白质。借助 Co-Scientist,其团队将原本需两到三年的精确氨基酸靶点识别工作压缩至六个月完成,目前正构建含氨基酸突变的细胞系验证假说。
爱丁堡大学团队用 Google Co-Scientist 梳理 MASH 肝病文献,生成可测试的新假说,其中一个假说指出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,解释药物 resmetirom 为何仅对少数合格患者有效,该假说随后经实验验证,或为靶向双重疗法铺路。
斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从现有药物文献中找出可重定位治疗肝纤维化的候选药。
推荐理由:斯坦福团队用 Co-Scientist 筛选肝纤维化药物,AI 提名的候选在活细胞实验中优于研究者自选。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。
推荐理由:原文给出多智能体假设生成系统的架构与多个实验室验证案例,可了解 AI 参与科研假设生成的具体路径。
Google Research 公布其开放科学成果:十余年积累的开源工具与数据集已服务全球超 25 万名研究人员和开发者。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)开展科研的四个方向。公共卫生方面,团队每周向 CDC 的流感、COVID-19 和 RSV 住院预测项目提交全美各州、最长提前四周的实时预测,在流感与 COVID-19 公开排行榜上处于或接近榜首。
推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的具体用法,可了解 AI 辅助科研的落地边界。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,把训练任务拆成解耦的计算孤岛并以异步数据流连接,从而隔离局部硬件故障。该架构基于 Pathways 和 DiLoCo,在混沌工程测试中丢失整个 learner unit 后仍能继续训练并重新接入;用 Gemma 4 模型验证时,其基准 ML 性能与传统训练方法持平。
推荐理由:Google DeepMind 用 Gemma 4 实测了跨数据中心异步训练,读者可了解分布式预训练在带宽与容错上的新解法。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen(Neuronal Morphology Generation)模型,用 PointInfinity 点云流匹配生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,在保留的小鼠轴突上降低 4.4% 重建误差,主要来自 merge error 减少。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,将用户随机路由至乐于助人的 "Good" 智能体或刻意不配合的 "Bad" 智能体,并配有逐轮用户满意度等标注。研究同时提出包含群体统计对齐、人类相似度评分与反事实验证三支柱的评估框架。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
Google Research 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,在 KV cache 压缩与向量搜索上给出可复用的精度与内存权衡方案。
Google Research 发布 S2Vec,一个自监督框架,通过 S2 Geometry 分区与特征栅格化将建成环境转为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在 US-wide 人口密度、收入中位数等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单模型,与图像嵌入做多模态融合后表现普遍优于单一模态;但在树冠覆盖、海拔等环境任务上仍需改进。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查双读流程中的检测率与工作量变化,并暴露人机仲裁分歧。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业内部基础设施中训练与治理。该平台以智能体优先设计,Mistral Vibe 这类自主智能体可用它微调模型、寻找最优超参数、调度任务并生成合成数据,用户只需用自然语言即可定制模型。
推荐理由:原文给出企业用自有数据训练前沿模型的分阶段能力与架构选择,可据此判断自建模型的落地路径。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,并与 NVIDIA 共同开发前沿开源 AI 模型,结合 Mistral 的模型架构与全栈平台和 NVIDIA 的算力、模型开发工具及合成数据生成管线。
推荐理由:Mistral 与 NVIDIA 联合开发开源前沿模型并加入 Nemotron Coalition,可了解开源模型生态的算力与协作分工。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Google 宣布在 Flood Hub 上线城市山洪(urban flash flood)预报,利用新的 AI 方法可提前最多 24 小时预测城市山洪风险。
推荐理由:Google 把洪水预报从河流扩展到城市内涝,并给出与 NWS 同口径的精度对比,可看 AI 预警的覆盖边界。
Google Research 推出 Groundsource,一种用 Gemini 从非结构化新闻中提取灾害历史数据的方法,并发布首个开放数据集,包含 2000 年至今 150 多个国家的 260 万条城市山洪记录。
推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其人工核验准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。
Berkeley AI Research 提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。
Mistral AI 宣布完成 1.7B€ 的 C 轮融资,投后估值 11.7B€,由半导体设备制造商 ASML 领投,现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:Mistral AI 完成 1.7B€ C 轮融资,由 ASML 领投,读者可了解其估值与半导体产业链合作方向。
伯克利 AI 研究团队证明,在随机小初始化等温和近似条件下,word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动态有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。该矩阵仅由词共现概率与 unigram 概率定义,其顶部特征向量对应名人传记、政府行政、地理描述等可解释主题。训练因此表现为按序离散的秩递增步骤,每步降低损失并扩展一个正交子空间。
Mistral 对 Pixtral-12B 进行 LoRA 微调后,在 Aerial Image Dataset(AID)卫星图像分类任务上较基座模型显著提升,改善了密集住宅与中等住宅等易混淆类别的区分能力,并减少了模型幻觉出的无效类别名。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开两项指标:Mistral Large 2 截至 2025 年 1 月训练及 18 个月使用产生 20.4 ktCO₂e。