GRASP 提出基于梯度的长时程世界模型规划方法
GRASP 是一种针对学习动态(世界模型)的基于梯度的规划器,通过提升轨迹至虚拟状态实现时间并行优化,并在状态迭代中引入随机性以增强探索。该方法通过重塑梯度,使动作获得清晰信号,同时避免通过高维视觉模型计算脆弱的“状态输入”梯度,从而解决长时程规划中优化病态及局部极小值问题。
GRASP 是一种针对学习动态(世界模型)的基于梯度的规划器,通过提升轨迹至虚拟状态实现时间并行优化,并在状态迭代中引入随机性以增强探索。该方法通过重塑梯度,使动作获得清晰信号,同时避免通过高维视觉模型计算脆弱的“状态输入”梯度,从而解决长时程规划中优化病态及局部极小值问题。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen(Neuronal Morphology Generation)模型,用 PointInfinity 点云流匹配生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,在保留的小鼠轴突上降低 4.4% 重建误差,主要来自 merge error 减少。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,将用户随机路由至乐于助人的 "Good" 智能体或刻意不配合的 "Bad" 智能体,并配有逐轮用户满意度等标注。研究同时提出包含群体统计对齐、人类相似度评分与反事实验证三支柱的评估框架。
Google 发布两个面向学术工作流的 AI 智能体:绘图智能体 PaperVizAgent(原 PaperBanana)和审稿智能体 ScholarPeer。
Google Research 提出一套框架,通过改编自 IRI、ERQ 等心理问卷的情境判断测试(SJT),评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
Google Quantum AI 发布白皮书,称未来量子计算机可能以比此前认知更少的量子比特和门破解保护加密货币的椭圆曲线密码,并给出针对 ECDLP-256 的两套 Shor 算法量子电路。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的最新量子资源估算,并公开其负责任披露流程,可供关注后量子迁移节奏的读者参考。
Google Research 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,在 KV cache 压缩与向量搜索上给出可复用的精度与内存权衡方案。
Google Research 发布 S2Vec,一个自监督框架,通过 S2 Geometry 分区与特征栅格化将建成环境转为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在 US-wide 人口密度、收入中位数等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单模型,与图像嵌入做多模态融合后表现普遍优于单一模态;但在树冠覆盖、海拔等环境任务上仍需改进。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查双读流程中的检测率与工作量变化,并暴露人机仲裁分歧。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,利用稀疏性和低阶性在大规模下识别 LLM 的关键交互。ProxySPEX 利用层级结构特性,在保持性能的同时将所需的消融次数减少约 10 倍。SPEX 在特征归因任务中,当上下文扩展至数千个特征时,仍能保持与 Faith-Shap 等现有方法相当的高忠实度。
Google Research 推出 Groundsource,一种用 Gemini 从非结构化新闻中提取灾害历史数据的方法,并发布首个开放数据集,包含 2000 年至今 150 多个国家的 260 万条城市山洪记录。
推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其人工核验准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,由医生通过视频实时监督。
推荐理由:Google 与 BIDMC 首次在真实门诊流程中前瞻性部署对话式诊断 AI,给出了安全事件、诊断一致性与医患反馈的具体数据。
Berkeley AI Research 提出基于互信息的成像系统设计框架,直接评估并优化系统信息含量。该框架在 NeurIPS 2025 论文中验证了其在四个成像领域预测性能的能力,优化结果匹配 SOTA 方法且无需任务特定解码器。
Berkeley AI Research 提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。
伯克利 AI 研究团队证明,在随机小初始化等温和近似条件下,word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动态有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。该矩阵仅由词共现概率与 unigram 概率定义,其顶部特征向量对应名人传记、政府行政、地理描述等可解释主题。训练因此表现为按序离散的秩递增步骤,每步降低损失并扩展一个正交子空间。