Google Research 提出 Retrieve-for-Train 框架加速复杂 AI 搜索
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将查询分解行为编译至 53.9M 参数的扩散模型,实现单次非自回归推理。该方案利用 Gemma3-4B 和 Qwen3-4B 进行监督合成,消除了推理时的思维 token 开销,解决了传统 LLM 在集合级搜索中的延迟瓶颈。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将查询分解行为编译至 53.9M 参数的扩散模型,实现单次非自回归推理。该方案利用 Gemma3-4B 和 Qwen3-4B 进行监督合成,消除了推理时的思维 token 开销,解决了传统 LLM 在集合级搜索中的延迟瓶颈。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:对结构压缩并量化的模型,直接从压缩前的原始全精度模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始教师蒸馏的恢复配方,并附与 QAT 的稳定性对比数据。
METR 研究显示 AI 在网络安全领域加速显著,数学研究加速轻微,AI 研究优化无可测加速。多所高校团队发布 SPADE 框架,通过自博弈生成合成可执行环境,在 30B 规模下使 Qwen3 模型在 AIME 等基准上性能提升 8.1 分。
新基准 DiG-bench 通过 70 个隐藏规则的游戏测试 AI 的探索与发现能力,结果显示 Opus 5 和 Fable 5 表现最佳,但前沿模型在 Tier 7 难度上仍远落后于人类。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结等拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型难以在场景变化中持续保持对拓扑结构的理解。图像与视频生成工具在维持拓扑关系上同样不可靠。
ABBEL 框架将摘要重构为自然语言信念状态,并引入信念评分机制以监督信息保留。在 CollabBench 协作编码任务中,该方法将模型与全上下文模型的性能差距缩小约 50%,且训练步数减少 50%。
Google Research 在 COLM 2026 论文《Thinking to Recall》中发现,开启推理能让 Gemini-2.5(Flash、Pro)和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上答出关闭推理时几乎无法召回的事实。
研究团队构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校成绩等场景中"钻制度空子"的能力,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的漏洞策略。
自适应并行推理(Adaptive Parallel Reasoning)允许模型自主决定何时分解子任务、生成并发线程数量及协调方式,以解决顺序推理导致的上下文膨胀与延迟问题。该范式旨在克服现有固定并行结构无法根据问题复杂度动态调整计算资源的局限,实现更高效的大语言模型推理扩展。
GRASP 是一种针对学习动态(世界模型)的基于梯度的规划器,通过提升轨迹至虚拟状态实现时间并行优化,并在状态迭代中引入随机性以增强探索。该方法通过重塑梯度,使动作获得清晰信号,同时避免通过高维视觉模型计算脆弱的“状态输入”梯度,从而解决长时程规划中优化病态及局部极小值问题。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,利用稀疏性和低阶性在大规模下识别 LLM 的关键交互。ProxySPEX 利用层级结构特性,在保持性能的同时将所需的消融次数减少约 10 倍。SPEX 在特征归因任务中,当上下文扩展至数千个特征时,仍能保持与 Faith-Shap 等现有方法相当的高忠实度。
Berkeley AI Research 提出基于互信息的成像系统设计框架,直接评估并优化系统信息含量。该框架在 NeurIPS 2025 论文中验证了其在四个成像领域预测性能的能力,优化结果匹配 SOTA 方法且无需任务特定解码器。
Berkeley AI Research 提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。