Google Research 提出 Retrieve-for-Train 框架加速复杂 AI 搜索
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将查询分解行为编译至 53.9M 参数的扩散模型,实现单次非自回归推理。该方案利用 Gemma3-4B 和 Qwen3-4B 进行监督合成,消除了推理时的思维 token 开销,解决了传统 LLM 在集合级搜索中的延迟瓶颈。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将查询分解行为编译至 53.9M 参数的扩散模型,实现单次非自回归推理。该方案利用 Gemma3-4B 和 Qwen3-4B 进行监督合成,消除了推理时的思维 token 开销,解决了传统 LLM 在集合级搜索中的延迟瓶颈。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,旨在提升实时语音对话的智能与并行推理能力。
推荐理由:原文给出了两款实时语音模型在推理与工具调用上的具体基准表现,读者可据此评估其在生产级语音智能体中的适用性。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,其中 DSX MaxLPS 在 Lambda 的 HGX B200 集群上完成首次验证:19 个节点以 85% 功率运行,达到与 16 节点满功率相同的功率预算,集群 token 吞吐提升 24%(约 400 万 token/秒升至 500 万),每瓦性能提升 23%。
推荐理由:原文给出 DSX MaxLPS 在 Lambda 集群的实测数字与 DSX Flex 的电网响应案例,可据此判断同功率预算下的吞吐提升空间。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南,用于缩小 Agent 的稳定性差距。在 AppWorld test_normal 的 168 个任务上。
推荐理由:原文给出 Pass^k 与一致性差距的量化结果,并说明如何用一次采样定位易翻转的决策点。
Fyxer 基于 OpenAI 模型,结合微调、记忆与真实用户反馈,为每位用户整理收件箱并以本人语气起草邮件。该 AI 行政助理的卖点在于让用户信任其代写与收件箱管理能力。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
GitHub 日本和韩国市场营销负责人 Tomoko Tanaka 分享如何利用 GitHub Copilot 和 GitHub Actions 自动化活动运营流程。
推荐理由:展示了非技术人员如何利用 GitHub Copilot 和 Actions 将重复性营销工作流转化为代码,提供了可复用的自动化模式。
Cognition 用 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师少审代码、多交付。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。
Google Research 在 ACL 2026 提出 ToolGrad,通过“答案优先”范式与文本梯度迭代生成工具使用数据,显著降低生成成本并提升数据复杂度。基于 ToolGrad-500 微调的 Gemma-3-12B 在 BFCL 基准上得分 83.1,性能超越 GPT-5 及 Claude 4.5 Opus 等专有模型。
GitHub Copilot app 内置 diff、终端和浏览器面板,允许用户在不离开应用的情况下审查代码变更、运行命令及预览界面。用户可通过 diff 面板接受或修改变更,在终端面板执行如 `npm run dev` 等脚本,并利用浏览器面板的 Pick & Polish 工具迭代 UI。这种集成工作流消除了应用切换,帮助用户在合并前验证 AI 生成代码的功能与正确性。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 宣布 ChatGPT Work 中的 Data agent 现已向所有人开放。该智能体可连接企业数据、发现洞察,并用自然语言构建交互式仪表盘。
推荐理由:OpenAI 官方披露 ChatGPT Work 中 Data agent 的开放范围与自然语言建看板能力,可据此判断企业数据接入方式的变化。
Cloudera 与 Mistral 宣布建立合作伙伴关系,旨在将 Mistral 模型集成至 Cloudera 混合数据平台,支持企业在私有云、本地及完全隔离环境中运行推理。该合作允许企业利用专有数据训练定制模型,实现数据与智能的完全自主控制。
OpenAI 推出 ChatGPT for Financial Services,内置金融数据并搭载 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。
推荐理由:官方给出面向金融服务的 ChatGPT 版本及其内置金融数据与模型组合,可据此判断其目标场景。
OpenAI 与 GSA 将面向符合条件的联邦、州、地方和部落政府提供 0 美元许可费、用量费用五折以及扩展的网络防御支持。该安排覆盖美国多级政府机构,具体资格条件与实施细节尚未在摘要中说明。
推荐理由:OpenAI 与 GSA 面向各级政府给出零许可费和半价用量,可观察 AI 采购与公共部门落地的价格路径。
Hugging Face 发布 Workflow1111,用 73 个节点、11 条媒体管线在单张 Gradio Workflow 画布上重建了 AUTOMATIC1111 的大部分功能,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 和图像转视频。
推荐理由:用 73 个节点复刻 A1111 全部功能,并展示输出节点如何自动变成 REST 端点和 MCP 工具。
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色和电话(telephony)接入。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此判断语音应用的接入方式。
Hugging Face 博客介绍如何在 Hugging Face Jobs 上跨机运行 AsyncGRPOTrainer:训练 Job 只把 LoRA adapter 写入 Storage Bucket,两个 vLLM Job 从同一挂载路径读取,代理负责加鉴权头、按 KV 前缀路由 rollout 并把 adapter 加载广播到所有副本,全程不需要 NCCL。
推荐理由:原文给出跨机异步 GRPO 的完整工程配方与五轮瓶颈定位数据,可迁移到自建 RL 训练流水线。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:OpenAI 官方发布 Agents API,读者可了解其托管服务定位与 Codex harness 编排能力。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他在 AI 对齐、安全与标准方面拥有相关经验。
OpenAI 的 Chris Lehane 发文称,AI 政策窗口已经打开,需要立即行动。他认为更强的 AI 能力需要更强的安全证据、共享标准和持久的政策行动。
Mistral 协助欧洲能源运营商将 4 万行 Fortran 77 代码迁移至 C++,解决了无测试套件和文档的遗留代码现代化难题。项目通过构建数值一致性验证框架,并利用 Vibe CLI 生成调用树,调度超过 100 个智能体完成代码文档化。最终采用人类监督 coder、tester 和 reviewer 智能体的工作流,实现了模块化的代码重构与质量保障。
OpenAI 发布 GPT-6 Astra,称其是面向企业场景能力最强的模型,具备高级推理、计算机操作以及更强的写作与设计判断力。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力定位,读者可据此了解其推理与计算机操作方向。
MIT 研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的自动化能力。
Google DeepMind 发布 AlphaGenome Atlas,提供人类基因组中 90 亿种单核苷酸变异的分子效应预测。该平台包含 1PB 数据集,并推出 AVI 评分以整合 AlphaGenome 和 AlphaMissense 的预测结果,帮助研究人员快速排序和解读基因变异。
推荐理由:原文展示了覆盖全基因组 90 亿种变异的预测平台,为遗传学研究提供了可复用的分子效应评估工具。
OpenAI 探讨更强且更可负担的 AI 如何拓展个人与企业可完成的工作范围,并让增长变得更经济。文章围绕能力提升与成本下降两条线索展开,但未给出具体模型版本、参数规模或价格数字。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投。这笔资金将用于扩展前沿研究、计算容量及基础设施,以支持其在全球 20 个国家服务 125 家以上企业的关键任务 AI 转型。Mistral 强调其全栈开放策略旨在提供数据、模型、计算和系统层面的主权控制,避免客户被锁定在单一供应商的路径中。
推荐理由:Mistral 完成欧洲最大规模融资,旨在构建包含模型、基础设施与产品的全栈主权 AI 体系。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像,更贴近用户原本的构想。
推荐理由:OpenAI 官方发布 ChatGPT Images 2.5,读者可了解其把草图与参考照片转为个性化成图的定位。
OpenAI 宣布扩大对新闻业的支持,面向学生、教育工作者、记者和新闻机构提供工具、培训与合作伙伴关系。该计划覆盖从课堂到新闻编辑室的多个环节。
OpenAI 分享了一份针对 Navier–Stokes 千禧年大奖难题的 AI 生成解答,包含一份书面说明和一份 Lean 形式化证明。
OpenAI 开放 500 万美元资助计划申请,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
OpenAI 联合 AIRPPU 和 WAN-IFRA 启动一项 AI 项目,帮助乌克兰新闻机构提升创新能力、韧性并支持独立新闻。该项目面向乌克兰新闻组织,具体工具、规模与上线时间未在原文中披露。
GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中用 /experimental 启用,按各模型标准费率计费。
推荐理由:GitHub 给出多模型编排的三种执行模式与三个基准上的质量成本对比,可据此判断编排式编码智能体的取舍。
Google Research 利用 UK Biobank 和 Biobank Japan 数据,评估了跨人群多基因风险评分(PRS)的迁移学习性能。研究发现,当目标人群样本量超过 15k 时,仅使用目标人群数据训练的模型优于混合欧洲数据的模型。对于遗传相关性高的性状,混合数据在样本量达 25-40k 前仍具优势,而血脂等特异性性状则更早失去混合数据的增益。
GitHub Copilot app 支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在 sessions view 中查看各会话标题与任务进度,并随时切换、无需重新说明背景。文中以 tailspin-toys 仓库为例,演示了并行处理 funded sort、无障碍审查和测试三项任务。
Google Research 与 HHMI Janelia 等机构合作,在 Cell 期刊发布了完整的雄性果蝇脑及中枢神经系统连接组图谱。该图谱包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最多的脑图谱。研究利用 AI 技术进行细胞级重建,并已通过 Neuroglancer 开源工具开放供研究者探索与下载。
Google DeepMind 发布 WeatherNext 3,这是其最先进的全球气象 AI 模型,支持实时卫星数据输入和每小时刷新。该模型在 5 公里分辨率下提供温度等表面变量预测,并将降水预测准确率提升最高 60%,已集成至 Search、Gemini 和 Maps 等产品。
推荐理由:模型直接学习实时卫星数据并实现每小时更新,为高纬度地区提供更高精度的局部气象预测。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个版本,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型,并以掩码离散扩散目标从零训练。