Ataraxos AI 击败史上最佳 Stratego 玩家,曾难倒 AI 的隐藏信息游戏被攻克
卡内基梅隆等高校团队开发的 Ataraxos AI 攻克曾难倒 AI 的 Stratego 游戏,以 15 胜 1 负 4 平击败史上最佳玩家 Pim Niemeijer。该模型仅用 16 GPU 和几千美元训练,而此前 DeepMind 高预算也未能构建可靠获胜机器。
卡内基梅隆等高校团队开发的 Ataraxos AI 攻克曾难倒 AI 的 Stratego 游戏,以 15 胜 1 负 4 平击败史上最佳玩家 Pim Niemeijer。该模型仅用 16 GPU 和几千美元训练,而此前 DeepMind 高预算也未能构建可靠获胜机器。
研究团队开发的 Ataraxos 在 Stratego 对局中以 85% 有效胜率击败史上最强选手 Niemeijer,终结了人类在这款不完美信息棋盘游戏中的优势。
推荐理由:对比 DeepNash 的算力开销与训练成本,读者可了解不完美信息博弈中强化学习的新解法。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学环境中,防止模型提前接触测试题目以优化性能。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型,以提升评测可信度。
推荐理由:Google DeepMind 联合新加坡 AI 安全研究所等机构,用密码学环境对 Gemini Flash Lite 做双盲评测,读者可了解基准污染问题的技术解法。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 玩转 49 款 Atari 游戏,到 AlphaGo、AlphaZero、MuZero、AlphaStar,再到由 Gemini 驱动的通用智能体 SIMA 2。
Google DeepMind 发布 WeatherNext AI 模型,在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取约一天的预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报多出约一天预警时间,并开源模型权重与代码,读者可据此判断气象预报工作流的可用变化。
Google Research 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自 500 万同意参与者、超过 1 万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:原文给出可穿戴健康基础模型的预训练规模与下游评测结果,读者可据此判断通用生理表征的可行性。
Google Research 在 I/O 2026 上公布多项进展,包括基于 ERA 与 Co-Scientist 的 Gemini for Science 科研工具套件,以及用于科学假设生成的 Hypothesis Generation 和基于 NotebookLM 的 Literature Insights。
推荐理由:Google Research 在 I/O 2026 集中披露科研智能体、健康 AI 与量子计算进展,可据此了解其研究到产品的转化路径。
Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究。它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。此外,Co-Scientist 将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,读者可了解 AI 辅助科研的落地方式。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究成果打包成科研工具,读者可了解其能力边界与开放节奏。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:通过飓风 Melissa 的实战案例,读者可以了解 AI 天气模型在路径与强度双预测上的具体表现。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。
推荐理由:原文给出多智能体假设生成系统的架构与多个实验室验证案例,可了解 AI 参与科研假设生成的具体路径。
Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可看算法智能体的跨领域边界。
Google Research 发布 TurboQuant 压缩算法,并配套提出 QJL 与 PolarQuant,用于解决向量量化中的内存开销问题,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,在 KV cache 压缩与向量搜索上给出可复用的精度与内存权衡方案。