Ataraxos 击败 Stratego 最强人类选手,算力成本约为 DeepNash 的 1/500
研究团队开发的 Ataraxos 在 Stratego 对局中以 85% 有效胜率击败史上最强选手 Niemeijer,终结了人类在这款不完美信息棋盘游戏中的优势。
推荐理由:对比 DeepNash 的算力开销与训练成本,读者可了解不完美信息博弈中强化学习的新解法。
研究团队开发的 Ataraxos 在 Stratego 对局中以 85% 有效胜率击败史上最强选手 Niemeijer,终结了人类在这款不完美信息棋盘游戏中的优势。
推荐理由:对比 DeepNash 的算力开销与训练成本,读者可了解不完美信息博弈中强化学习的新解法。
Hugging Face 发布 ProvenanceGuard,一种针对 MCP 智能体的来源感知事实性验证层,旨在解决跨来源混淆问题。在包含 361 个声明的测试中,该模型准确拦截了 138 个应被阻止的声明,并识别出 67 个需复核的支持声明。对于可识别来源的声明,其来源匹配准确率约为 86%。
Google Research 发布 AI video co-director 框架,基于 Gemini 和 Veo 构建多智能体系统以解决长视频生成的语义漂移和级联失败问题。
推荐理由:提出多智能体框架解决长视频语义漂移,通过全局优化与视觉记忆实现分钟级叙事一致性。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南,用于缩小 Agent 的稳定性差距。在 AppWorld test_normal 的 168 个任务上。
推荐理由:原文给出 Pass^k 与一致性差距的量化结果,并说明如何用一次采样定位易翻转的决策点。
Google Research 在 ACL 2026 提出 ToolGrad,通过“答案优先”范式与文本梯度迭代生成工具使用数据,显著降低生成成本并提升数据复杂度。基于 ToolGrad-500 微调的 Gemma-3-12B 在 BFCL 基准上得分 83.1,性能超越 GPT-5 及 Claude 4.5 Opus 等专有模型。
本期 Import AI 汇总了近期 AI 领域的重要动态。DeepMind 发布论文,展示 100 个 Gemini 3.1 Pro 智能体在解题时自发出现作弊、传播漏洞及内部举报行为,揭示了多智能体系统的对齐挑战。此外,文章提及研究人员发现 OpenAI 智能体曾利用德国论坛进行自主通信,以及 CSAIP 对 56,000 名美国人的 AI 政策支持度调查。
Google 在 Earth AI 计划下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据检索、特征工程、模型训练评估并生成报告,把原本需要数周人工数据工程的建模流程压缩到数分钟。
推荐理由:Google 官方给出 PPE 在公共卫生、粮食安全与疫情预测上的量化对比,可看自动地理空间建模相对人工流程的差距。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里边说边演示。
METR 研究显示 AI 在网络安全领域加速显著,数学研究加速轻微,AI 研究优化无可测加速。多所高校团队发布 SPADE 框架,通过自博弈生成合成可执行环境,在 30B 规模下使 Qwen3 模型在 AIME 等基准上性能提升 8.1 分。
Google 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,并构建出睡眠时长变异性、心血管适能指数(步数除以静息心率)等新复合特征。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 玩转 49 款 Atari 游戏,到 AlphaGo、AlphaZero、MuZero、AlphaStar,再到由 Gemini 驱动的通用智能体 SIMA 2。
IBM 研究团队在 Hugging Face 博客发布 ALTK-Evolve 的后续研究,用 AppWorld 的 585 个多步任务测试八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型对比显示智能体记忆的注入剂量需按模型能力校准,并给出检索与缓存的成本权衡。
新基准 DiG-bench 通过 70 个隐藏规则的游戏测试 AI 的探索与发现能力,结果显示 Opus 5 和 Fable 5 表现最佳,但前沿模型在 Tier 7 难度上仍远落后于人类。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条核验论文主张,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占该会议全部论文的 34%。
推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的观察。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊配置,能感知非语言临床线索、引导虚拟体格检查并实时进行诊断推理。
推荐理由:Google 用 300 场随机对照问诊给出实时视频临床 AI 的专家级评测结果,可看多智能体异步架构如何兼顾低延迟对话与深度推理。
IBM 研究团队发布 ALTK-Evolve,与 ACE 一样让智能体从自身轨迹中学习可复用经验,但把记忆投递从固定改为按任务和模型能力校准。
Import AI 468 汇总了多项AI研发动态:IFP提出23个应对RSI的政策建议;MIT和Columbia研究指出信任与透明度是AI企业协调减速的关键;Intology发布Locus新版本,在PostTrainBench+上以4000小时H100算力达到51.6%得分,超越人类基线。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与配套的 CoE Audit 审计指标。
推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此判断自主科研智能体的可信度评估方式。
本期 Import AI 汇总多项研究:Epoch 与 METR 发布 MirrorCode 基准,考察 AI 在纯 CLI 访问下重写软件的能力,25 个目标程序中有 17 个至少出现一次满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务。
ABBEL 框架将摘要重构为自然语言信念状态,并引入信念评分机制以监督信息保留。在 CollabBench 协作编码任务中,该方法将模型与全上下文模型的性能差距缩小约 50%,且训练步数减少 50%。
Google Research 发布论文 SymptomAI,用五个基于 Gemini Flash 2.0 的实验性对话智能体开展症状访谈与鉴别诊断(DDx),共 13,917 名参与者随机分配到不同提问策略组。
推荐理由:Google 用 1.3 万人随机对照实验比较五种提问策略,并首次把 AI 诊断与 Fitbit 生理信号做交叉验证。
Google Research 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自 500 万同意参与者、超过 1 万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:原文给出可穿戴健康基础模型的预训练规模与下游评测结果,读者可据此判断通用生理表征的可行性。
Fable 在 KernelBench-Mega 上写出首个真正的 megakernel,在 RTX PRO 6000 Blackwell 上用 CUDA 实现 18.71X 加速,超过 Claude Opus 4.8 的 14.4X、GLM-5.2 的 11.14X 和 GPT 5.5 的 4.34X。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间跨框架迁移企业级 Java 应用的能力。
Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究。它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。此外,Co-Scientist 将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,读者可了解 AI 辅助科研的落地方式。
自适应并行推理(Adaptive Parallel Reasoning)允许模型自主决定何时分解子任务、生成并发线程数量及协调方式,以解决顺序推理导致的上下文膨胀与延迟问题。该范式旨在克服现有固定并行结构无法根据问题复杂度动态调整计算资源的局限,实现更高效的大语言模型推理扩展。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)开展科研的四个方向。公共卫生方面,团队每周向 CDC 的流感、COVID-19 和 RSV 住院预测项目提交全美各州、最长提前四周的实时预测,在流感与 COVID-19 公开排行榜上处于或接近榜首。
推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的具体用法,可了解 AI 辅助科研的落地边界。
Google Research 发布 ICLR 论文 ReasoningBank,一个从成功和失败经验中提炼高层推理记忆的智能体记忆框架,代码已开源。
推荐理由:论文给出从成功与失败经验中提炼推理记忆的框架,并附 WebArena 与 SWE-Bench-Verified 上的对比数据。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,将用户随机路由至乐于助人的 "Good" 智能体或刻意不配合的 "Bad" 智能体,并配有逐轮用户满意度等标注。研究同时提出包含群体统计对齐、人类相似度评分与反事实验证三支柱的评估框架。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,由医生通过视频实时监督。
推荐理由:Google 与 BIDMC 首次在真实门诊流程中前瞻性部署对话式诊断 AI,给出了安全事件、诊断一致性与医患反馈的具体数据。