IBM 研究:ALTK-Evolve 用更少 token 实现 ACE 级智能体记忆
IBM 研究团队发布 ALTK-Evolve,与 ACE 一样让智能体从自身轨迹中学习可复用经验,但把记忆投递从固定改为按任务和模型能力校准。
IBM 研究团队发布 ALTK-Evolve,与 ACE 一样让智能体从自身轨迹中学习可复用经验,但把记忆投递从固定改为按任务和模型能力校准。
Import AI 468 汇总了多项AI研发动态:IFP提出23个应对RSI的政策建议;MIT和Columbia研究指出信任与透明度是AI企业协调减速的关键;Intology发布Locus新版本,在PostTrainBench+上以4000小时H100算力达到51.6%得分,超越人类基线。
Hugging Face 最新论文提出两项系统改动,让大语言模型知识蒸馏的训练成本大幅下降:一是离线缓存教师模型的 top-100 logits,训练时无需再加载教师模型;二是融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。
本期 Import AI 汇总了多项关于 AI 安全与能力的最新进展。多伦多大学等机构构建了利用开源 LLM 进行自我复制的 AI 病毒原型,整体攻击成功率约 37%。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与配套的 CoE Audit 审计指标。
推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此判断自主科研智能体的可信度评估方式。
K-Search 框架扩展了 MLX 后端,通过结构化翻译层将 CUDA 内核知识自动适配为 Apple Silicon 的高性能内核。该方法在 Apple Silicon 上达到接近专家水平的性能,相比原生 MLX Attention 内核实现 0.97x 加速,并在 Mamba SSM 内核上较社区 mlx-lm 实现获得最高 20x 的 prefill 加速。
本期 Import AI 汇总多项研究:Epoch 与 METR 发布 MirrorCode 基准,考察 AI 在纯 CLI 访问下重写软件的能力,25 个目标程序中有 17 个至少出现一次满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务。
ABBEL 框架将摘要重构为自然语言信念状态,并引入信念评分机制以监督信息保留。在 CollabBench 协作编码任务中,该方法将模型与全上下文模型的性能差距缩小约 50%,且训练步数减少 50%。
Google Research 发布论文 SymptomAI,用五个基于 Gemini Flash 2.0 的实验性对话智能体开展症状访谈与鉴别诊断(DDx),共 13,917 名参与者随机分配到不同提问策略组。
推荐理由:Google 用 1.3 万人随机对照实验比较五种提问策略,并首次把 AI 诊断与 Fitbit 生理信号做交叉验证。
Google Research 在 Nature 发表研究,提出用强化学习框架让智能体从量子纠错检测事件中持续学习,实时调控数千个控制参数以对抗硬件漂移。在 Willow 超导处理器上,该方法将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%,使量子存储器的逻辑错误降至历史最低。
DharmaOCR 在葡萄牙语专属基准上取得 0.925 分,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语数据的监督微调与 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上保持优势。
Google Research 在 ICLR 2026 论文中揭示,扩散模型的创造力源于神经网络训练中的 score smoothing——正则化使学到的 score function 变平滑,让去噪过程在训练数据点之间插值,从而生成新样本。
Hume 发布 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个专有与开源语音模型、15 个以上评估维度和 60 多项指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:Hume 用百万级人工评分构建语音评测基准,揭示现有基准高估真实表现的盲区。
Google Research 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自 500 万同意参与者、超过 1 万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:原文给出可穿戴健康基础模型的预训练规模与下游评测结果,读者可据此判断通用生理表征的可行性。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市开展为期六个月的大规模真实实验,通过修改 Google Maps 算法,将遇到预设拥堵路段的行程引导至耗时相近的替代路线。
Fable 在 KernelBench-Mega 上写出首个真正的 megakernel,在 RTX PRO 6000 Blackwell 上用 CUDA 实现 18.71X 加速,超过 Claude Opus 4.8 的 14.4X、GLM-5.2 的 11.14X 和 GPT 5.5 的 4.34X。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间跨框架迁移企业级 Java 应用的能力。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增加 5.5%、总拥有成本(TCO)降低约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并已在公开缓存 trace 上验证。
Google Research 在 COLM 2026 论文《Thinking to Recall》中发现,开启推理能让 Gemini-2.5(Flash、Pro)和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上答出关闭推理时几乎无法召回的事实。
Google Research 公布两项皮肤健康 AI 研究:一项发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者借助 AI 工具尝试命名皮肤状况的比例达 62%,准确率 23%,约为无辅助对照组 8% 的近三倍。但 AI 组在判断下一步就医建议上未取得统计显著提升,且比对照组更倾向建议较低紧急度的处理方式。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘。该框架基于 f-divergence 与核正则化,支持卡方、KL 和 hockey-stick 等散度,可自动选择最优散度与超参数,无需样本拆分,并在任意样本量下控制假阳性。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。
推荐理由:塞拉利昂预注册随机对照试验给出了 Guided Learning 的量化增益与交互数据,可了解 AI 辅助教学的实际效果与局限。
研究团队构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校成绩等场景中"钻制度空子"的能力,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的漏洞策略。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后采集 8 秒面部视频,通过端侧深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色人群。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
Google 发布一套零信任隐私分析方案,将新型单次消息密码学聚合协议与 TEE 结合,使设备无需多轮在线即可提交数据。该方案保证 Google 只能获得匿名化的群体聚合洞察,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 认证则向参与者证明协议按公开代码正确执行。
Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究。它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。此外,Co-Scientist 将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,读者可了解 AI 辅助科研的落地方式。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,将其转化为可验证的假设。
爱丁堡大学团队用 Google Co-Scientist 梳理 MASH 肝病文献,生成可测试的新假说,其中一个假说指出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,解释药物 resmetirom 为何仅对少数合格患者有效,该假说随后经实验验证,或为靶向双重疗法铺路。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关文献,将想法转化为可检验假设并按可行性与风险收益排序。
斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从现有药物文献中找出可重定位治疗肝纤维化的候选药。
推荐理由:斯坦福团队用 Co-Scientist 筛选肝纤维化药物,AI 提名的候选在活细胞实验中优于研究者自选。
自适应并行推理(Adaptive Parallel Reasoning)允许模型自主决定何时分解子任务、生成并发线程数量及协调方式,以解决顺序推理导致的上下文膨胀与延迟问题。该范式旨在克服现有固定并行结构无法根据问题复杂度动态调整计算资源的局限,实现更高效的大语言模型推理扩展。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)开展科研的四个方向。公共卫生方面,团队每周向 CDC 的流感、COVID-19 和 RSV 住院预测项目提交全美各州、最长提前四周的实时预测,在流感与 COVID-19 公开排行榜上处于或接近榜首。
推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的具体用法,可了解 AI 辅助科研的落地边界。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,把训练任务拆成解耦的计算孤岛并以异步数据流连接,从而隔离局部硬件故障。该架构基于 Pathways 和 DiLoCo,在混沌工程测试中丢失整个 learner unit 后仍能继续训练并重新接入;用 Gemma 4 模型验证时,其基准 ML 性能与传统训练方法持平。
推荐理由:Google DeepMind 用 Gemma 4 实测了跨数据中心异步训练,读者可了解分布式预训练在带宽与容错上的新解法。
Google Research 发布 ICLR 论文 ReasoningBank,一个从成功和失败经验中提炼高层推理记忆的智能体记忆框架,代码已开源。
推荐理由:论文给出从成功与失败经验中提炼推理记忆的框架,并附 WebArena 与 SWE-Bench-Verified 上的对比数据。
GRASP 是一种针对学习动态(世界模型)的基于梯度的规划器,通过提升轨迹至虚拟状态实现时间并行优化,并在状态迭代中引入随机性以增强探索。该方法通过重塑梯度,使动作获得清晰信号,同时避免通过高维视觉模型计算脆弱的“状态输入”梯度,从而解决长时程规划中优化病态及局部极小值问题。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen(Neuronal Morphology Generation)模型,用 PointInfinity 点云流匹配生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,在保留的小鼠轴突上降低 4.4% 重建误差,主要来自 merge error 减少。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,将用户随机路由至乐于助人的 "Good" 智能体或刻意不配合的 "Bad" 智能体,并配有逐轮用户满意度等标注。研究同时提出包含群体统计对齐、人类相似度评分与反事实验证三支柱的评估框架。
Google Research 提出一套框架,通过改编自 IRI、ERQ 等心理问卷的情境判断测试(SJT),评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。