2026 BAIR 研究生展示
伯克利人工智能研究实验室(BAIR)展示其 2026 届博士毕业生的研究成果,涵盖机器人、大语言模型推理、计算机视觉及 AI 安全等领域。毕业生去向包括 OpenAI、Physical Intelligence、Mistral AI 等机构,以及普林斯顿大学、UCLA 等高校教职。
伯克利人工智能研究实验室(BAIR)展示其 2026 届博士毕业生的研究成果,涵盖机器人、大语言模型推理、计算机视觉及 AI 安全等领域。毕业生去向包括 OpenAI、Physical Intelligence、Mistral AI 等机构,以及普林斯顿大学、UCLA 等高校教职。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 的推理,以降低语音对话的响应延迟。
推荐理由:原文给出可替换的语音到语音流水线与推理加速组合,读者可据此评估实时语音助手的搭建路径。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间跨框架迁移企业级 Java 应用的能力。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温最多降低 0.5°C。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,4 秒生成文本到图像,每张 1K 图像 0.034 美元;后者支持高质量视频生成与对话式编辑,输出视频定价为每秒 0.10 美元。
推荐理由:两款模型同日开放开发者入口,并给出延迟、单价与能力边界,便于评估图像到视频的串联工作流。
围绕 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准表现,读者可据此判断零样本表格预测能否替代传统树模型流程。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,支持评测结果交叉发布与解读,并链接到开放模型、榜单和统一元数据存储。
NVIDIA 研究人员开发 ENPIRE 框架,让编码智能体自主驱动物理机器人完成策略迭代,在 PushT、整理插针、切割扎带等任务上达到 99% 成功率。
Google Research 发布一种新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,给出端侧推理在内存与能耗约束下的具体优化路径。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增加 5.5%、总拥有成本(TCO)降低约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并已在公开缓存 trace 上验证。
Google Research 在 COLM 2026 论文《Thinking to Recall》中发现,开启推理能让 Gemini-2.5(Flash、Pro)和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上答出关闭推理时几乎无法召回的事实。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它仅作为独立的 Gemini 2.5 computer use 模型提供。
推荐理由:原文给出 computer use 从独立模型并入主 Flash 模型的变化,以及企业级安全防护选项,读者可据此判断智能体跨平台自动化的落地条件。
Mistral AI 为 Connectors 推出多项新能力:管理员控制(GA)可按 workspace 或组织设置连接器访问并逐个开关工具,带连接器作用域的 API key(GA)防止自动化 AI 工作负载冒用身份,多账号连接器(GA)支持一个连接器绑定多个账号。
推荐理由:原文列出连接器的权限、身份与调试能力,读者可据此判断企业级智能体接入外部系统时的治理方式。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,官方同时说明这两个基准在数学、科学和多栏文档上存在评分偏差,建议以自身文档实测为准。
推荐理由:OCR 4 在文本之外返回边界框、块类型与置信度,读者可据此判断结构化文档解析如何接入 RAG 与智能体流程。
牛津大学、英国 AI 安全研究院、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定优于人类专家,即使专家可自选议题、提前研究、接受数小时结构化训练并获得 1,000 英镑奖金。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,共同开发一款 AI 规划审批原型工具,目标是将住户规划申请的处理时间缩短 50%。
推荐理由:英国政府与 Google DeepMind 合作开发规划审批 AI 原型,目标将审批时间减半,2027 年全国推广。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转化为可用的树篱、石墙与矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星影像上预训练的 RSF Vision-Transformer 主干,并用约 247 平方公里标注数据微调,通过双层标注与 Polsby–Popper 紧凑度评分区分林地、树丛与线性植被。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理先进 AI 的纵深防御框架,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把内部智能体当作潜在内部威胁的分级监控与响应框架。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为"对齐尚未走上正轨",计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、博弈论与 personas。
Google Research 公布两项皮肤健康 AI 研究:一项发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者借助 AI 工具尝试命名皮肤状况的比例达 62%,准确率 23%,约为无辅助对照组 8% 的近三倍。但 AI 组在判断下一步就医建议上未取得统计显著提升,且比对照组更倾向建议较低紧急度的处理方式。
加州大学圣地亚哥分校在 Google 支持下,正用 2000 台退役 Pixel 手机的主板搭建数据中心,为数百名师生提供低成本、低碳的云计算。SPEC 基准显示 25-50 台手机约等于一台现代服务器,20 台手机的小型集群已能支撑 75 人以上课程的评分负载,且延迟低于默认 AWS 后端。该系统预计 2026 年秋季上线。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘。该框架基于 f-divergence 与核正则化,支持卡方、KL 和 hockey-stick 等散度,可自动选择最优散度与超参数,无需样本拆分,并在任意样本量下控制假阳性。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理加速,单张 NVIDIA H100 上超过 1000 tokens/秒、RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 4x 加速的实测数字与硬件门槛,读者可据此判断本地低并发场景是否值得换用扩散式生成。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助征集,面向全球研究者。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:原文给出 70+ 语言、连续生成语音和几秒延迟等关键指标,读者可据此判断实时语音翻译的可用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 去掉多模态编码器并把视觉音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 推出面向欧洲早期机器人初创的 Accelerator: Robotics 项目,选出 15 家公司,提供 3 个月密集指导与技术支持,并可调用其 AI 技术栈和 Gemini 机器人模型。入选者覆盖物流、制造、医疗、气候与导航等领域,本周在伦敦启动。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。
推荐理由:塞拉利昂预注册随机对照试验给出了 Guided Learning 的量化增益与交互数据,可了解 AI 辅助教学的实际效果与局限。
研究团队构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校成绩等场景中"钻制度空子"的能力,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的漏洞策略。
Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版。
推荐理由:原文给出多智能体 RAG 的架构细节与跨语料评测数据,可据此判断复杂查询检索的可行边界。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后采集 8 秒面部视频,通过端侧深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色人群。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构能用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可了解其与旧版相比的预测时效变化及接入方式。
Import AI 459 聚焦三项研究:英国 AI 安全研究所的论文指出用 AI 监督 AI 训练的自动化对齐研究并非万能方案;另有工作提出蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价的尝试。同期还介绍了弗吉尼亚大学、Anthropic 与加拿大银行经济学家的研究,估算 2025 年美国名义 AI GDP 约 2500 亿美元,质量调整后实际年增速约 2600%。
Google Research 在 I/O 2026 上公布多项进展,包括基于 ERA 与 Co-Scientist 的 Gemini for Science 科研工具套件,以及用于科学假设生成的 Hypothesis Generation 和基于 NotebookLM 的 Literature Insights。
推荐理由:Google Research 在 I/O 2026 集中披露科研智能体、健康 AI 与量子计算进展,可据此了解其研究到产品的转化路径。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。
推荐理由:Mistral 一次性给出工业 AI 栈、Vibe 智能体和自建数据中心三条线,可据此判断其企业级全栈布局。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。Work Mode 可在网页和移动端执行收件箱整理、深度研究、文档起草等长周期任务,支持企业知识搜索、结构化数据分析和可复用技能;Code Mode 提供远程编码会话,并新增 VS Code 扩展和 CLI 更新。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作与编码两种模式的能力边界和定价分层。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,开源且可运行在云端、本地或边缘。它把摄取、检索和评测统一到共享接口下,内置 BM25 稀疏检索、稠密向量检索与混合配置,并提供 recall、precision、MRR、NDCG 等评测指标。
推荐理由:Mistral 把检索管线的摄取、检索与评测收进同一框架,读者可据此判断自建 RAG 的集成成本会怎样变化。
Google 发布一套零信任隐私分析方案,将新型单次消息密码学聚合协议与 TEE 结合,使设备无需多轮在线即可提交数据。该方案保证 Google 只能获得匿名化的群体聚合洞察,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 认证则向参与者证明协议按公开代码正确执行。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业解决方案中的新基础能力。该能力从几何与边界条件直接预测物理场,单次前向推理在单 GPU 上以秒级完成,用于设计迭代,传统求解器保留用于验证和边界情况。
推荐理由:Mistral 把物理仿真模型并入企业平台,读者可了解其与传统求解器的分工及工业落地场景。