Google DeepMind 发布 DiffusionGemma 实验模型,文本生成最高提速 4 倍
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理加速,单张 NVIDIA H100 上超过 1000 tokens/秒、RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 4x 加速的实测数字与硬件门槛,读者可据此判断本地低并发场景是否值得换用扩散式生成。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理加速,单张 NVIDIA H100 上超过 1000 tokens/秒、RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 4x 加速的实测数字与硬件门槛,读者可据此判断本地低并发场景是否值得换用扩散式生成。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:原文给出 70+ 语言、连续生成语音和几秒延迟等关键指标,读者可据此判断实时语音翻译的可用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 去掉多模态编码器并把视觉音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。
推荐理由:塞拉利昂预注册随机对照试验给出了 Guided Learning 的量化增益与交互数据,可了解 AI 辅助教学的实际效果与局限。
Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版。
推荐理由:原文给出多智能体 RAG 的架构细节与跨语料评测数据,可据此判断复杂查询检索的可行边界。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后采集 8 秒面部视频,通过端侧深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色人群。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构能用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可了解其与旧版相比的预测时效变化及接入方式。
Google Research 在 I/O 2026 上公布多项进展,包括基于 ERA 与 Co-Scientist 的 Gemini for Science 科研工具套件,以及用于科学假设生成的 Hypothesis Generation 和基于 NotebookLM 的 Literature Insights。
推荐理由:Google Research 在 I/O 2026 集中披露科研智能体、健康 AI 与量子计算进展,可据此了解其研究到产品的转化路径。
Google 发布 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,读者可据此判断科研编码自动化的落地程度。
Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究。它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。此外,Co-Scientist 将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,读者可了解 AI 辅助科研的落地方式。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View grounding 能力,用户可通过 Maps 图钉选择美国境内地点,并叠加 Desert Sands、Stone Age、Ocean World、B&W film 等风格,再描述角色来生成以真实影像为起点的可交互世界。
推荐理由:Genie 接入 Street View 真实影像后,读者可了解世界模型如何以真实地点为锚点生成可交互环境。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮对话编辑视频。
推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究成果打包成科研工具,读者可了解其能力边界与开放节奏。
Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能此前已在全球被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从现有药物文献中找出可重定位治疗肝纤维化的候选药。
推荐理由:斯坦福团队用 Co-Scientist 筛选肝纤维化药物,AI 提名的候选在活细胞实验中优于研究者自选。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:通过飓风 Melissa 的实战案例,读者可以了解 AI 天气模型在路径与强度双预测上的具体表现。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API、Google AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放渠道,可据此判断速度与质量的取舍。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。
推荐理由:原文给出多智能体假设生成系统的架构与多个实验室验证案例,可了解 AI 参与科研假设生成的具体路径。
Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可看算法智能体的跨领域边界。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 个案例零关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生盲评与实时多模态模拟的对比数据,可了解医疗智能体当前能力边界。