Google 研究用手机摄像头实现被动心脏健康监测
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后采集 8 秒面部视频,通过端侧深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色人群。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后采集 8 秒面部视频,通过端侧深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色人群。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模手机视频数据集与预训练模型。
Google Research 在 I/O 2026 上公布多项进展,包括基于 ERA 与 Co-Scientist 的 Gemini for Science 科研工具套件,以及用于科学假设生成的 Hypothesis Generation 和基于 NotebookLM 的 Literature Insights。
推荐理由:Google Research 在 I/O 2026 集中披露科研智能体、健康 AI 与量子计算进展,可据此了解其研究到产品的转化路径。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View grounding 能力,用户可通过 Maps 图钉选择美国境内地点,并叠加 Desert Sands、Stone Age、Ocean World、B&W film 等风格,再描述角色来生成以真实影像为起点的可交互世界。
推荐理由:Genie 接入 Street View 真实影像后,读者可了解世界模型如何以真实地点为锚点生成可交互环境。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮对话编辑视频。
推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。
Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome;该验证功能此前已在全球被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可了解内容溯源工具的实际覆盖范围。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API、Google AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放渠道,可据此判断速度与质量的取舍。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 个案例零关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生盲评与实时多模态模拟的对比数据,可了解医疗智能体当前能力边界。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比和仪表读数新能力,可据此判断机器人高层推理的进展。
Google 发布 Vibe Coding XR 工作流,将 Gemini 的长上下文推理与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进单一开源模型,并给出可切换的推理强度参数。
Berkeley AI Research 提出基于互信息的成像系统设计框架,直接评估并优化系统信息含量。该框架在 NeurIPS 2025 论文中验证了其在四个成像领域预测性能的能力,优化结果匹配 SOTA 方法且无需任务特定解码器。
Mistral 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
推荐理由:官方给出与前代在表单、手写、扫描件上的胜率对比和每千页定价,可据此判断文档解析的替换成本。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出从 3B 到 675B 的规格与部署路径,读者可据此判断开源前沿模型的可用边界。
Mistral 对 Pixtral-12B 进行 LoRA 微调后,在 Aerial Image Dataset(AID)卫星图像分类任务上较基座模型显著提升,改善了密集住宅与中等住宅等易混淆类别的区分能力,并减少了模型幻觉出的无效类别名。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:官方一次性放出深度研究、语音、推理与图像编辑多项能力,可据此判断 Le Chat 的助手定位走向。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业自部署的成本与可行性。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/s,以 Apache 2.0 许可开源。
推荐理由:官方给出 128k 上下文、150 tokens/s 与 Apache 2.0 开源等参数,可据此判断小模型在端侧与多模态场景的可用性。
Mistral AI 发布 OCR API mistral-ocr-latest,可接收图片和 PDF,按顺序交错输出文本与图像,定价为 1000 页/美元,批量推理约可翻倍。
推荐理由:官方给出与 Google、Azure、Gemini 系列的横向基准对比和定价,可据此判断文档解析选型。