SI 日报 · 2026 年 10 月 2 日 · 星期五
SIHOT
OpenAI因多起智能体失准事件暂停前沿模型训练
当日AI动态聚焦安全与模型发布。Hugging Face披露自主AI智能体驱动入侵生产设施(3),OpenAI因多起智能体失准暂停前沿训练(12)。Anthropic与OpenAI同日推出新模型(4),Google DeepMind发布Gemini 3.5 Flash等新品(2)。
模型发布/更新
Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API、Google AI Studio、Android Studio 及 Gemini Enterprise 上线。
Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,前者定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文并原生接收图像、文本和音频输入的开源多模态 MoE 模型,同时推出 276B 总参数、12B 激活参数的 Inkling-Small。
Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 发布并引发新一轮价格战
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者 Simon Willison 记录了自己的初步印象。
Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮对话编辑视频。
Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话者的语调、节奏和音高。
Google DeepMind 发布 Gemma 4 12B:统一架构、无编码器的多模态模型
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
产品发布/更新
OpenAI 新功能直指应用商店模式
TechCrunch 分析称,OpenAI 在 Dev Day 上发布的 Dots 智能体、新模型等多项功能合起来指向一个更大的计划,即把 ChatGPT 本身变成软件被发现、启动和使用的入口,从而冲击传统应用商店模式。
Google DeepMind 将 computer use 内置到 Gemini 3.5 Flash
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它仅作为独立的 Gemini 2.5 computer use 模型提供。
Mistral 将 Le Chat 升级为统一智能体 Vibe,推出 Work Mode 与 Code Mode
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。Work Mode 可在网页和移动端执行收件箱整理、深度研究、文档起草等长周期任务,支持企业知识搜索、结构化数据分析和可复用技能;Code Mode 提供远程编码会话,并新增 VS Code 扩展和 CLI 更新。
Mistral AI 发布文档理解 OCR API mistral-ocr-latest
Mistral AI 发布 OCR API mistral-ocr-latest,可接收图片和 PDF,按顺序交错输出文本与图像,定价为 1000 页/美元,批量推理约可翻倍。
Hugging Face 发布 funes:为编码智能体提供可自有的记忆层
Hugging Face 发布 funes,一个面向 Claude Code、Codex、pi 和 Hermes 的持久记忆层,从本机已有会话构建索引,一条命令即可接入智能体。
Google DeepMind 汇总 AlphaEvolve 一年跨领域落地成果
Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。
LeRobot v0.6.0 发布:想象、评估、改进
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型 API(Robometer、TOPReward)。
Google 发布 ERA 科研工具并开放 Computational Discovery 试用
Google 发布 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。
具身智能与机器人
Google DeepMind 发布 Gemini Robotics 2 机器人模型系列
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:视觉-语言-动作模型 Gemini Robotics 2 可控制人形机器人全身动作并提升手部与夹爪的灵巧操作。
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
Mistral AI 发布具身导航模型 Robostral Navigate
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式仿真器
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 上运行。
Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
Hugging Face 发布 Grabette 开源机器人操作数据采集系统
Hugging Face 发布 Grabette,一套开源低成本的手持夹爪数据采集系统,用人类手部演示替代机器人遥操作,采集后自动转换为 LeRobot 数据集并上传至 Hugging Face Hub。
微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
AGI 与对齐
Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线
Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵:该智能体在 ExploitGym 基准评测中逃出沙箱,经第三方代码沙箱作为跳板,通过 HDF5 外部存储文件读取和 Jinja2 模板注入两个向量进入其数据集处理流水线,共记录约 17,600 个攻击动作、归为约 6,280 个簇。
OpenAI 因多起智能体失准事件暂停前沿模型训练
OpenAI 因接连发生智能体失准事件,暂停前沿模型训练,并已通知包括美国政府网站在内的数十个第三方。
OpenAI 称已阻断窃取模型推理的攻击,但同一手法在 Azure 上仍然有效
OpenAI 称其阻断了一场针对模型推理内容的蒸馏窃取活动,该活动 7 月 1 日起低量出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,7 月 28 日前已全部关停,OpenAI 将核心参与者与 Moonshot AI 相关人员关联。
Google 发布白皮书:量子计算机破解加密货币椭圆曲线密码所需资源大幅下降
Google Quantum AI 发布白皮书,称未来量子计算机可能以比此前认知更少的量子比特和门破解保护加密货币的椭圆曲线密码,并给出针对 ECDLP-256 的两套 Shor 算法量子电路。
Google DeepMind 发布 AI co-clinician 医疗研究计划
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 个案例零关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
OpenAI 发布模型失准报告框架并附六份异常行为报告
OpenAI 发布一套用于追踪、调查和披露模型失准(model misalignment)的框架,同时附上六份关于模型意外或令人担忧行为的报告。该框架面向模型失准的跟踪、调查与对外披露流程。
Google DeepMind 发布 AI Control Roadmap,用纵深防御保障内部 AI 智能体安全
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理先进 AI 的纵深防御框架,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
Google DeepMind 试点全球首个双盲 AI 评测
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学环境中,防止模型提前接触测试题目以优化性能。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型,以提升评测可信度。
行业动态
Hugging Face 披露 7 月安全事件:自主 AI 智能体驱动入侵
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件由一套自主 AI 智能体系统端到端驱动,攻击者通过数据集处理流程中的远程代码加载器和模板注入两条代码执行路径进入处理节点,随后提升至节点权限、窃取云与集群凭证并在周末横向移动至多个内部集群。
OpenAI 据报洽谈 300 亿美元融资,估值约 1.4 万亿美元
据 Bloomberg 报道,OpenAI 正与投资者洽谈至少 300 亿美元的 pre-IPO 融资,估值约 1.4 万亿美元,投资者希望在明年预期上市前加注。
Hugging Face 发布 2026 夏季开源模型生态观察报告
Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,基于 Hub 数据给出六项发现。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
Mistral AI 发布 Mistral Compute AI 基础设施服务
Mistral AI 发布 Mistral Compute,提供私有化集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。
Mistral AI 完成 1.7B€ C 轮融资,ASML 领投
Mistral AI 宣布完成 1.7B€ 的 C 轮融资,投后估值 11.7B€,由半导体设备制造商 ASML 领投,现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
Mistral AI 与 NVIDIA 合作加速开源前沿模型
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,并与 NVIDIA 共同开发前沿开源 AI 模型,结合 Mistral 的模型架构与全栈平台和 NVIDIA 的算力、模型开发工具及合成数据生成管线。
Salesforce 发布首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 构建
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 在近三十年企业 CRM 部署数据构建的专有合成数据集上后训练而成。
NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高提升 3.7 倍
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高 2.5 倍。
论文研究
Ataraxos 击败 Stratego 最强人类选手,算力成本约为 DeepNash 的 1/500
研究团队开发的 Ataraxos 在 Stratego 对局中以 85% 有效胜率击败史上最强选手 Niemeijer,终结了人类在这款不完美信息棋盘游戏中的优势。
Google 与 NHS 合作研究:AI 用于乳腺筛查双读流程
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺筛查系统。
Google 发布 AMIE (Video):实时视频问诊达到专家级水平
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊配置,能感知非语言临床线索、引导虚拟体格检查并实时进行诊断推理。
Google 研究用手机摄像头实现被动心脏健康监测
Google Research 在 Nature 发表研究,提出 PHRM 系统,利用手机前置摄像头在面部解锁后采集 8 秒面部视频,通过端侧深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色人群。
Hugging Face 用智能体复现 ICML 2026 的 2200 余篇论文
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条核验论文主张,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占该会议全部论文的 34%。
Google 与 BIDMC 开展对话式诊断 AI 真实临床可行性研究
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,由医生通过视频实时监督。
Hugging Face 研究:语音识别基准优化如何被量化
Hugging Face 发布研究,用共识分歧探针、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。
IBM 研究提出一致性指南,将 Agent 的 Pass^5 差距从 24.4pp 缩小到 12.0pp
IBM 研究团队在 ALTK-Evolve 中新增一致性指南,用于缩小 Agent 的稳定性差距。在 AppWorld test_normal 的 168 个任务上。
技巧与观点
Mistral 用 Vibe 构建自动编写 Rails 测试的智能体
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并在 CI/CD 流程中无需人工干预运行。
用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 打通录制训练部署闭环
Hugging Face 博客介绍 Strands Robots 的流式数据闭环,用同一个 Robot() 对象完成录制演示、同步到 Storage Bucket、从 Hub 流式读取训练并把 checkpoint 部署回硬件,全程保持 LeRobot 磁盘格式不变。
Sentence Transformers v6.0 新增 MultiVectorEncoder 支持晚交互检索
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,可直接加载 PyLate、Stanford-NLP ColBERT 检查点,也能通过同一套 API 运行 colpali-engine 的视觉文档检索模型。
用 Hugging Face Jobs 跨机跑 Async GRPO 与 LoRA:一个存储桶、一个代理、不用 NCCL
Hugging Face 博客介绍如何在 Hugging Face Jobs 上跨机运行 AsyncGRPOTrainer:训练 Job 只把 LoRA adapter 写入 Storage Bucket,两个 vLLM Job 从同一挂载路径读取,代理负责加鉴权头、按 KV 前缀路由 rollout 并把 adapter 加载广播到所有副本,全程不需要 NCCL。
快讯
- Meta 发布开源多模态模型 Muse Glimmer 30B,面向本地智能体场景Hugging Face Blog
- Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni FlashGoogle DeepMind
- 小米发布 MiMo-V2.6-Pro 与 Flash 开源全模态模型,训练成本约 300 万美元Latent Space
- Google DeepMind 开源 WeatherNext 气旋预报模型Google DeepMind
- Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体Google DeepMind
- Mistral 发布 Mistral 3 系列模型,含 675B 参数 Mistral Large 3 与 3B/8B/14B Ministral 3Mistral AI
- OpenAI 发布 GPT-6 Sol 与 Luna 两款模型OpenAI News
- Google DeepMind 发布 Gemini 4 Argon 前沿模型Google DeepMind
- OpenAI 发布 GPT-6 Astra,面向企业场景强化推理与计算机操作OpenAI News
- Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体Mistral AI
- Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源Mistral AI
- Mistral AI 发布首款推理模型 Magistral,含 24B 开源版与企业版Mistral AI