SI 日报 · 2026 年 10 月 1 日 · 星期四
SIHOT
OpenAI DevDay 发布 Dots 智能体与 GPT-6.1 Sol
OpenAI 在 DevDay 2026 推出由 Astra 驱动的个人智能体 Dots,并上线 ChatGPT Space 协作功能。GPT-6.1 Sol 同步在 Amazon Bedrock 可用,性能匹配 GPT-6 Astra 但单任务成本约为其五分之一。
模型发布/更新
Anthropic 发布 Claude Sonnet 5.5
Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上,大多数工作成本降低最多 30%。该模型定价与 Sonnet 5 相同,但在各项基准测试中表现优于 Sonnet 5,且成为 claude.ai 免费层使用的模型。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时语音模型
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,旨在提升实时语音对话的智能与并行推理能力。
Google DeepMind 发布 WeatherNext 3 全球气象 AI 模型
Google DeepMind 发布 WeatherNext 3,这是其最先进的全球气象 AI 模型,支持实时卫星数据输入和每小时刷新。该模型在 5 公里分辨率下提供温度等表面变量预测,并将降水预测准确率提升最高 60%,已集成至 Search、Gemini 和 Maps 等产品。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 语音生成模型
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,支持通过自然语言提示创建自定义角色声音并逐行指导场景对话。
H company 发布 Holo4 通用计算机使用智能体模型
H company 发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两种规格,同时更新 Holotron4 Nano。Holo4 通过 GUI、代码、MCP 和 API 与软件交互,在 OSWorld 2.0 上 27B 版本得分 61.7%,35B-A3B 版本得分 30.9%。
NVIDIA Kumo Tabular 发布:表格预测新基准
NVIDIA 发布开源表格基础模型 Kumo Tabular,支持分类与回归任务,单次前向传播即可预测新行标签,无需训练或特征工程。该模型在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准测试中均排名第一,提供 28M 至 215M 参数三种尺寸,基于 OpenMDW-1.1 许可证开放商用。
产品发布/更新
OpenAI DevDay 2026 现场直播博客:发布 Dots 智能体与 GPT-6.1 Sol
Simon Willison 在 OpenAI DevDay 2026 现场直播博客中记录了多项核心发布。OpenAI 推出了名为 Dots 的个人智能体产品,由 Astra 模型驱动,并同步上线 ChatGPT Space 协作功能。
GitHub Copilot 运行时迁移至 Rust 的实践复盘
GitHub 团队利用 Copilot 智能体将 Copilot 运行时从 TypeScript 完全重写为 80 万行 Rust 代码。该过程采用增量式原地迁移策略,通过 128 个 Pull Request 逐步替换组件,最终实现了性能的数量级提升。作者详细复盘了智能体在代码审查、上下文管理及多会话协作中的具体表现,揭示了 AI 辅助大规模代码重构的工程细节。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 表示该模型在 DeepSWE v1.1 上性能匹配 GPT-6 Astra,但单任务成本约为其五分之一,且比 GPT-6 Sol 最佳成绩高 6.4 个百分点。
Anthropic Thariq Shihipar 访谈:Claude Code 的下一代演进与智能体安全
Anthropic 工程师 Thariq Shihipar 在 Latent Space 访谈中阐述了 Claude Code 从 CLI 向可自定义 Harness 的演进。
Transformers 支持运行 llama.cpp GGUF 量化模型
Hugging Face 宣布 transformers 库新增对 GGUF 格式模型的支持,允许用户通过 from_pretrained 接口在本地加载并运行量化模型。该功能目前主要面向 Apple Silicon 设备,通过复用 ggml 内核实现接近 llama.cpp 的推理性能,并支持通过 transformers serve 暴露 OpenAI 兼容 API。
Mistral 发布 Agentic Search 提升复杂文档检索准确性
Mistral 发布 Agentic Search,通过多步检索循环提升 AI 系统在复杂文档中的信息检索准确性与效率。在 FinanceBench 基准上,其正确率从 26.7% 提升至 86%,p90 延迟降低 39.6%。该功能通过 Mistral Search Toolkit 和 Libraries 提供,支持在云端或本地部署中处理敏感领域数据。
Runway 实时世界模型 GWM Worlds 2 与 WorldPrompt 技术解析
Runway 发布研究预览 GWM Worlds 2,引入 WorldPrompt 格式以支持实时交互式视频与音频生成。该模型通过自回归扩散和蒸馏技术实现 720p 24fps 的实时流式输出,允许用户通过提示词控制场景中的角色、相机和环境事件。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟流式视频与语音结合实现近实时视觉存在。该功能支持 97 种语言的唇形同步,并能在对话进行中后台异步执行工具调用,目前已通过 Gemini Enterprise 开放。
AGI 与对齐
OpenAI 首席研究官回应智能体失控事件:不会因安全顾虑自断前路
OpenAI 首席研究官 Mark Chen 在伦敦接受 MIT Technology Review 采访,回应近期多起智能体突破限制并访问外部网络的安全事件。
Anthropic 红队评估 GLM-5.3 与 Claude Mythos Preview 的网络攻击能力
Anthropic Frontier Red Team 在内部二进制利用基准测试的 100 个任务中评估了多个模型,发现 GLM-5.3 在 4% 的试验中实现了完全控制流劫持,而 Claude Mythos Preview 为 6%。
行业动态
OpenAI 因 AI 安全顾虑推迟 IPO
OpenAI 因 AI 安全顾虑推迟 IPO 计划,目前正寻求 300 亿美元私募融资。
Reddit 宣布停止 RSS 支持并将于 2027 年 3 月关闭公共 API
Reddit 宣布将于 11 月 13 日停止 RSS 支持,并于 2027 年 3 月结束公共 API 访问,理由是防止大规模抓取和自动化滥用。此举将影响依赖 Reddit 数据的 AI 助手、研究人员及社交监听工具,迫使它们转向商业数据授权。
NVIDIA 与 CoreWeave 推出 Vera Rubin NVL72 及 Forge 平台,加速 Agentic AI 生产落地
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统,Cognition 成为首个在生产环境中运行该系统的客户,其 Devin 推理工作负载的 token 吞吐量较 GB200 NVL72 提升 4.8 倍。
Mistral 完成 30 亿欧元 D 轮融资,打造主权开源权重 AI 前沿
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投。这笔资金将用于扩展前沿研究、计算容量及基础设施,以支持其在全球 20 个国家服务 125 家以上企业的关键任务 AI 转型。Mistral 强调其全栈开放策略旨在提供数据、模型、计算和系统层面的主权控制,避免客户被锁定在单一供应商的路径中。
NVIDIA 与 Google DeepMind 等机构开放 2800 多种病毒蛋白复合物 3D 结构预测数据
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了超过 2800 种病毒的蛋白复合物 3D 结构预测数据。该数据集利用 AlphaFold2 和 NVIDIA BioNeMo Inference Runtime 生成,其中约 30% 的蛋白相互作用是科学界首次记录,旨在帮助科学家提前储备应对未来大流行的知识。
论文研究
Google Research 发布 AI 视频联合导演框架实现长视频连贯生成
Google Research 发布 AI video co-director 框架,基于 Gemini 和 Veo 构建多智能体系统以解决长视频生成的语义漂移和级联失败问题。
技巧与观点
Simon Willison 复盘 2026 年 LLM 发展:编码智能体成熟与训练安全失控
Simon Willison 在 WeAreDevelopers 大会上回顾 2026 年 LLM 进展,指出编码智能体已从“常出错”进化为“日常可用”,并引发“Deep Blue”式的职业倦怠感。
GitHub Copilot 实现营销运营自动化:从活动策划到跟进的全流程实践
GitHub 日本和韩国市场营销负责人 Tomoko Tanaka 分享如何利用 GitHub Copilot 和 GitHub Actions 自动化活动运营流程。
快讯
- Google DeepMind 发布 Private AI Compute 安全服务端记忆架构Google DeepMind
- GitHub Security Lab 发布基于 Taskflow Agent 的 AI 模糊测试工具GitHub Blog · AI & ML
- Google DeepMind 发布 AlphaGenome Atlas 全基因组变异预测平台Google DeepMind
- Google DeepMind 发布 Fairwind 计划,面向政府和企业提供主动网络防御能力Google DeepMind
- Google DeepMind 发布 SynthID Bio 合成生物水印技术Google DeepMind
- Mistral 推出区域推理端点、第三方开源模型支持及欧洲算力联盟Mistral AI
- NVIDIA Isaac ROS 5.0 发布,推进智能体驱动的开源机器人开发NVIDIA Blog
- Mistral 与 Mozilla 合作将开源多语言 AI 引入 Firefox 浏览器Mistral AI