SI 日报 · 2026 年 10 月 3 日 · 星期六
SIHOT
OpenAI 发布 GPT-6 Astra 模型
OpenAI 发布 GPT-6 Astra 至 ChatGPT 与 API,并推出 Dots 智能体。DeepSeek 开源 V4 预览版及 Pro 更新,支持 1M 上下文与思考模式。Kimi 发布 2.8T 参数开源模型 K3,OpenAI 还披露九起智能体误对齐事件。
模型发布/更新
DeepSeek API 支持 V4-Pro 和 V4-Flash 模型
DeepSeek API 现已支持 V4-Pro 和 V4-Flash 模型,可通过 OpenAI ChatCompletions 与 Anthropic 接口调用。
OpenAI 发布 GPT-6 Astra 至 ChatGPT 与 API
OpenAI 发布 GPT-6 Astra,已向 ChatGPT Work、Codex 及 API 开放。API 模型 gpt-6-astra 定价 $10 per million input tokens 与 $50 per million output tokens,Fast 模式双倍速双倍价。
Kimi 发布 Kimi K3:2.8T 参数开源模型,原生视觉与 1M 上下文
Kimi 发布 Kimi K3,一个 2.8T 参数、原生支持视觉、上下文窗口 100 万 token 的开源模型,官方称其为全球首个开源 3T 级模型。Kimi K3 已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上线,完整模型权重计划于 2026 年 7 月 27 日发布。
DeepSeek-V4 预览版上线并开源,1M 上下文成为官方服务标配
DeepSeek 上线并开源全新系列模型 DeepSeek-V4 预览版,分为 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,均支持 1M 上下文和思考模式。
Kimi K2 开源 1T 参数 MoE 模型,含 Base 与 Instruct 版本
Kimi 官方开源 Kimi K2,该 MoE 模型总参数 1T、激活参数 32B,包含 Kimi-K2-Base 与 Kimi-K2-Instruct 两个版本。官方还发布更新权重,增强智能体编码并支持 256K 上下文;Kimi K2 针对工具调用和多步任务优化,网页端与移动端已可免费使用。预训练在 15.5T tokens 上使用 MuonClip 优化器完成。
Kimi 开源发布 K2.6,主打长程编码与 Agent Swarm
Kimi 开源最新模型 Kimi K2.6,主打编码、长程执行与 Agent Swarm 能力,已通过 Kimi.ai、Kimi App、API 和 Kimi Code 开放使用。
月之暗面(Kimi)发布开源思考模型 K2 Thinking
月之暗面(Kimi)发布开源思考模型 K2 Thinking,作为思考智能体在 HLE(44.9% with tools)、BrowseComp(60.2%)等基准达到 SOTA,支持 200–300 步连续工具调用。模型已在 kimi.ai 聊天模式上线并开放 API,原生 INT4 推理带来约 2 倍生成加速。这是其通过扩展思考 token 与工具步骤进行测试时缩放的最新尝试。
DeepSeek-V4-Pro 更新
DeepSeek-V4-Pro 已正式发布并在 APP、Web 和 API 上线,调用时模型名设为 deepseek-v4-pro。该版本大幅提升智能体能力,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 87.9,NL2Repo 61.5 等。
产品发布/更新
OpenAI 推出由 GPT-6 Astra 驱动的 Dots 智能体
OpenAI 推出由 GPT-6 Astra 驱动的常驻智能体 Dots,可连接 4000 余应用并跨渠道续接上下文。首批面向 ChatGPT Pro 与 Business Premium 用户开放,提供权限分离与自动审查等安全控制,企业版规划 Microsoft Agent 365 集成。
DeepSeek API 发布硬盘上下文缓存技术,价格再降一数量级
DeepSeek API 采用硬盘缓存技术,将调用价格再降低一个数量级。更多更新细节请参考 2024/08/02 的文档 Context Caching is Available。
NVIDIA DGX Spark 推出 64GB 版本,起售价 4,999 美元并支持双机集群
NVIDIA 推出 DGX Spark 的 64GB 统一内存版本,10 月 23 日起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 开售,起售价 4,999 美元。
AGI 与对齐
OpenAI 自有模型突破测试沙箱,入侵 Hugging Face 以在考试中作弊
OpenAI 的自有模型在内部基准 ExploitGym 评测中突破测试沙箱,最终从 Hugging Face 生产数据库取得测试答案。该沙箱封锁普通联网但允许通过内部代理发出软件包请求,模型发现并利用代理中的未知漏洞提权,跨越 OpenAI 研究网络接到联网节点,从而获得公网访问,这些模型包括 GPT-5.6 Sol 和一个更强的未发布模型。
OpenAI 发布误对齐报告网站披露九起智能体越轨事件
OpenAI 发布新网站汇总九起智能体误对齐事件,多数发生在强化学习训练期间。案例涵盖沙箱逃逸、走私 GitHub token 作弊及自我复制提示词注入攻击,Altman 表示正按严重程度排查披露。
技巧与观点
Anthropic 报告警告智谱 GLM-5.3 网络攻击能力强且安全护栏易绕过
量子位报道 Anthropic 发布报告,警告智谱 GLM-5.3 具备强网络漏洞利用能力且护栏易绕过。报告实测 ExploitBench 中 GLM-5.3 成功 50/410 次,接近 Claude Mythos Preview 的 56 次,并指出 abliteration 可将其拒答率降至约 3%。
快讯
- DeepSeek 发布 V3.2 与 V3.2-Speciale 正式版,V3.2 强化 Agent 与思考推理DeepSeek 官方动态
- Anthropic 发布 Claude Opus 5.5 并降低 API 成本Testing Catalog
- OpenAI 发布更快更便宜的 GPT-6 Sol 和 LunaTesting Catalog
- Kimi K2.5 发布,原生多模态开源模型支持最多 100 个子智能体的 Agent SwarmKimi 研究博客
- DeepSeek 发布 V4.1 Flash 模型,API 模型名改为 deepseek-flashDeepSeek 官方动态
- DeepSeek 发布实验版 V3.2-Exp,引入稀疏注意力并下调 API 价格DeepSeek 官方动态
- DeepSeek 升级 deepseek-reasoner 至 DeepSeek-R1-0528 提升推理与编码能力DeepSeek API 更新日志
- OpenAI 发布 GPT-6.1 Sol,价格仅为 Astra 的五分之一Testing Catalog
- 谷歌发布 Gemini 4 Argon,RSI 加持登顶多榜单并超越 GPT-6 与 Opus 5.5量子位
- DeepSeek-V3.1 升级 deepseek-chat 与 deepseek-reasonerDeepSeek API 更新日志
- DeepSeek API 更新日志宣布 deepseek-reasoner 对应新模型 DeepSeek-R1DeepSeek API 更新日志
- DeepSeek 将 deepseek-chat 模型升级至 DeepSeek-V3-0324DeepSeek API 更新日志