SI 日报 · 2026 年 10 月 8 日 · 星期四
SIHOT
GPT-6 与 Intelligent UI 面向所有人推出
GPT-6 正在 ChatGPT 中全球推出,搭载 Intelligent UI 提供带视觉的更快交互体验。
模型发布/更新
Anthropic 发布 Claude Haiku 5.5,大幅降价印证 AI 价格战远未结束
Anthropic 发布 Claude Haiku 5.5,价格较前代最多降 90% 且基准性能大幅跃升,适用于高量低成本任务。在提示最长 10 万 token 时每百万 token 输入价 0.10 美元,超长提示贵 5 倍;Terminal-Bench 4.0 代理编码得分从 0 升至 39.2%,OSWorld-2.1 计算机使用达 72.4%。
- Claude Haiku 5.5 登陆 AWS Amazon Bedrock 与 Claude PlatformAWS Machine Learning Blog
Nemotron 3 微调后在 IOI 2026 与 IMO 2026 均达金牌水平
Nemotron 3 经 SFT 与 RL 微调后在 IOI 2026 和 IMO 2026 均超过金牌阈值。IOI 2026 中 Nemotron-3-Ultra-CC 获 535.4/600,IMO 2026 系统得 30/42,模型、数据集与 NeMo-Skills 推理管线已在 Hugging Face 开放。
Liquid AI 发布多模态开放 d1 边缘决策模型 d1-3B 与 d1-omni-600M
今日 Liquid AI 发布开放权重 d1 决策模型 d1-3B 与实验性 d1-omni-600M,可在边缘设备做多模态决策。d1-3B 在 Decision Index 0.2.1 得 48.57 分超 Decider 35B-A3B,于 Jetson 延迟低至 16 毫秒。模型基于 LFM 单前向传播不生成 token,已在 Hugging Face 开放。
产品发布/更新
NVIDIA与Microsoft借RTX Spark与AI智能体开启Windows PC新起点
NVIDIA与Microsoft在微软活动上宣布RTX Spark笔记本预购开启及DGX Station for Windows预览,将本地AI智能体引入Windows PC。
AGI 与对齐
ChatGPT 因家长警报在青少年自杀对话中失效被评“不可接受风险”
Common Sense Media 旗下青年 AI 安全研究所经 4000 余次测试提示将 ChatGPT for Teens 评为未成年人“不可接受风险”,家长警报在自杀对话中从未触发。测试显示警报仅于数周敏感历史后启动,辅导模式与年龄识别亦有缺陷,OpenAI 反驳称测试不反映实际。该独立结论正成为佛州诉讼与监管限制未成年人的关键证据,此前已有相关死亡案件。
行业动态
New Constructs 给 Anthropic 估值 1500 亿美元,称其“2026 年最荒唐 IPO”
New Constructs给予Anthropic 1500亿美元估值,并称其即将进行的IPO为2026年最荒唐IPO。Anthropic目标纳斯达克估值2万亿美元,但泄露招股书显示其2025年营收46亿美元、净亏损420亿美元。该机构曾称WeWork为2019最荒唐IPO且后者撤回上市,认为闭源模型面临开源竞争难盈利。
论文研究
Google Research 探讨更好的工作是否意味着更好的工作者,基于三个月专利律师AI实验
Google Research 在11家知识产权律所的133名律师中开展三个月AI专利起草助手实验,发现AI提升短期起草质量但移除后初级律师专业判断未同步增强。实验将律师随机分组,AI组在10天和90天起草任务中分数提升0.34和0.38标准偏差,但90天无辅助红笔修改任务仅资深律师保持0.45标准偏差优势。该研究发表于NBER,提示设计AI工具需避免阻碍初级专业人士长期专长积累。
Agent Lightning v1.0:用于以真实 harness 训练智能体的 3,500 行轻量级智能体 RL 框架
Microsoft Research Asia 推出并开源 Agent Lightning v1.0,一个约3500行轻量级智能体 RL 框架,使真实 harness 直接参与训练。