跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 1–20 条 · 共 59 条
10月1日周四
  1. The Decoder78

    Google 发布 Gemini 4 Argon,基准追平 OpenAI 与 Anthropic 但未明显领先

    Google 发布新一代前沿模型 Gemini 4 Argon,在多项基准上追平 OpenAI 和 Anthropic 的竞品,但未取得明显领先。Argon 先向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才逐步面向开发者、企业和消费者,API 促销价为每百万输入 token 2 美元、输出 10 美元。

    推荐理由:汇总第三方基准与定价数据,可对比 Argon 与 GPT-6、Claude 系列在智能指数和 token 消耗上的差距。

  2. The Verge · AI80

    Google 发布 Gemini 4 Argon,初期仅向可信网络防御方开放

    Google 发布新一代前沿模型 Gemini 4 Argon,称其在真实软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中具备前沿性能。该模型初期仅向一组可信网络防御方开放,Google 表示正参与美国政府的前沿模型预发布访问流程并逐步扩大访问范围。

    推荐理由:Google 发布 Gemini 4 Argon 却先限制给可信网络防御方,读者可据此观察前沿模型发布与安全审查的绑定趋势。

  3. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,之后才向开发者、企业和消费者开放。

    推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的实际差距。

  4. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在长程编码、企业知识工作与网络安全防御上的基准与内部落地数据,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月30日周三
  1. AWS Machine Learning Blog83

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 表示该模型在 DeepSWE v1.1 上性能匹配 GPT-6 Astra,但单任务成本约为其五分之一,且比 GPT-6 Sol 最佳成绩高 6.4 个百分点。

    推荐理由:GPT-6.1 Sol 在 Amazon Bedrock 正式可用,以约五分之一成本实现接近 GPT-6 Astra 的推理能力,降低智能体工作流成本。

9月29日周二
  1. Hugging Face Blog80

    NVIDIA Kumo Tabular 发布:表格预测新基准

    NVIDIA 发布开源表格基础模型 Kumo Tabular,支持分类与回归任务,单次前向传播即可预测新行标签,无需训练或特征工程。该模型在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准测试中均排名第一,提供 28M 至 215M 参数三种尺寸,基于 OpenMDW-1.1 许可证开放商用。

    推荐理由:该模型在四个基准测试中排名第一,展示了无需训练即可处理表格数据的效率与准确性平衡。

  2. Simon Willison86

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上,大多数工作成本降低最多 30%。该模型定价与 Sonnet 5 相同,但在各项基准测试中表现优于 Sonnet 5,且成为 claude.ai 免费层使用的模型。

    推荐理由:原文对比了 Sonnet 5.5 与 Opus 5.5 在编码任务上的表现,并指出其成为 claude.ai 免费层模型带来的竞争变化。

9月28日周一
  1. Hugging Face Blog82

    H company 发布 Holo4 通用计算机使用智能体模型

    H company 发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两种规格,同时更新 Holotron4 Nano。Holo4 通过 GUI、代码、MCP 和 API 与软件交互,在 OSWorld 2.0 上 27B 版本得分 61.7%,35B-A3B 版本得分 30.9%。

    推荐理由:Holo4 支持 GUI、代码、MCP 和 API 多接口交互,在 OSWorld 2.0 上以更低成本接近闭源模型表现。

9月23日周三
9月22日周二
  1. Latent Space82

    小米发布 MiMo-V2.6-Pro 与 Flash 开源全模态模型,训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,位列开源权重模型首位,定价 $0.435/M 输入、$0.87/M 输出 token,采用 MIT 许可。

    推荐理由:小米首次进入前沿开源模型序列,其RL环境与训练配方开源,可观察后训练成本压缩到何种程度。

9月16日周三
9月10日周四
  1. OpenAI News70

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色和电话(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此判断语音应用的接入方式。

9月9日周三
9月3日周四
  1. Google DeepMind84

    Google DeepMind 发布 WeatherNext 3 全球气象 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是其最先进的全球气象 AI 模型,支持实时卫星数据输入和每小时刷新。该模型在 5 公里分辨率下提供温度等表面变量预测,并将降水预测准确率提升最高 60%,已集成至 Search、Gemini 和 Maps 等产品。

    推荐理由:模型直接学习实时卫星数据并实现每小时更新,为高纬度地区提供更高精度的局部气象预测。

  2. Google DeepMind85

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,前者定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的能力、定价和开放入口,可据此判断长程编码与安全场景的选型。

8月27日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化文本。据 Artificial Analysis 测量,流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写时间较前代 Chirp 3 改善 70%;模型支持 85 种以上语言自动检测、自定义词汇和最多三位说话人区分。

    推荐理由:官方给出 WER、延迟与多语言等量化指标,并列出两套 API 与产品落地入口,便于判断语音转写能力边界。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有