跳到正文

#模型发布

今日 3 条
9月23日周三
9月22日周二
  1. Latent Space82

    小米发布 MiMo-V2.6-Pro 与 Flash 开源全模态模型,训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,位列开源权重模型首位,定价 $0.435/M 输入、$0.87/M 输出 token,采用 MIT 许可。

    推荐理由:小米首次进入前沿开源模型序列,其RL环境与训练配方开源,可观察后训练成本压缩到何种程度。

9月19日周六
9月16日周三
9月10日周四
  1. OpenAI News70

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色和电话(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此判断语音应用的接入方式。

9月9日周三
9月3日周四
  1. Google DeepMind84

    Google DeepMind 发布 WeatherNext 3 全球气象 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是其最先进的全球气象 AI 模型,支持实时卫星数据输入和每小时刷新。该模型在 5 公里分辨率下提供温度等表面变量预测,并将降水预测准确率提升最高 60%,已集成至 Search、Gemini 和 Maps 等产品。

    推荐理由:模型直接学习实时卫星数据并实现每小时更新,为高纬度地区提供更高精度的局部气象预测。

  2. Google DeepMind85

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,前者定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的能力、定价和开放入口,可据此判断长程编码与安全场景的选型。

9月1日周二
  1. Google Research58

    Google 发布 TimesFM-3 多变量零样本预测基础模型

    Google 发布 TimesFM-3,这是其新一代时间序列基础模型,原生预训练支持多变量预测,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,采用交替注意力架构与 Contiguous Patch Masking,单次前向传播即可生成整个预测区间,并为每个目标输出 10 到 90 分位的 9 个分位数。

8月27日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化文本。据 Artificial Analysis 测量,流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写时间较前代 Chirp 3 改善 70%;模型支持 85 种以上语言自动检测、自定义词汇和最多三位说话人区分。

    推荐理由:官方给出 WER、延迟与多语言等量化指标,并列出两套 API 与产品落地入口,便于判断语音转写能力边界。

8月25日周二
8月14日周五
8月12日周三
  1. Google DeepMind78

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语种手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

    推荐理由:SL2T 把多语种手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与隐私设计。

8月10日周一
8月6日周四
  1. Google DeepMind82

    Google DeepMind 开源 WeatherNext 气旋预报模型

    Google DeepMind 发布 WeatherNext AI 模型,在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取约一天的预警时间,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出气旋路径与强度预报多出约一天预警时间,并开源模型权重与代码,读者可据此判断气象预报工作流的可用变化。

8月4日周二
  1. Mistral AI71

    Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,采用 Apache 2.0 许可,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时接受自然语言策略并输出校准后的安全分数,无需重新训练,统一处理文本与图像安全评估。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。

    推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,读者可据此判断轻量安全分类器的部署门槛。

7月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出进度分类与时刻定位两项量化指标,可据此判断机器人在长任务中自我纠错与切换步骤的能力边界。

  2. Google DeepMind62

    Google DeepMind 在 Google Flow Music 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量与提示词遵循度、结构感知更好,人声表达与情感更细腻且发音改善,同时可更便捷地控制输出节奏与时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。

7月28日周二
7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:官方披露了轻量安全模型的基准表现与限量开放方式,可了解专用小模型在漏洞挖掘上的取舍。

7月15日周三
  1. Hugging Face Blog84

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文并原生接收图像、文本和音频输入的开源多模态 MoE 模型,同时推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月8日周三
  1. Mistral AI71

    Mistral AI 发布具身导航模型 Robostral Navigate

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。

    推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成功率与训练方法,可据此判断具身导航对传感器配置的依赖程度。

7月2日周四
  1. Mistral AI66

    Mistral 发布 Leanstral 1.5:6B 激活参数形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数 6B 激活参数的形式化验证模型,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34%。

    推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的具体成绩与每道题成本对比,读者可据此判断开源证明模型的性价比。

7月1日周三
  1. Google DeepMind82

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,4 秒生成文本到图像,每张 1K 图像 0.034 美元;后者支持高质量视频生成与对话式编辑,输出视频定价为每秒 0.10 美元。

    推荐理由:两款模型同日开放开发者入口,并给出延迟、单价与能力边界,便于评估图像到视频的串联工作流。

6月30日周二
  1. Google Research78

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准表现,读者可据此判断零样本表格预测能否替代传统树模型流程。

6月23日周二
  1. Mistral AI66

    Mistral 发布 OCR 4,支持 170 种语言与单容器自托管

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,官方同时说明这两个基准在数学、科学和多栏文档上存在评分偏差,建议以自身文档实测为准。

    推荐理由:OCR 4 在文本之外返回边界框、块类型与置信度,读者可据此判断结构化文档解析如何接入 RAG 与智能体流程。

6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布 DiffusionGemma 实验模型,文本生成最高提速 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理加速,单张 NVIDIA H100 上超过 1000 tokens/秒、RTX 5090 上超过 700 tokens/秒。

    推荐理由:官方给出 4x 加速的实测数字与硬件门槛,读者可据此判断本地低并发场景是否值得换用扩散式生成。

6月9日周二
5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,将指令遵循、推理与编码合并到同一套权重中,以修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,τ³-Telecom 得分 91.4。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管与异步编码的可行边界。

5月18日周一
  1. Google DeepMind82

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑

    Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮对话编辑视频。

    推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API、Google AI Studio、Android Studio 及 Gemini Enterprise 上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放渠道,可据此判断速度与质量的取舍。

4月16日周四
4月13日周一
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比和仪表读数新能力,可据此判断机器人高层推理的进展。

3月24日周二
  1. Mistral AI69

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,具备情感表达与零样本跨语言音色适配能力。

    推荐理由:Mistral 首款 TTS 模型给出参数量、延迟与定价,并公开与 ElevenLabs 的对比评测,便于判断企业语音栈的选型空间。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有