Allen AI 发布 Olmo-core 3:面向大规模 MoE 的开放训练基础设施
Allen AI 发布 Olmo-core 3,一套面向大规模 MoE 的开放训练框架,设计目标是把 MoE 训练扩展到万亿参数级。
Allen AI 发布 Olmo-core 3,一套面向大规模 MoE 的开放训练框架,设计目标是把 MoE 训练扩展到万亿参数级。
NVIDIA 发布开源表格基础模型 Kumo Tabular,支持分类与回归任务,单次前向传播即可预测新行标签,无需训练或特征工程。该模型在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准测试中均排名第一,提供 28M 至 215M 参数三种尺寸,基于 OpenMDW-1.1 许可证开放商用。
推荐理由:该模型在四个基准测试中排名第一,展示了无需训练即可处理表格数据的效率与准确性平衡。
H company 发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两种规格,同时更新 Holotron4 Nano。Holo4 通过 GUI、代码、MCP 和 API 与软件交互,在 OSWorld 2.0 上 27B 版本得分 61.7%,35B-A3B 版本得分 30.9%。
推荐理由:Holo4 支持 GUI、代码、MCP 和 API 多接口交互,在 OSWorld 2.0 上以更低成本接近闭源模型表现。
Liquid AI 发布 LFM2.5-VL-DSpark 实验性草稿模型,为 LFM2.5-VL-3B 视觉语言模型引入推测解码路径。该模型增加 280M 参数,在 H100 上实现最高 2.66x 解码加速,并支持 llama.cpp、MLX-VLM 和 SGLang。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个版本,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型,并以掩码离散扩散目标从零训练。
Google 发布 TimesFM-3,这是其新一代时间序列基础模型,原生预训练支持多变量预测,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,采用交替注意力架构与 Contiguous Patch Masking,单次前向传播即可生成整个预测区间,并为每个目标输出 10 到 90 分位的 9 个分位数。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
推荐理由:IBM 公开了 Granite 4.2 从预训练到多阶段 RL 的完整构建流程,可对照其分阶段课程与奖励设计理解推理模型如何训练。
Liquid AI 为 LFM2.5 家族的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:官方给出三个模型在 H100 与 MacBook 上的实测加速比和调用方式,可据此判断端侧推理的可用性。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升多语言质量。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与自部署延迟数据,可据此评估自建语音链路的成本与可行性。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署代码,可据此判断端侧智能体选型。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文并原生接收图像、文本和音频输入的开源多模态 MoE 模型,同时推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数 6B 激活参数的形式化验证模型,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34%。
推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的具体成绩与每道题成本对比,读者可据此判断开源证明模型的性价比。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准表现,读者可据此判断零样本表格预测能否替代传统树模型流程。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理加速,单张 NVIDIA H100 上超过 1000 tokens/秒、RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 4x 加速的实测数字与硬件门槛,读者可据此判断本地低并发场景是否值得换用扩散式生成。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,具备情感表达与零样本跨语言音色适配能力。
推荐理由:Mistral 首款 TTS 模型给出参数量、延迟与定价,并公开与 ElevenLabs 的对比评测,便于判断企业语音栈的选型空间。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文本模型。
推荐理由:官方给出两款语音转写模型的延迟、错误率与价格对比,可据此判断实时语音应用的落地成本。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SoTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:官方给出 Devstral 在 SWE-Bench Verified 的分数与开源许可,读者可据此判断开源编码智能体的当前水位。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/s,以 Apache 2.0 许可开源。
推荐理由:官方给出 128k 上下文、150 tokens/s 与 Apache 2.0 开源等参数,可据此判断小模型在端侧与多模态场景的可用性。