Ideogram 称新模型 Ideogram 4.5 可局部编辑图像而不影响其余部分
Ideogram 发布新模型 Ideogram 4.5,称其只改动用户指定区域,换装等局部编辑不会改变人物身形和背景。该模型提供四档质量,单张价格 0.8 至 22 美分,均为原生 2K 分辨率,现已在 Ideogram 平台和 API 上线,目标场景包括产品摄影、室内设计、照片修复和图内文字编辑。
Ideogram 发布新模型 Ideogram 4.5,称其只改动用户指定区域,换装等局部编辑不会改变人物身形和背景。该模型提供四档质量,单张价格 0.8 至 22 美分,均为原生 2K 分辨率,现已在 Ideogram 平台和 API 上线,目标场景包括产品摄影、室内设计、照片修复和图内文字编辑。
Tavus 的 Griffin 模型在1分钟视频通话中让48%参与者误认为真人,此前系统最高仅2%。在 Tavus 所述的 Nvidia 独立音频视频对话拟人测试中 Griffin 获3.83分接近人类3.92分,预览版 Griffin-Lite 已开放给选定测试者。Tavus 成立于2020年,从营销视频扩展至实时对话。
Amazon Web Services 发布开源决策模型 Strands Decider 2B,受 Jev 启发,以低成本和置信度评分适配智能体工作流的步骤决策。该模型基于 Qen3.5-2B 构建,完全开源可本地运行,由 Strands Labs 推出;同周 OpenAI 也宣布了类似产品,反映决策模型涌现。
Google 发布新一代前沿模型 Gemini 4 Argon,在多项基准上追平 OpenAI 和 Anthropic 的竞品,但未取得明显领先。Argon 先向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才逐步面向开发者、企业和消费者,API 促销价为每百万输入 token 2 美元、输出 10 美元。
推荐理由:汇总第三方基准与定价数据,可对比 Argon 与 GPT-6、Claude 系列在智能指数和 token 消耗上的差距。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前用户还无法使用。此前外界预期的 Gemini 3.5 Pro 并未出现。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证并修补关键软件漏洞。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在真实软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中具备前沿性能。该模型初期仅向一组可信网络防御方开放,Google 表示正参与美国政府的前沿模型预发布访问流程并逐步扩大访问范围。
推荐理由:Google 发布 Gemini 4 Argon 却先限制给可信网络防御方,读者可据此观察前沿模型发布与安全审查的绑定趋势。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,之后才向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的实际差距。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在长程编码、企业知识工作与网络安全防御上的基准与内部落地数据,可据此判断前沿模型的能力边界与分阶段开放节奏。
文章指出 OpenAI 正在打击旨在提取模型推理能力的保护性模型蒸馏计划,并加强防御措施。
OpenAI 发布 GPT-6.1 Sol 超快模式,支持 8x 生成速度,定价 $60/M tokens,在自动化基准上击败 Opus 5.5 的 1/3 成本,并引入 Decisions API 和 Codex 云环境。
OpenAI 推出 GPT 6.1 Sol,该模型提供接近 Astra 水平的智能,价格仅为后者的五分之一。
NVIDIA 发布开源表格基础模型 Kumo Tabular,支持分类与回归任务,单次前向传播即可预测新行标签,无需训练或特征工程。该模型在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准测试中均排名第一,提供 28M 至 215M 参数三种尺寸,基于 OpenMDW-1.1 许可证开放商用。
推荐理由:该模型在四个基准测试中排名第一,展示了无需训练即可处理表格数据的效率与准确性平衡。
开源多模态模型 GPT-6.1 Sol 发布,支持代码、电脑及专业工作,价格减半,上下文 8k,参数 175B,速度 3.5x,可用性开源。
2026 年 9 月 29 日发布的 OpenAI DevDay 2026 回顾,涵盖 GPT-6 Astra、ChatGPT、Codex 及多模态工具,标志着大模型生态的重大演进。
Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上,大多数工作成本降低最多 30%。该模型定价与 Sonnet 5 相同,但在各项基准测试中表现优于 Sonnet 5,且成为 claude.ai 免费层使用的模型。
推荐理由:原文对比了 Sonnet 5.5 与 Opus 5.5 在编码任务上的表现,并指出其成为 claude.ai 免费层模型带来的竞争变化。
本文介绍了 OpenAI 发布的 Towards safety cases for frontier AI training 模型,涵盖技术保障、运营实践及误alignment 调查,旨在构建前沿 AI 训练的安全防线。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet。
H company 发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两种规格,同时更新 Holotron4 Nano。Holo4 通过 GUI、代码、MCP 和 API 与软件交互,在 OSWorld 2.0 上 27B 版本得分 61.7%,35B-A3B 版本得分 30.9%。
推荐理由:Holo4 支持 GUI、代码、MCP 和 API 多接口交互,在 OSWorld 2.0 上以更低成本接近闭源模型表现。
Liquid AI 发布 LFM2.5-VL-DSpark 实验性草稿模型,为 LFM2.5-VL-3B 视觉语言模型引入推测解码路径。该模型增加 280M 参数,在 H100 上实现最高 2.66x 解码加速,并支持 llama.cpp、MLX-VLM 和 SGLang。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,支持通过自然语言提示创建自定义角色声音并逐行指导场景对话。
推荐理由:原文展示了从静态预设到动态创意工作室的转变,提供了多语言角色定制与场景对话控制的具体能力。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:汇总了 Opus 5.5 与 GPT-6 Sol/Luna 同日的定价、基准与第三方评测,便于对比两家新模型的取舍。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者 Simon Willison 记录了自己的初步印象。
推荐理由:作者实测对比了同日发布的三款新模型,并给出完整价格表,可据此判断这轮降价对应用选型的影响。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,面向日常工作场景提供前沿智能,两者在能力与成本上有不同的平衡取向。
小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,位列开源权重模型首位,定价 $0.435/M 输入、$0.87/M 输出 token,采用 MIT 许可。
推荐理由:小米首次进入前沿开源模型序列,其RL环境与训练配方开源,可观察后训练成本压缩到何种程度。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,旨在提升实时语音对话的智能与并行推理能力。
推荐理由:原文给出了两款实时语音模型在推理与工具调用上的具体基准表现,读者可据此评估其在生产级语音智能体中的适用性。
OpenAI 发布 GPT-6 Astra,称其是面向企业场景能力最强的模型,具备高级推理、计算机操作以及更强的写作与设计判断力。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力定位,读者可据此了解其推理与计算机操作方向。
Google DeepMind 发布 WeatherNext 3,这是其最先进的全球气象 AI 模型,支持实时卫星数据输入和每小时刷新。该模型在 5 公里分辨率下提供温度等表面变量预测,并将降水预测准确率提升最高 60%,已集成至 Search、Gemini 和 Maps 等产品。
推荐理由:模型直接学习实时卫星数据并实现每小时更新,为高纬度地区提供更高精度的局部气象预测。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个版本,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型,并以掩码离散扩散目标从零训练。
Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,前者定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的能力、定价和开放入口,可据此判断长程编码与安全场景的选型。
Google 发布 TimesFM-3,这是其新一代时间序列基础模型,原生预训练支持多变量预测,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,采用交替注意力架构与 Contiguous Patch Masking,单次前向传播即可生成整个预测区间,并为每个目标输出 10 到 90 分位的 9 个分位数。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化文本。据 Artificial Analysis 测量,流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写时间较前代 Chirp 3 改善 70%;模型支持 85 种以上语言自动检测、自定义词汇和最多三位说话人区分。
推荐理由:官方给出 WER、延迟与多语言等量化指标,并列出两套 API 与产品落地入口,便于判断语音转写能力边界。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
推荐理由:IBM 公开了 Granite 4.2 从预训练到多阶段 RL 的完整构建流程,可对照其分阶段课程与奖励设计理解推理模型如何训练。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体任务的性价比变化。
Google DeepMind 发布多语种手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:SL2T 把多语种手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与隐私设计。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署代码,可据此判断端侧智能体选型。
Google DeepMind 发布 WeatherNext AI 模型,在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取约一天的预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报多出约一天预警时间,并开源模型权重与代码,读者可据此判断气象预报工作流的可用变化。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,采用 Apache 2.0 许可,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时接受自然语言策略并输出校准后的安全分数,无需重新训练,统一处理文本与图像安全评估。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。
推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,读者可据此判断轻量安全分类器的部署门槛。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升:旋律结构更丰富自然,歌词质量与提示词遵循度、结构感知更好,人声表达与情感更细腻且发音改善,同时可更便捷地控制输出节奏与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。