ChatGPT 上线虚拟试穿与商品收藏功能
OpenAI 宣布在全球上线 ChatGPT 两项购物功能,包括虚拟试穿和商品收藏。用户在购物结果中点 Try On 按钮,上传自拍或全身照即可查看服装、配饰的上身效果,也可上传商品图片让 ChatGPT 代为试穿;Favorites 则把发现的商品存入应用内 Library 以便回看。OpenAI 称新功能基于新发布的 ChatGPT Images 2.5 模型,而此前其即时结账功能表现不佳。
OpenAI 宣布在全球上线 ChatGPT 两项购物功能,包括虚拟试穿和商品收藏。用户在购物结果中点 Try On 按钮,上传自拍或全身照即可查看服装、配饰的上身效果,也可上传商品图片让 ChatGPT 代为试穿;Favorites 则把发现的商品存入应用内 Library 以便回看。OpenAI 称新功能基于新发布的 ChatGPT Images 2.5 模型,而此前其即时结账功能表现不佳。
Google 在 Gemini Live 中推出 Guided Vision 功能,利用 AI 为 Android 用户提供实时音频描述,辅助阅读小字及识别物体。该功能同时集成于 Google TalkBack,并支持在 Android 9 及以上设备通过设置启用。此前该功能已在近期的 Pixel 更新中宣布。
Tavus 的 Griffin 模型在1分钟视频通话中让48%参与者误认为真人,此前系统最高仅2%。在 Tavus 所述的 Nvidia 独立音频视频对话拟人测试中 Griffin 获3.83分接近人类3.92分,预览版 Griffin-Lite 已开放给选定测试者。Tavus 成立于2020年,从营销视频扩展至实时对话。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证并修补关键软件漏洞。
Condé Nast 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现系统,将内容检索时间从 250 分钟缩短至 2 分钟以内。该系统采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频信号进行联合编码,支持基于意图的语义搜索。此前编辑团队依赖标题和描述手动查找素材,导致运营效率低下。
Amazon Bedrock AgentCore Runtime Instances 支持在单个 EC2 实例上部署多智能体,实现长达 14 天的持久化会话与 GPU 访问。该方案通过共享文件系统协作,利用 NVIDIA L4 GPU 运行 ACE-Step 模型,约 9 秒即可渲染 20 秒 48 kHz 立体声音频。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,在保持蛋白质生物功能的同时嵌入可验证签名。实验显示,水印设计在结合亲和力和序列多样性上与无水印版本相当,并成功创建了首个具有生物功能的水印蛋白质结合器。
推荐理由:原文展示了在保持生物功能前提下对蛋白质进行水印验证的方法,为合成生物安全提供了新的技术路径。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
AWS 展示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型走迷宫,基于 GRPO 从 VisGym SFT 检查点出发,在固定 64 个迷宫的评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
美国国防部申请 3030 万美元预算,用于开发名为 Polygraph+ 的 AI 测谎技术。该项目由 DCSA 主导,旨在通过 AI 算法和“standoff sensing”技术提升联邦测谎的准确性与可靠性。尽管该技术尚未获国会批准,且现有测谎仪的可靠性长期受质疑,五角大楼仍计划将其用于员工背景调查和内部威胁检测。
Latent Space 宣布将 AINews 与 Discord 社区合并,并计划迁移至 Beehiiv 以构建多节目网络。AINews 订阅量已超 20 万,Discord 成员达数万。平台重新开放赞助合作,并将于下周在 Supabase Select 活动上采访其创始人。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟流式视频与语音结合实现近实时视觉存在。该功能支持 97 种语言的唇形同步,并能在对话进行中后台异步执行工具调用,目前已通过 Gemini Enterprise 开放。
推荐理由:原文展示了实时视频与语音结合的多模态交互能力,以及后台异步工具调用机制,为构建企业级虚拟助手提供了具体参考。
Liquid AI 发布 LFM2.5-VL-DSpark 实验性草稿模型,为 LFM2.5-VL-3B 视觉语言模型引入推测解码路径。该模型增加 280M 参数,在 H100 上实现最高 2.66x 解码加速,并支持 llama.cpp、MLX-VLM 和 SGLang。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了超过 2800 种病毒的蛋白复合物 3D 结构预测数据。该数据集利用 AlphaFold2 和 NVIDIA BioNeMo Inference Runtime 生成,其中约 30% 的蛋白相互作用是科学界首次记录,旨在帮助科学家提前储备应对未来大流行的知识。
推荐理由:NVIDIA 与 Google DeepMind 等机构开放了 2800 多种病毒的蛋白复合物 3D 结构预测数据,为未来疫情应对提供基础生物学知识储备。
Meta 在 Connect 2026 上把 Muse 个人智能体作为硬件加智能体战略的核心,发布语音与实时视频能力、多款眼镜硬件,并预告但未发布新的前沿模型。
NVIDIA 在新加坡 AI Day 展示合作伙伴利用 Nemotron 和 Cosmos 模型加速东南亚 AI 落地。新加坡 HTX 使用 Nemotron 3 Super 和 Nano Omni 推进公共安全 AI,泰国 iApp Technology 基于 Nemotron 3 Nano 微调的开源法律模型已服务约 43,000 名用户。
Google Research 发布新研究,利用生成式 UI 让教师创建定制化的交互式 STEM 学习模拟。该研究基于 LearnLM 模型,通过教学护栏和自纠正循环确保内容准确性,并发布了包含 30 多个英语 STEM 交互示例的库。美国 12 名教师试点反馈积极,平均评分 8/10,学校可通过 Google for Education Pilot Program 申请参与。
Google DeepMind 发布 AlphaGenome Atlas,提供人类基因组中 90 亿种单核苷酸变异的分子效应预测。该平台包含 1PB 数据集,并推出 AVI 评分以整合 AlphaGenome 和 AlphaMissense 的预测结果,帮助研究人员快速排序和解读基因变异。
推荐理由:原文展示了覆盖全基因组 90 亿种变异的预测平台,为遗传学研究提供了可复用的分子效应评估工具。
Google DeepMind 发布 WeatherNext 3,这是其最先进的全球气象 AI 模型,支持实时卫星数据输入和每小时刷新。该模型在 5 公里分辨率下提供温度等表面变量预测,并将降水预测准确率提升最高 60%,已集成至 Search、Gemini 和 Maps 等产品。
推荐理由:模型直接学习实时卫星数据并实现每小时更新,为高纬度地区提供更高精度的局部气象预测。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个版本,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型,并以掩码离散扩散目标从零训练。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩画的思路,模型通过 p5.brush 写出约 150 行 JavaScript 程序作画,全部数据集、RL 环境、训练脚本与模型均已开源。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态处理的取舍差异。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来一批生成视频创作控制能力,通过 Gemini API 在 Google AI Studio 提供。
推荐理由:官方给出场景延展、首尾帧插值与 4K 上采样等具体能力与开放入口,可据此判断生成视频工作流的变化。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里边说边演示。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 玩转 49 款 Atari 游戏,到 AlphaGo、AlphaZero、MuZero、AlphaStar,再到由 Gemini 驱动的通用智能体 SIMA 2。
Google Research 提出 PhotoScan,一个从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,源码与模型权重随研究论文公开。用户可在 UI 或 API 中选择区域、时间范围、编码器变体(Nano 128 维 1.4M 参数、Tiny 192 维 6.2M 参数、Base 768 维 89M 参数)、分辨率与影像源,导出 int8 存储的 COG。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结等拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型难以在场景变化中持续保持对拓扑结构的理解。图像与视频生成工具在维持拓扑关系上同样不可靠。
Google DeepMind 发布多语种手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:SL2T 把多语种手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与隐私设计。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊配置,能感知非语言临床线索、引导虚拟体格检查并实时进行诊断推理。
推荐理由:Google 用 300 场随机对照问诊给出实时视频临床 AI 的专家级评测结果,可看多智能体异步架构如何兼顾低延迟对话与深度推理。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光 VLM,可同时完成报告生成、疾病存在与否定判断、病灶定位及多标签分类等任务,并支持生成式与双推理模式。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升多语言质量。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与自部署延迟数据,可据此评估自建语音链路的成本与可行性。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署代码,可据此判断端侧智能体选型。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,采用 Apache 2.0 许可,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时接受自然语言策略并输出校准后的安全分数,无需重新训练,统一处理文本与图像安全评估。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。
推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,读者可据此判断轻量安全分类器的部署门槛。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出进度分类与时刻定位两项量化指标,可据此判断机器人在长任务中自我纠错与切换步骤的能力边界。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:视觉-语言-动作模型 Gemini Robotics 2 可控制人形机器人全身动作并提升手部与夹爪的灵巧操作。
推荐理由:三款模型分别覆盖全身控制、具身推理与端侧部署,可据此判断机器人智能层的分工方式。
Google Research 发布论文 SymptomAI,用五个基于 Gemini Flash 2.0 的实验性对话智能体开展症状访谈与鉴别诊断(DDx),共 13,917 名参与者随机分配到不同提问策略组。
推荐理由:Google 用 1.3 万人随机对照实验比较五种提问策略,并首次把 AI 诊断与 Fitbit 生理信号做交叉验证。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber。
推荐理由:三款 Flash 系列模型同时发布,给出 token 效率、价格与多项基准对比,可据此判断智能体工作流的成本变化。
DharmaOCR 在葡萄牙语专属基准上取得 0.925 分,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语数据的监督微调与 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上保持优势。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文并原生接收图像、文本和音频输入的开源多模态 MoE 模型,同时推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。