跳到正文

#多模态

今日 3 条
今天10月2日周五
  1. TechCrunch · AI66

    ChatGPT 上线虚拟试穿与商品收藏功能

    OpenAI 宣布在全球上线 ChatGPT 两项购物功能,包括虚拟试穿和商品收藏。用户在购物结果中点 Try On 按钮,上传自拍或全身照即可查看服装、配饰的上身效果,也可上传商品图片让 ChatGPT 代为试穿;Favorites 则把发现的商品存入应用内 Library 以便回看。OpenAI 称新功能基于新发布的 ChatGPT Images 2.5 模型,而此前其即时结账功能表现不佳。

10月1日周四
  1. AWS Machine Learning Blog31

    Condé Nast 如何利用 Amazon Bedrock 构建多模态视频发现系统

    Condé Nast 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现系统,将内容检索时间从 250 分钟缩短至 2 分钟以内。该系统采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频信号进行联合编码,支持基于意图的语义搜索。此前编辑团队依赖标题和描述手动查找素材,导致运营效率低下。

9月30日周三
  1. Google DeepMind68

    Google DeepMind 发布 SynthID Bio 合成生物水印技术

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,在保持蛋白质生物功能的同时嵌入可验证签名。实验显示,水印设计在结合亲和力和序列多样性上与无水印版本相当,并成功创建了首个具有生物功能的水印蛋白质结合器。

    推荐理由:原文展示了在保持生物功能前提下对蛋白质进行水印验证的方法,为合成生物安全提供了新的技术路径。

9月29日周二
  1. Microsoft Research62

    微软研究院推出面向生物学复杂性的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

9月26日周六
9月25日周五
  1. MIT Technology Review · AI42

    五角大楼申请 3000 万美元预算开发 AI 测谎仪

    美国国防部申请 3030 万美元预算,用于开发名为 Polygraph+ 的 AI 测谎技术。该项目由 DCSA 主导,旨在通过 AI 算法和“standoff sensing”技术提升联邦测谎的准确性与可靠性。尽管该技术尚未获国会批准,且现有测谎仪的可靠性长期受质疑,五角大楼仍计划将其用于员工背景调查和内部威胁检测。

  2. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟流式视频与语音结合实现近实时视觉存在。该功能支持 97 种语言的唇形同步,并能在对话进行中后台异步执行工具调用,目前已通过 Gemini Enterprise 开放。

    推荐理由:原文展示了实时视频与语音结合的多模态交互能力,以及后台异步工具调用机制,为构建企业级虚拟助手提供了具体参考。

9月24日周四
  1. NVIDIA Blog60

    NVIDIA 与 Google DeepMind 等机构开放 2800 多种病毒蛋白复合物 3D 结构预测数据

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了超过 2800 种病毒的蛋白复合物 3D 结构预测数据。该数据集利用 AlphaFold2 和 NVIDIA BioNeMo Inference Runtime 生成,其中约 30% 的蛋白相互作用是科学界首次记录,旨在帮助科学家提前储备应对未来大流行的知识。

    推荐理由:NVIDIA 与 Google DeepMind 等机构开放了 2800 多种病毒的蛋白复合物 3D 结构预测数据,为未来疫情应对提供基础生物学知识储备。

9月23日周三
9月18日周五
  1. Google Research55

    Google Research 发布利用生成式 UI 创建交互式学习模拟的研究

    Google Research 发布新研究,利用生成式 UI 让教师创建定制化的交互式 STEM 学习模拟。该研究基于 LearnLM 模型,通过教学护栏和自纠正循环确保内容准确性,并发布了包含 30 多个英语 STEM 交互示例的库。美国 12 名教师试点反馈积极,平均评分 8/10,学校可通过 Google for Education Pilot Program 申请参与。

9月8日周二
  1. Google DeepMind73

    Google DeepMind 发布 AlphaGenome Atlas 全基因组变异预测平台

    Google DeepMind 发布 AlphaGenome Atlas,提供人类基因组中 90 亿种单核苷酸变异的分子效应预测。该平台包含 1PB 数据集,并推出 AVI 评分以整合 AlphaGenome 和 AlphaMissense 的预测结果,帮助研究人员快速排序和解读基因变异。

    推荐理由:原文展示了覆盖全基因组 90 亿种变异的预测平台,为遗传学研究提供了可复用的分子效应评估工具。

9月3日周四
  1. Google DeepMind84

    Google DeepMind 发布 WeatherNext 3 全球气象 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是其最先进的全球气象 AI 模型,支持实时卫星数据输入和每小时刷新。该模型在 5 公里分辨率下提供温度等表面变量预测,并将降水预测准确率提升最高 60%,已集成至 Search、Gemini 和 Maps 等产品。

    推荐理由:模型直接学习实时卫星数据并实现每小时更新,为高纬度地区提供更高精度的局部气象预测。

9月2日周三
8月28日周五
8月26日周三
8月21日周五
8月17日周一
8月13日周四
  1. Microsoft Research41

    MindTopo:微软研究院推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结等拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型难以在场景变化中持续保持对拓扑结构的理解。图像与视频生成工具在维持拓扑关系上同样不可靠。

8月12日周三
  1. Google DeepMind78

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语种手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

    推荐理由:SL2T 把多语种手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与隐私设计。

  2. Google Research71

    Google 发布 AMIE (Video):实时视频问诊达到专家级水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊配置,能感知非语言临床线索、引导虚拟体格检查并实时进行诊断推理。

    推荐理由:Google 用 300 场随机对照问诊给出实时视频临床 AI 的专家级评测结果,可看多智能体异步架构如何兼顾低延迟对话与深度推理。

8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言版:364M 开源权重,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升多语言质量。

    推荐理由:原文给出 364M 开源权重模型的多语言扩展与自部署延迟数据,可据此评估自建语音链路的成本与可行性。

8月10日周一
8月4日周二
  1. Mistral AI71

    Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,采用 Apache 2.0 许可,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时接受自然语言策略并输出校准后的安全分数,无需重新训练,统一处理文本与图像安全评估。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。

    推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,读者可据此判断轻量安全分类器的部署门槛。

7月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出进度分类与时刻定位两项量化指标,可据此判断机器人在长任务中自我纠错与切换步骤的能力边界。

7月28日周二
7月23日周四
7月21日周二
7月16日周四
7月15日周三
  1. Hugging Face Blog84

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文并原生接收图像、文本和音频输入的开源多模态 MoE 模型,同时推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有