跳到正文

#Agent

今日 7 条
7月23日周四
7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:官方披露了轻量安全模型的基准表现与限量开放方式,可了解专用小模型在漏洞挖掘上的取舍。

7月16日周四
  1. Hugging Face Blog88

    Hugging Face 披露 7 月安全事件:自主 AI 智能体驱动入侵

    Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件由一套自主 AI 智能体系统端到端驱动,攻击者通过数据集处理流程中的远程代码加载器和模板注入两条代码执行路径进入处理节点,随后提升至节点权限、窃取云与集群凭证并在周末横向移动至多个内部集群。

    推荐理由:Hugging Face 披露首起由自主 AI 智能体端到端驱动的入侵,并复盘用开源模型做取证时遭遇的护栏限制。

7月15日周三
  1. Hugging Face Blog84

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文并原生接收图像、文本和音频输入的开源多模态 MoE 模型,同时推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月13日周一
7月9日周四
  1. Mistral AI40

    Mistral Studio 为 Prompts 和 Skills 提供系统化记录管理

    Mistral Studio 即日起为 Prompts 和 Skills 提供集中化系统记录,每个资产可版本化、归属明确且可追溯。不可变版本、回滚、审计日志和分类标签等功能,让非开发者的业务团队也能直接迭代并部署生产指令,同时触发既有 CI/CD 流程。Skills 可作为 MCP 服务器直接从 Studio 调用,确保生产执行的是受治理的同一版本资产。

  2. Google Research62

    Google Research 发布 SensorFM 可穿戴健康基础模型

    Google Research 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自 500 万同意参与者、超过 1 万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。

    推荐理由:原文给出可穿戴健康基础模型的预训练规模与下游评测结果,读者可据此判断通用生理表征的可行性。

7月7日周二
  1. Hugging Face Blog62

    微软在 Foundry Managed Compute 上线 Hugging Face 模型集合

    微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将开源权重模型以每周刷新、一键部署的方式接入 Foundry,权重预存于 Azure,运行时由微软构建并扫描。

    推荐理由:微软与 Hugging Face 合作把开源权重模型接入 Foundry,读者可了解企业部署开源模型时被补齐的运维环节。

  2. Berkeley AI Research40

    智能近乎免费后,面向、基于及由智能体构建的数据系统

    随着推理成本降至百万 token 低于 $1,UC Berkeley 团队提出数据系统需应对智能体带来的三大挑战。针对智能体作为主要负载,系统需优化高重复率的查询并支持近似答案;针对智能体集群管理,需构建支持长任务状态协调与共识的新基础设施;针对智能体自主合成系统,需解决验证其符合预期行为的难题。

7月1日周三
6月25日周四
  1. Google DeepMind78

    Google DeepMind 将 computer use 内置到 Gemini 3.5 Flash

    Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它仅作为独立的 Gemini 2.5 computer use 模型提供。

    推荐理由:原文给出 computer use 从独立模型并入主 Flash 模型的变化,以及企业级安全防护选项,读者可据此判断智能体跨平台自动化的落地条件。

6月24日周三
  1. Mistral AI62

    Mistral AI 为 Connectors 增加管理员控制、API key 作用域与调试器

    Mistral AI 为 Connectors 推出多项新能力:管理员控制(GA)可按 workspace 或组织设置连接器访问并逐个开关工具,带连接器作用域的 API key(GA)防止自动化 AI 工作负载冒用身份,多账号连接器(GA)支持一个连接器绑定多个账号。

    推荐理由:原文列出连接器的权限、身份与调试能力,读者可据此判断企业级智能体接入外部系统时的治理方式。

6月23日周二
  1. Mistral AI66

    Mistral 发布 OCR 4,支持 170 种语言与单容器自托管

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,官方同时说明这两个基准在数学、科学和多栏文档上存在评分偏差,建议以自身文档实测为准。

    推荐理由:OCR 4 在文本之外返回边界框、块类型与置信度,读者可据此判断结构化文档解析如何接入 RAG 与智能体流程。

6月17日周三
  1. Google DeepMind60

    Google DeepMind 与英国政府合作开发 AI 规划审批工具,目标将审批时间减半

    Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,共同开发一款 AI 规划审批原型工具,目标是将住户规划申请的处理时间缩短 50%。

    推荐理由:英国政府与 Google DeepMind 合作开发规划审批 AI 原型,目标将审批时间减半,2027 年全国推广。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI Control Roadmap,用纵深防御保障内部 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理先进 AI 的纵深防御框架,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。

    推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把内部智能体当作潜在内部威胁的分级监控与响应框架。

6月10日周三
6月5日周五
5月29日周五
  1. Google Research60

    Google Research 在 I/O 2026 发布 Gemini for Science 等多项研究进展

    Google Research 在 I/O 2026 上公布多项进展,包括基于 ERA 与 Co-Scientist 的 Gemini for Science 科研工具套件,以及用于科学假设生成的 Hypothesis Generation 和基于 NotebookLM 的 Literature Insights。

    推荐理由:Google Research 在 I/O 2026 集中披露科研智能体、健康 AI 与量子计算进展,可据此了解其研究到产品的转化路径。

5月28日周四
  1. Mistral AI78

    Mistral 将 Le Chat 升级为统一智能体 Vibe,推出 Work Mode 与 Code Mode

    Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。Work Mode 可在网页和移动端执行收件箱整理、深度研究、文档起草等长周期任务,支持企业知识搜索、结构化数据分析和可复用技能;Code Mode 提供远程编码会话,并新增 VS Code 扩展和 CLI 更新。

    推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作与编码两种模式的能力边界和定价分层。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,将指令遵循、推理与编码合并到同一套权重中,以修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,τ³-Telecom 得分 91.4。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管与异步编码的可行边界。

5月20日周三
  1. Google Research75

    Google 发布 ERA 科研工具并开放 Computational Discovery 试用

    Google 发布 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。

    推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,读者可据此判断科研编码自动化的落地程度。

5月19日周二
  1. Google DeepMind62

    Google DeepMind 用 Co-Scientist 加速细胞衰老逆转研究

    Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究。它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。此外,Co-Scientist 将原本需要长达六个月的筛选数据分析缩短到几天。

    推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,读者可了解 AI 辅助科研的落地方式。

5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实地点生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View grounding 能力,用户可通过 Maps 图钉选择美国境内地点,并叠加 Desert Sands、Stone Age、Ocean World、B&W film 等风格,再描述角色来生成以真实影像为起点的可交互世界。

    推荐理由:Genie 接入 Street View 真实影像后,读者可了解世界模型如何以真实地点为锚点生成可交互环境。

5月17日周日
5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API、Google AI Studio、Android Studio 及 Gemini Enterprise 上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放渠道,可据此判断速度与质量的取舍。

5月12日周二
5月8日周五
  1. Berkeley AI Research45

    自适应并行推理:高效推理扩展的下一个范式

    自适应并行推理(Adaptive Parallel Reasoning)允许模型自主决定何时分解子任务、生成并发线程数量及协调方式,以解决顺序推理导致的上下文膨胀与延迟问题。该范式旨在克服现有固定并行结构无法根据问题复杂度动态调整计算资源的局限,实现更高效的大语言模型推理扩展。

5月6日周三
  1. Google DeepMind76

    Google DeepMind 汇总 AlphaEvolve 一年跨领域落地成果

    Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可看算法智能体的跨领域边界。

4月30日周四
  1. Google DeepMind66

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 个案例零关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。

    推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生盲评与实时多模态模拟的对比数据,可了解医疗智能体当前能力边界。

  2. Google Research62

    Google Research 科学家使用 ERA 开展科研的四种方式

    Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)开展科研的四个方向。公共卫生方面,团队每周向 CDC 的流感、COVID-19 和 RSV 住院预测项目提交全美各州、最长提前四周的实时预测,在流感与 COVID-19 公开排行榜上处于或接近榜首。

    推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的具体用法,可了解 AI 辅助科研的落地边界。

4月27日周一
  1. Mistral AI71

    Mistral AI 发布 Workflows 公开预览版

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久执行、可观测性和容错能力,把 AI 流程从概念验证推进到生产环境。ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等组织已用其自动化关键流程。

    推荐理由:Mistral 把企业级 AI 编排的持久执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。

4月22日周三
4月21日周二
4月14日周二
4月9日周四
  1. Google Research34

    Google Research 发布 ConvApparel:测量并弥合用户模拟器的真实感差距

    Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,将用户随机路由至乐于助人的 "Good" 智能体或刻意不配合的 "Bad" 智能体,并配有逐轮用户满意度等标注。研究同时提出包含群体统计对齐、人类相似度评分与反事实验证三支柱的评估框架。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有