跳到正文

#Agent

今日 11 条
6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI Control Roadmap,用纵深防御保障内部 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理先进 AI 的纵深防御框架,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。

    推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把内部智能体当作潜在内部威胁的分级监控与响应框架。

6月10日周三
6月5日周五
5月29日周五
  1. Google Research60

    Google Research 在 I/O 2026 发布 Gemini for Science 等多项研究进展

    Google Research 在 I/O 2026 上公布多项进展,包括基于 ERA 与 Co-Scientist 的 Gemini for Science 科研工具套件,以及用于科学假设生成的 Hypothesis Generation 和基于 NotebookLM 的 Literature Insights。

    推荐理由:Google Research 在 I/O 2026 集中披露科研智能体、健康 AI 与量子计算进展,可据此了解其研究到产品的转化路径。

5月28日周四
  1. Mistral AI78

    Mistral 将 Le Chat 升级为统一智能体 Vibe,推出 Work Mode 与 Code Mode

    Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。Work Mode 可在网页和移动端执行收件箱整理、深度研究、文档起草等长周期任务,支持企业知识搜索、结构化数据分析和可复用技能;Code Mode 提供远程编码会话,并新增 VS Code 扩展和 CLI 更新。

    推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作与编码两种模式的能力边界和定价分层。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,将指令遵循、推理与编码合并到同一套权重中,以修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,τ³-Telecom 得分 91.4。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管与异步编码的可行边界。

5月20日周三
  1. Google Research75

    Google 发布 ERA 科研工具并开放 Computational Discovery 试用

    Google 发布 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并开始通过 Gemini for Science 向全球科学家开放。

    推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,读者可据此判断科研编码自动化的落地程度。

5月19日周二
  1. Google DeepMind62

    Google DeepMind 用 Co-Scientist 加速细胞衰老逆转研究

    Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究。它扫描数万篇论文后提出 20 多个新的候选遗传因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。此外,Co-Scientist 将原本需要长达六个月的筛选数据分析缩短到几天。

    推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与验证结果,读者可了解 AI 辅助科研的落地方式。

5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实地点生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View grounding 能力,用户可通过 Maps 图钉选择美国境内地点,并叠加 Desert Sands、Stone Age、Ocean World、B&W film 等风格,再描述角色来生成以真实影像为起点的可交互世界。

    推荐理由:Genie 接入 Street View 真实影像后,读者可了解世界模型如何以真实地点为锚点生成可交互环境。

5月17日周日
5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API、Google AI Studio、Android Studio 及 Gemini Enterprise 上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放渠道,可据此判断速度与质量的取舍。

5月12日周二
5月8日周五
  1. Berkeley AI Research45

    自适应并行推理:高效推理扩展的下一个范式

    自适应并行推理(Adaptive Parallel Reasoning)允许模型自主决定何时分解子任务、生成并发线程数量及协调方式,以解决顺序推理导致的上下文膨胀与延迟问题。该范式旨在克服现有固定并行结构无法根据问题复杂度动态调整计算资源的局限,实现更高效的大语言模型推理扩展。

5月6日周三
  1. Google DeepMind76

    Google DeepMind 汇总 AlphaEvolve 一年跨领域落地成果

    Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心,用于优化下一代 TPU 设计与缓存替换策略。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,覆盖基因组、电网、TPU 与多家企业应用,可看算法智能体的跨领域边界。

5月4日周一
4月30日周四
  1. Google DeepMind66

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 个案例零关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。

    推荐理由:DeepMind 公开 AI co-clinician 研究计划,给出医生盲评与实时多模态模拟的对比数据,可了解医疗智能体当前能力边界。

  2. Google Research62

    Google Research 科学家使用 ERA 开展科研的四种方式

    Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)开展科研的四个方向。公共卫生方面,团队每周向 CDC 的流感、COVID-19 和 RSV 住院预测项目提交全美各州、最长提前四周的实时预测,在流感与 COVID-19 公开排行榜上处于或接近榜首。

    推荐理由:四个跨领域案例展示了 ERA 从预测到机制发现的具体用法,可了解 AI 辅助科研的落地边界。

4月27日周一
  1. Mistral AI71

    Mistral AI 发布 Workflows 公开预览版

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久执行、可观测性和容错能力,把 AI 流程从概念验证推进到生产环境。ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等组织已用其自动化关键流程。

    推荐理由:Mistral 把企业级 AI 编排的持久执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。

4月22日周三
4月21日周二
4月14日周二
4月9日周四
  1. Google Research34

    Google Research 发布 ConvApparel:测量并弥合用户模拟器的真实感差距

    Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,将用户随机路由至乐于助人的 "Good" 智能体或刻意不配合的 "Bad" 智能体,并配有逐轮用户满意度等标注。研究同时提出包含群体统计对齐、人类相似度评分与反事实验证三支柱的评估框架。

3月31日周二
3月25日周三
3月18日周三
  1. Mistral AI62

    Mistral AI 推出企业级模型训练系统 Forge

    Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业内部基础设施中训练与治理。该平台以智能体优先设计,Mistral Vibe 这类自主智能体可用它微调模型、寻找最优超参数、调度任务并生成合成数据,用户只需用自然语言即可定制模型。

    推荐理由:原文给出企业用自有数据训练前沿模型的分阶段能力与架构选择,可据此判断自建模型的落地路径。

3月12日周四
  1. Google Research66

    Google 与 BIDMC 开展对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,由医生通过视频实时监督。

    推荐理由:Google 与 BIDMC 首次在真实门诊流程中前瞻性部署对话式诊断 AI,给出了安全事件、诊断一致性与医患反馈的具体数据。

3月11日周三
1月28日周三
  1. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与订阅方案,可据此判断终端编码智能体的工作流变化。

12月9日周二
  1. Mistral AI77

    Mistral 发布 Devstral 2 编码模型家族与 Mistral Vibe CLI

    Mistral AI 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源模型,分别采用修改版 MIT 和 Apache 2.0 许可。

    推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,便于判断开源编码模型与闭源模型的差距。

10月24日周五
  1. Mistral AI62

    Mistral AI 发布 AI Studio 生产平台

    Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

    推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力产品化,读者可据此判断企业 AI 从原型走向生产的门槛在哪。

9月2日周二
  1. Mistral AI42

    Mistral AI 为 Le Chat 推出 Memories 记忆功能(beta)

    Mistral AI 为 Le Chat 上线 Memories(beta),采用自动保存、智能召回并显示来源链接的混合方案。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与导入。同步推出 Memory Insights,基于用户数据生成趋势与摘要,后续将支持记忆分类、即时遗忘和更清晰的调用记录。

  2. Mistral AI65

    Mistral 为 Le Chat 上线自定义 MCP 连接器与 Memories

    Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,可连接 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。

    推荐理由:官方给出连接器目录与 Memories 的具体能力边界,可据此判断企业工作流接入方式。

7月30日周三
  1. Mistral AI62

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08,并推出由 Codestral、Codestral Embed、Devstral 和 Mistral Code IDE 插件组成的企业级编码栈。

    推荐理由:Mistral 把补全、代码检索与智能体工作流打包成可私有部署的企业编码栈,读者可据此判断自托管方案的能力边界。

7月17日周四
  1. Mistral AI65

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:官方一次性放出深度研究、语音、推理与图像编辑多项能力,可据此判断 Le Chat 的助手定位走向。

7月11日周五
6月4日周三
  1. Mistral AI62

    Mistral 发布企业级 AI 编码助手 Mistral Code

    Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量和本地气隙 GPU 部署,代码保留在企业边界内。

    推荐理由:原文给出企业级编码助手的模型组合、部署方式与客户落地案例,可据此判断私有化编码方案的取舍。

5月27日周二

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有