跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1–20 条 · 共 96 条
10月1日周四
  1. The Decoder78

    Google 发布 Gemini 4 Argon,基准追平 OpenAI 与 Anthropic 但未明显领先

    Google 发布新一代前沿模型 Gemini 4 Argon,在多项基准上追平 OpenAI 和 Anthropic 的竞品,但未取得明显领先。Argon 先向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才逐步面向开发者、企业和消费者,API 促销价为每百万输入 token 2 美元、输出 10 美元。

    推荐理由:汇总第三方基准与定价数据,可对比 Argon 与 GPT-6、Claude 系列在智能指数和 token 消耗上的差距。

  2. TechCrunch · AI80

    OpenAI 新功能直指应用商店模式

    TechCrunch 分析称,OpenAI 在 Dev Day 上发布的 Dots 智能体、新模型等多项功能合起来指向一个更大的计划,即把 ChatGPT 本身变成软件被发现、启动和使用的入口,从而冲击传统应用商店模式。

    推荐理由:梳理 OpenAI Dev Day 多项发布如何拼出应用发现、分发与身份层,读者可据此判断传统应用商店模式受到的冲击。

  3. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,之后才向开发者、企业和消费者开放。

    推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的实际差距。

  4. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在长程编码、企业知识工作与网络安全防御上的基准与内部落地数据,可据此判断前沿模型的能力边界与分阶段开放节奏。

  5. TechCrunch · AI78

    Reddit 宣布停止 RSS 支持并将于 2027 年 3 月关闭公共 API

    Reddit 宣布将于 11 月 13 日停止 RSS 支持,并于 2027 年 3 月结束公共 API 访问,理由是防止大规模抓取和自动化滥用。此举将影响依赖 Reddit 数据的 AI 助手、研究人员及社交监听工具,迫使它们转向商业数据授权。

    推荐理由:Reddit 关闭 RSS 和公共 API 将切断 AI 产品的免费数据源,迫使开发者转向商业授权或替代方案。

9月30日周三
  1. NVIDIA Blog76

    NVIDIA 与 CoreWeave 推出 Vera Rubin NVL72 及 Forge 平台,加速 Agentic AI 生产落地

    CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统,Cognition 成为首个在生产环境中运行该系统的客户,其 Devin 推理工作负载的 token 吞吐量较 GB200 NVL72 提升 4.8 倍。

    推荐理由:原文展示了 Vera Rubin 在真实编码负载下的吞吐量提升,以及 CoreWeave Forge 如何打通从生产反馈到模型训练的闭环。

  2. AWS Machine Learning Blog83

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 表示该模型在 DeepSWE v1.1 上性能匹配 GPT-6 Astra,但单任务成本约为其五分之一,且比 GPT-6 Sol 最佳成绩高 6.4 个百分点。

    推荐理由:GPT-6.1 Sol 在 Amazon Bedrock 正式可用,以约五分之一成本实现接近 GPT-6 Astra 的推理能力,降低智能体工作流成本。

9月29日周二
  1. Simon Willison93

    OpenAI DevDay 2026 现场直播博客:发布 Dots 智能体与 GPT-6.1 Sol

    Simon Willison 在 OpenAI DevDay 2026 现场直播博客中记录了多项核心发布。OpenAI 推出了名为 Dots 的个人智能体产品,由 Astra 模型驱动,并同步上线 ChatGPT Space 协作功能。

    推荐理由:记录了 OpenAI 发布 Dots 智能体、GPT-6.1 Sol 模型及 Codex Security 等核心产品,提供了现场演示细节与功能对比。

  2. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度。

    推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此估算长任务智能体的成本与延迟取舍。

9月28日周一
  1. Hugging Face Blog82

    H company 发布 Holo4 通用计算机使用智能体模型

    H company 发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两种规格,同时更新 Holotron4 Nano。Holo4 通过 GUI、代码、MCP 和 API 与软件交互,在 OSWorld 2.0 上 27B 版本得分 61.7%,35B-A3B 版本得分 30.9%。

    推荐理由:Holo4 支持 GUI、代码、MCP 和 API 多接口交互,在 OSWorld 2.0 上以更低成本接近闭源模型表现。

  2. Simon Willison80

    Simon Willison 复盘 2026 年 LLM 发展:编码智能体成熟与训练安全失控

    Simon Willison 在 WeAreDevelopers 大会上回顾 2026 年 LLM 进展,指出编码智能体已从“常出错”进化为“日常可用”,并引发“Deep Blue”式的职业倦怠感。

    推荐理由:作者以个人视角复盘 2026 年 LLM 发展,重点分析了编码智能体带来的工程范式变化及训练过程中的安全失控事件。

9月25日周五
  1. Latent Space80

    Runway 实时世界模型 GWM Worlds 2 与 WorldPrompt 技术解析

    Runway 发布研究预览 GWM Worlds 2,引入 WorldPrompt 格式以支持实时交互式视频与音频生成。该模型通过自回归扩散和蒸馏技术实现 720p 24fps 的实时流式输出,允许用户通过提示词控制场景中的角色、相机和环境事件。

    推荐理由:通过Runway高管访谈,揭示了实时世界模型在自回归生成、蒸馏加速及因果一致性上的工程挑战与Agent应用潜力。

  2. GitHub Blog · AI & ML73

    GitHub Security Lab 发布基于 Taskflow Agent 的 AI 模糊测试工具

    GitHub Security Lab 发布了 Fuzzing Taskflow,一个针对 C/C++ 项目的自主模糊测试流水线,默认使用 Claude Sonnet 5 驱动。该工具通过 MCP 工具调用 AFL++ 和编译器,自动完成入口点识别、Harness 编写、覆盖率分析及崩溃分诊,并生成包含漏洞判定和修复建议的报告。

    推荐理由:展示了 LLM Agent 如何接管模糊测试中编写 Harness、分析覆盖率及分诊崩溃等重复性人工环节,为 C/C++ 项目自动化安全审计提供了可复用的工程范式。

  3. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟流式视频与语音结合实现近实时视觉存在。该功能支持 97 种语言的唇形同步,并能在对话进行中后台异步执行工具调用,目前已通过 Gemini Enterprise 开放。

    推荐理由:原文展示了实时视频与语音结合的多模态交互能力,以及后台异步工具调用机制,为构建企业级虚拟助手提供了具体参考。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有