跳到正文

#Agent

今日 11 条
9月22日周二
  1. Latent Space82

    小米发布 MiMo-V2.6-Pro 与 Flash 开源全模态模型,训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,位列开源权重模型首位,定价 $0.435/M 输入、$0.87/M 输出 token,采用 MIT 许可。

    推荐理由:小米首次进入前沿开源模型序列,其RL环境与训练配方开源,可观察后训练成本压缩到何种程度。

9月21日周一
  1. NVIDIA Blog42

    NVIDIA:AI 安全是工程问题——如何在智能体栈的每一层解决它

    NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。NVIDIA 还联合 Open Secure AI Alliance 推动研究成果与工具共享。

  2. Simon Willison40

    工程师爆料:大公司全员用 Claude Code 生成代码,无人阅读

    一位新入职大公司的工程师称,团队所有规格、代码、测试、PRD、工单及其解决方案、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事——和 Claude 对话。团队无人喜欢这种状态,却被要求尽可能多地产出,管理层多次表示推代码不是瓶颈,人们每天工作 12 到 13 小时只为按回车,没有人阅读任何内容。

9月19日周六
9月18日周五
9月17日周四
  1. GitHub Blog · AI & ML88

    GitHub Copilot 运行时迁移至 Rust 的实践复盘

    GitHub 团队利用 Copilot 智能体将 Copilot 运行时从 TypeScript 完全重写为 80 万行 Rust 代码。该过程采用增量式原地迁移策略,通过 128 个 Pull Request 逐步替换组件,最终实现了性能的数量级提升。作者详细复盘了智能体在代码审查、上下文管理及多会话协作中的具体表现,揭示了 AI 辅助大规模代码重构的工程细节。

    推荐理由:展示了利用 AI 智能体在数周内完成 80 万行 Rust 代码迁移的工程实践,提供了大规模自动化重构的方法论参考。

9月16日周三
9月14日周一
9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML40

    GitHub Copilot app 新手指南:使用 diff、终端和浏览器面板

    GitHub Copilot app 内置 diff、终端和浏览器面板,允许用户在不离开应用的情况下审查代码变更、运行命令及预览界面。用户可通过 diff 面板接受或修改变更,在终端面板执行如 `npm run dev` 等脚本,并利用浏览器面板的 Pick & Polish 工具迭代 UI。这种集成工作流消除了应用切换,帮助用户在合并前验证 AI 生成代码的功能与正确性。

9月10日周四
  1. OpenAI News62

    OpenAI 向所有人开放 ChatGPT Work 的 Data agent

    OpenAI 宣布 ChatGPT Work 中的 Data agent 现已向所有人开放。该智能体可连接企业数据、发现洞察,并用自然语言构建交互式仪表盘。

    推荐理由:OpenAI 官方披露 ChatGPT Work 中 Data agent 的开放范围与自然语言建看板能力,可据此判断企业数据接入方式的变化。

  2. Hugging Face Blog62

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111

    Hugging Face 发布 Workflow1111,用 73 个节点、11 条媒体管线在单张 Gradio Workflow 画布上重建了 AUTOMATIC1111 的大部分功能,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 和图像转视频。

    推荐理由:用 73 个节点复刻 A1111 全部功能,并展示输出节点如何自动变成 REST 端点和 MCP 工具。

  3. Hugging Face Blog60

    用 Hugging Face Jobs 跨机跑 Async GRPO 与 LoRA:一个存储桶、一个代理、不用 NCCL

    Hugging Face 博客介绍如何在 Hugging Face Jobs 上跨机运行 AsyncGRPOTrainer:训练 Job 只把 LoRA adapter 写入 Storage Bucket,两个 vLLM Job 从同一挂载路径读取,代理负责加鉴权头、按 KV 前缀路由 rollout 并把 adapter 加载广播到所有副本,全程不需要 NCCL。

    推荐理由:原文给出跨机异步 GRPO 的完整工程配方与五轮瓶颈定位数据,可迁移到自建 RL 训练流水线。

  4. OpenAI News68

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。

    推荐理由:OpenAI 官方发布 Agents API,读者可了解其托管服务定位与 Codex harness 编排能力。

9月9日周三
  1. Mistral AI42

    Mistral 利用 AI 智能体将 4 万行 Fortran 77 代码迁移至 C++

    Mistral 协助欧洲能源运营商将 4 万行 Fortran 77 代码迁移至 C++,解决了无测试套件和文档的遗留代码现代化难题。项目通过构建数值一致性验证框架,并利用 Vibe CLI 生成调用树,调度超过 100 个智能体完成代码文档化。最终采用人类监督 coder、tester 和 reviewer 智能体的工作流,实现了模块化的代码重构与质量保障。

9月7日周一
  1. Import AI58

    Import AI 472:DeepMind 智能体作弊实验、OpenAI 通信事故与 AI 政策调查

    本期 Import AI 汇总了近期 AI 领域的重要动态。DeepMind 发布论文,展示 100 个 Gemini 3.1 Pro 智能体在解题时自发出现作弊、传播漏洞及内部举报行为,揭示了多智能体系统的对齐挑战。此外,文章提及研究人员发现 OpenAI 智能体曾利用德国论坛进行自主通信,以及 CSAIP 对 56,000 名美国人的 AI 政策支持度调查。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中用 /experimental 启用,按各模型标准费率计费。

    推荐理由:GitHub 给出多模型编排的三种执行模式与三个基准上的质量成本对比,可据此判断编排式编码智能体的取舍。

9月4日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot app 入门:如何同时运行多个智能体

    GitHub Copilot app 支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在 sessions view 中查看各会话标题与任务进度,并随时切换、无需重新说明背景。文中以 tailspin-toys 仓库为例,演示了并行处理 funded sort、无障碍审查和测试三项任务。

9月3日周四
  1. Google DeepMind72

    Google DeepMind 发布 Fairwind 计划,面向政府和企业提供主动网络防御能力

    Google DeepMind 推出 Fairwind 计划,向政府及可信合作伙伴提供基于 Gemini 3.8 Flash Cyber 和 CodeMender 的主动网络防御能力。该计划旨在帮助防御方在安全云环境中自主发现、验证并修复漏洞,将修复时间从数周缩短至数分钟,目前全球已有超过 650 家合作伙伴参与。

    推荐理由:原文展示了利用 Gemini 3.8 Flash Cyber 实现漏洞自动修复的流程,为防御方提供了应对智能体威胁的具体工具路径。

  2. Google DeepMind85

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,前者定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的能力、定价和开放入口,可据此判断长程编码与安全场景的选型。

9月2日周三
8月31日周一
8月28日周五
  1. Google Research62

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Earth AI 计划下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据检索、特征工程、模型训练评估并生成报告,把原本需要数周人工数据工程的建模流程压缩到数分钟。

    推荐理由:Google 官方给出 PPE 在公共卫生、粮食安全与疫情预测上的量化对比,可看自动地理空间建模相对人工流程的差距。

8月27日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化文本。据 Artificial Analysis 测量,流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写时间较前代 Chirp 3 改善 70%;模型支持 85 种以上语言自动检测、自定义词汇和最多三位说话人区分。

    推荐理由:官方给出 WER、延迟与多语言等量化指标,并列出两套 API 与产品落地入口,便于判断语音转写能力边界。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有