跳到正文

#编码

今日 0 条
10月1日周四
  1. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,之后才向开发者、企业和消费者开放。

    推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的实际差距。

  2. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在长程编码、企业知识工作与网络安全防御上的基准与内部落地数据,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月30日周三
  1. NVIDIA Blog76

    NVIDIA 与 CoreWeave 推出 Vera Rubin NVL72 及 Forge 平台,加速 Agentic AI 生产落地

    CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统,Cognition 成为首个在生产环境中运行该系统的客户,其 Devin 推理工作负载的 token 吞吐量较 GB200 NVL72 提升 4.8 倍。

    推荐理由:原文展示了 Vera Rubin 在真实编码负载下的吞吐量提升,以及 CoreWeave Forge 如何打通从生产反馈到模型训练的闭环。

  2. AWS Machine Learning Blog83

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 表示该模型在 DeepSWE v1.1 上性能匹配 GPT-6 Astra,但单任务成本约为其五分之一,且比 GPT-6 Sol 最佳成绩高 6.4 个百分点。

    推荐理由:GPT-6.1 Sol 在 Amazon Bedrock 正式可用,以约五分之一成本实现接近 GPT-6 Astra 的推理能力,降低智能体工作流成本。

9月29日周二
  1. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度。

    推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此估算长任务智能体的成本与延迟取舍。

  2. Simon Willison86

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上,大多数工作成本降低最多 30%。该模型定价与 Sonnet 5 相同,但在各项基准测试中表现优于 Sonnet 5,且成为 claude.ai 免费层使用的模型。

    推荐理由:原文对比了 Sonnet 5.5 与 Opus 5.5 在编码任务上的表现,并指出其成为 claude.ai 免费层模型带来的竞争变化。

9月28日周一
  1. Simon Willison80

    Simon Willison 复盘 2026 年 LLM 发展:编码智能体成熟与训练安全失控

    Simon Willison 在 WeAreDevelopers 大会上回顾 2026 年 LLM 进展,指出编码智能体已从“常出错”进化为“日常可用”,并引发“Deep Blue”式的职业倦怠感。

    推荐理由:作者以个人视角复盘 2026 年 LLM 发展,重点分析了编码智能体带来的工程范式变化及训练过程中的安全失控事件。

9月27日周日
9月26日周六
9月25日周五
9月23日周三
9月21日周一
  1. Simon Willison40

    工程师爆料:大公司全员用 Claude Code 生成代码,无人阅读

    一位新入职大公司的工程师称,团队所有规格、代码、测试、PRD、工单及其解决方案、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事——和 Claude 对话。团队无人喜欢这种状态,却被要求尽可能多地产出,管理层多次表示推代码不是瓶颈,人们每天工作 12 到 13 小时只为按回车,没有人阅读任何内容。

9月18日周五
9月17日周四
  1. GitHub Blog · AI & ML88

    GitHub Copilot 运行时迁移至 Rust 的实践复盘

    GitHub 团队利用 Copilot 智能体将 Copilot 运行时从 TypeScript 完全重写为 80 万行 Rust 代码。该过程采用增量式原地迁移策略,通过 128 个 Pull Request 逐步替换组件,最终实现了性能的数量级提升。作者详细复盘了智能体在代码审查、上下文管理及多会话协作中的具体表现,揭示了 AI 辅助大规模代码重构的工程细节。

    推荐理由:展示了利用 AI 智能体在数周内完成 80 万行 Rust 代码迁移的工程实践,提供了大规模自动化重构的方法论参考。

9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML40

    GitHub Copilot app 新手指南:使用 diff、终端和浏览器面板

    GitHub Copilot app 内置 diff、终端和浏览器面板,允许用户在不离开应用的情况下审查代码变更、运行命令及预览界面。用户可通过 diff 面板接受或修改变更,在终端面板执行如 `npm run dev` 等脚本,并利用浏览器面板的 Pick & Polish 工具迭代 UI。这种集成工作流消除了应用切换,帮助用户在合并前验证 AI 生成代码的功能与正确性。

9月9日周三
  1. Mistral AI42

    Mistral 利用 AI 智能体将 4 万行 Fortran 77 代码迁移至 C++

    Mistral 协助欧洲能源运营商将 4 万行 Fortran 77 代码迁移至 C++,解决了无测试套件和文档的遗留代码现代化难题。项目通过构建数值一致性验证框架,并利用 Vibe CLI 生成调用树,调度超过 100 个智能体完成代码文档化。最终采用人类监督 coder、tester 和 reviewer 智能体的工作流,实现了模块化的代码重构与质量保障。

9月8日周二
9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中用 /experimental 启用,按各模型标准费率计费。

    推荐理由:GitHub 给出多模型编排的三种执行模式与三个基准上的质量成本对比,可据此判断编排式编码智能体的取舍。

9月4日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot app 入门:如何同时运行多个智能体

    GitHub Copilot app 支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在 sessions view 中查看各会话标题与任务进度,并随时切换、无需重新说明背景。文中以 tailspin-toys 仓库为例,演示了并行处理 funded sort、无障碍审查和测试三项任务。

9月3日周四
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,前者定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的能力、定价和开放入口,可据此判断长程编码与安全场景的选型。

8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 9 项基准中 7 项超过其全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:对结构压缩并量化的模型,直接从压缩前的原始全精度模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始教师蒸馏的恢复配方,并附与 QAT 的稳定性对比数据。

8月14日周五
7月27日周一
7月26日周日
7月21日周二
7月1日周三
5月28日周四
  1. Mistral AI78

    Mistral 将 Le Chat 升级为统一智能体 Vibe,推出 Work Mode 与 Code Mode

    Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。Work Mode 可在网页和移动端执行收件箱整理、深度研究、文档起草等长周期任务,支持企业知识搜索、结构化数据分析和可复用技能;Code Mode 提供远程编码会话,并新增 VS Code 扩展和 CLI 更新。

    推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作与编码两种模式的能力边界和定价分层。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,将指令遵循、推理与编码合并到同一套权重中,以修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,τ³-Telecom 得分 91.4。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管与异步编码的可行边界。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有