跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

30条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1–20 条 · 共 30 条
10月1日周四
  1. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,之后才向开发者、企业和消费者开放。

    推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的实际差距。

  2. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在长程编码、企业知识工作与网络安全防御上的基准与内部落地数据,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月30日周三
  1. NVIDIA Blog76

    NVIDIA 与 CoreWeave 推出 Vera Rubin NVL72 及 Forge 平台,加速 Agentic AI 生产落地

    CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统,Cognition 成为首个在生产环境中运行该系统的客户,其 Devin 推理工作负载的 token 吞吐量较 GB200 NVL72 提升 4.8 倍。

    推荐理由:原文展示了 Vera Rubin 在真实编码负载下的吞吐量提升,以及 CoreWeave Forge 如何打通从生产反馈到模型训练的闭环。

  2. AWS Machine Learning Blog83

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为编码、计算机使用和专业工作负载提供更强推理能力。OpenAI 表示该模型在 DeepSWE v1.1 上性能匹配 GPT-6 Astra,但单任务成本约为其五分之一,且比 GPT-6 Sol 最佳成绩高 6.4 个百分点。

    推荐理由:GPT-6.1 Sol 在 Amazon Bedrock 正式可用,以约五分之一成本实现接近 GPT-6 Astra 的推理能力,降低智能体工作流成本。

9月29日周二
  1. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度。

    推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此估算长任务智能体的成本与延迟取舍。

  2. Simon Willison86

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上,大多数工作成本降低最多 30%。该模型定价与 Sonnet 5 相同,但在各项基准测试中表现优于 Sonnet 5,且成为 claude.ai 免费层使用的模型。

    推荐理由:原文对比了 Sonnet 5.5 与 Opus 5.5 在编码任务上的表现,并指出其成为 claude.ai 免费层模型带来的竞争变化。

9月28日周一
  1. Simon Willison80

    Simon Willison 复盘 2026 年 LLM 发展:编码智能体成熟与训练安全失控

    Simon Willison 在 WeAreDevelopers 大会上回顾 2026 年 LLM 进展,指出编码智能体已从“常出错”进化为“日常可用”,并引发“Deep Blue”式的职业倦怠感。

    推荐理由:作者以个人视角复盘 2026 年 LLM 发展,重点分析了编码智能体带来的工程范式变化及训练过程中的安全失控事件。

9月23日周三
9月17日周四
  1. GitHub Blog · AI & ML88

    GitHub Copilot 运行时迁移至 Rust 的实践复盘

    GitHub 团队利用 Copilot 智能体将 Copilot 运行时从 TypeScript 完全重写为 80 万行 Rust 代码。该过程采用增量式原地迁移策略,通过 128 个 Pull Request 逐步替换组件,最终实现了性能的数量级提升。作者详细复盘了智能体在代码审查、上下文管理及多会话协作中的具体表现,揭示了 AI 辅助大规模代码重构的工程细节。

    推荐理由:展示了利用 AI 智能体在数周内完成 80 万行 Rust 代码迁移的工程实践,提供了大规模自动化重构的方法论参考。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型间选择执行方案,用户可在 GitHub Copilot CLI 中用 /experimental 启用,按各模型标准费率计费。

    推荐理由:GitHub 给出多模型编排的三种执行模式与三个基准上的质量成本对比,可据此判断编排式编码智能体的取舍。

9月3日周四
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和面向安全防御的 Gemini 3.8 Flash Cyber,前者定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的能力、定价和开放入口,可据此判断长程编码与安全场景的选型。

8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 9 项基准中 7 项超过其全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:对结构压缩并量化的模型,直接从压缩前的原始全精度模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始教师蒸馏的恢复配方,并附与 QAT 的稳定性对比数据。

8月14日周五
7月21日周二
5月28日周四
  1. Mistral AI78

    Mistral 将 Le Chat 升级为统一智能体 Vibe,推出 Work Mode 与 Code Mode

    Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。Work Mode 可在网页和移动端执行收件箱整理、深度研究、文档起草等长周期任务,支持企业知识搜索、结构化数据分析和可复用技能;Code Mode 提供远程编码会话,并新增 VS Code 扩展和 CLI 更新。

    推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此了解其工作与编码两种模式的能力边界和定价分层。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,将指令遵循、推理与编码合并到同一套权重中,以修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,τ³-Telecom 得分 91.4。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管与异步编码的可行边界。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini 应用、Google 搜索 AI Mode、Google Antigravity、Gemini API、Google AI Studio、Android Studio 及 Gemini Enterprise 上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和开放渠道,可据此判断速度与质量的取舍。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有