Google Research 发布利用生成式 UI 创建交互式学习模拟的研究
Google Research 发布新研究,利用生成式 UI 让教师创建定制化的交互式 STEM 学习模拟。该研究基于 LearnLM 模型,通过教学护栏和自纠正循环确保内容准确性,并发布了包含 30 多个英语 STEM 交互示例的库。美国 12 名教师试点反馈积极,平均评分 8/10,学校可通过 Google for Education Pilot Program 申请参与。
Google Research 发布新研究,利用生成式 UI 让教师创建定制化的交互式 STEM 学习模拟。该研究基于 LearnLM 模型,通过教学护栏和自纠正循环确保内容准确性,并发布了包含 30 多个英语 STEM 交互示例的库。美国 12 名教师试点反馈积极,平均评分 8/10,学校可通过 Google for Education Pilot Program 申请参与。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》首发即登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 及新支持的 Firefox 浏览器上串流游玩。
Cooley 基于 ChatGPT Work 打造了 GO Public,把智能能力引入 IPO 流程,帮助律师更早发现潜在问题,并将判断力集中在最关键之处。
Steve Yegge 关停了 Gas Town,并承认每月花费数千美元订阅编码智能体,却只做出了 Gas Town 这一个项目。Databricks 向约 3500 名工程师铺开 GPT-6 Astra,其在高复杂度系统设计与长周期任务上明显优于 Opus 5 / Sol 5.6,但整体编码支出增加约 60%,为此设立了专门的 Astra 子预算。
GitHub 团队利用 Copilot 智能体将 Copilot 运行时从 TypeScript 完全重写为 80 万行 Rust 代码。该过程采用增量式原地迁移策略,通过 128 个 Pull Request 逐步替换组件,最终实现了性能的数量级提升。作者详细复盘了智能体在代码审查、上下文管理及多会话协作中的具体表现,揭示了 AI 辅助大规模代码重构的工程细节。
推荐理由:展示了利用 AI 智能体在数周内完成 80 万行 Rust 代码迁移的工程实践,提供了大规模自动化重构的方法论参考。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能能力,支持律所自定义工作流、接入法律数据源,并针对保密客户工作提供法律级管控。
AIUC(Artificial Intelligence Underwriting Company)宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投,客户包括 Cursor、Harvey、Lovable、ElevenLabs。
OpenAI 发布一套用于追踪、调查和披露模型失准(model misalignment)的框架,同时附上六份关于模型意外或令人担忧行为的报告。该框架面向模型失准的跟踪、调查与对外披露流程。
推荐理由:OpenAI 公开模型失准的追踪与披露框架,并附六份异常行为报告,可了解其安全披露机制。
OpenAI 与 AARP 合作,在美国 10 座城市为 1,000 名老年人提供免费的 ChatGPT 实操工作坊,帮助他们安全地掌握实用 AI 技能。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin 相对 GB300 的吞吐倍数与 99% 扩展效率,可据此判断推理成本走向。
Emerald AI、Google 和 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态管理用电。
OpenAI 推出 AI 广告新体验,包括 Sponsored Agents 和面向营销人员的工具,并集成 HubSpot 与 Shopify。
Mistral 宣布与 Mozilla 建立合作伙伴关系,Firefox Smart Window(beta)现由 Mistral 模型驱动。该功能旨在帮助用户理解复杂搜索、记忆点击过的内容并基于浏览器标签页溯源信息,目前面向法国和北美用户开放,英国和德国预计今年晚些时候跟进。
推荐理由:Mistral 与 Mozilla 合作将开源模型引入 Firefox,展示了隐私优先的浏览器 AI 落地路径。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,供员工直接分享。
OpenAI 经济研究显示,员工使用 AI 的方式已超出传统岗位职责,部分新活动正成为其工作中的常态化环节。该研究聚焦员工实际使用行为,而非预设的岗位分工。
曼彻斯特大学团队基于 NVIDIA Earth-2 的 CorrDiff 生成式降尺度模型,用一年英国逐小时污染数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 的单节点八卡上仅用两天完成训练。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 在近三十年企业 CRM 部署数据构建的专有合成数据集上后训练而成。
推荐理由:Salesforce 首个 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 后训练,读者可了解其训练方式与落地节奏。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将查询分解行为编译至 53.9M 参数的扩散模型,实现单次非自回归推理。该方案利用 Gemma3-4B 和 Qwen3-4B 进行监督合成,消除了推理时的思维 token 开销,解决了传统 LLM 在集合级搜索中的延迟瓶颈。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,旨在提升实时语音对话的智能与并行推理能力。
推荐理由:原文给出了两款实时语音模型在推理与工具调用上的具体基准表现,读者可据此评估其在生产级语音智能体中的适用性。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,其中 DSX MaxLPS 在 Lambda 的 HGX B200 集群上完成首次验证:19 个节点以 85% 功率运行,达到与 16 节点满功率相同的功率预算,集群 token 吞吐提升 24%(约 400 万 token/秒升至 500 万),每瓦性能提升 23%。
推荐理由:原文给出 DSX MaxLPS 在 Lambda 集群的实测数字与 DSX Flex 的电网响应案例,可据此判断同功率预算下的吞吐提升空间。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南,用于缩小 Agent 的稳定性差距。在 AppWorld test_normal 的 168 个任务上。
推荐理由:原文给出 Pass^k 与一致性差距的量化结果,并说明如何用一次采样定位易翻转的决策点。
Fyxer 基于 OpenAI 模型,结合微调、记忆与真实用户反馈,为每位用户整理收件箱并以本人语气起草邮件。该 AI 行政助理的卖点在于让用户信任其代写与收件箱管理能力。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
GitHub 日本和韩国市场营销负责人 Tomoko Tanaka 分享如何利用 GitHub Copilot 和 GitHub Actions 自动化活动运营流程。
推荐理由:展示了非技术人员如何利用 GitHub Copilot 和 Actions 将重复性营销工作流转化为代码,提供了可复用的自动化模式。
Cognition 用 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师少审代码、多交付。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。
Google Research 在 ACL 2026 提出 ToolGrad,通过“答案优先”范式与文本梯度迭代生成工具使用数据,显著降低生成成本并提升数据复杂度。基于 ToolGrad-500 微调的 Gemma-3-12B 在 BFCL 基准上得分 83.1,性能超越 GPT-5 及 Claude 4.5 Opus 等专有模型。
GitHub Copilot app 内置 diff、终端和浏览器面板,允许用户在不离开应用的情况下审查代码变更、运行命令及预览界面。用户可通过 diff 面板接受或修改变更,在终端面板执行如 `npm run dev` 等脚本,并利用浏览器面板的 Pick & Polish 工具迭代 UI。这种集成工作流消除了应用切换,帮助用户在合并前验证 AI 生成代码的功能与正确性。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 宣布 ChatGPT Work 中的 Data agent 现已向所有人开放。该智能体可连接企业数据、发现洞察,并用自然语言构建交互式仪表盘。
推荐理由:OpenAI 官方披露 ChatGPT Work 中 Data agent 的开放范围与自然语言建看板能力,可据此判断企业数据接入方式的变化。
Cloudera 与 Mistral 宣布建立合作伙伴关系,旨在将 Mistral 模型集成至 Cloudera 混合数据平台,支持企业在私有云、本地及完全隔离环境中运行推理。该合作允许企业利用专有数据训练定制模型,实现数据与智能的完全自主控制。
OpenAI 推出 ChatGPT for Financial Services,内置金融数据并搭载 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。
推荐理由:官方给出面向金融服务的 ChatGPT 版本及其内置金融数据与模型组合,可据此判断其目标场景。
OpenAI 与 GSA 将面向符合条件的联邦、州、地方和部落政府提供 0 美元许可费、用量费用五折以及扩展的网络防御支持。该安排覆盖美国多级政府机构,具体资格条件与实施细节尚未在摘要中说明。
推荐理由:OpenAI 与 GSA 面向各级政府给出零许可费和半价用量,可观察 AI 采购与公共部门落地的价格路径。
Hugging Face 发布 Workflow1111,用 73 个节点、11 条媒体管线在单张 Gradio Workflow 画布上重建了 AUTOMATIC1111 的大部分功能,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 和图像转视频。
推荐理由:用 73 个节点复刻 A1111 全部功能,并展示输出节点如何自动变成 REST 端点和 MCP 工具。
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色和电话(telephony)接入。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此判断语音应用的接入方式。
Hugging Face 博客介绍如何在 Hugging Face Jobs 上跨机运行 AsyncGRPOTrainer:训练 Job 只把 LoRA adapter 写入 Storage Bucket,两个 vLLM Job 从同一挂载路径读取,代理负责加鉴权头、按 KV 前缀路由 rollout 并把 adapter 加载广播到所有副本,全程不需要 NCCL。
推荐理由:原文给出跨机异步 GRPO 的完整工程配方与五轮瓶颈定位数据,可迁移到自建 RL 训练流水线。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:OpenAI 官方发布 Agents API,读者可了解其托管服务定位与 Codex harness 编排能力。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他在 AI 对齐、安全与标准方面拥有相关经验。
OpenAI 的 Chris Lehane 发文称,AI 政策窗口已经打开,需要立即行动。他认为更强的 AI 能力需要更强的安全证据、共享标准和持久的政策行动。