Amazon Bedrock AgentCore 利用 Agentic AI 加速云迁移
基于 Amazon Bedrock AgentCore 的四智能体模式将大型云迁移项目中每个应用的 IaC 开发时间从 3 到 4 周缩短至几分钟。该方案通过 MCP 工具连接内部系统,与 AWS Transform 和 AWS DMS 配合,覆盖 300 多个应用的迁移及运维需求。此前此类定制化 IaC 组合需耗费数年工程人力,此模式实现了自动化治理与监控。
基于 Amazon Bedrock AgentCore 的四智能体模式将大型云迁移项目中每个应用的 IaC 开发时间从 3 到 4 周缩短至几分钟。该方案通过 MCP 工具连接内部系统,与 AWS Transform 和 AWS DMS 配合,覆盖 300 多个应用的迁移及运维需求。此前此类定制化 IaC 组合需耗费数年工程人力,此模式实现了自动化治理与监控。
Amazon Quick 推出 Live Data in Apps 功能,允许 AI 构建的应用实时查询受治理的 Quick Sight 数据集。该功能支持 SPICE 和 Direct Query 模式,自动应用行级与列级安全规则,确保用户仅查看授权数据。此前应用仅展示构建时的静态快照,无法反映实时业务指标。
文章展示了如何在 Amazon EKS 上部署 NVIDIA NeMo Agent Toolkit (NAT) 1.6,并将 Amazon S3 Vectors 实现为自定义持久记忆层。该方案利用 S3 Vectors 支持单索引 20 亿向量及强写入一致性,满足生产级多智能体系统对弹性存储和成本效率的需求。这是继此前探讨 S3 Vectors 架构优势后,进一步落地具体实现的技术指南。
该指南演示了如何在 AWS 上为 Claude Platform on AWS 配置生产、本地开发及外部环境的多环境访问。方案采用专用 AI Services 账户架构,通过跨账户 SigV4、工作区 API 密钥及 OIDC 联合认证实现隔离。这是继架构模式与认证路径决策后的完整分步实施教程。
Amazon Payments 在 Amazon SageMaker AI 上部署多目标上下文多臂老虎机(MAB),用于优化产品获客漏斗中的个性化内容选择。七周在线 A/B 测试显示,针对特定客户群体,最终漏斗转化率实现了高个位数的相对提升,但另一群体未见改善,表明问题在于内容而非模型。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并优化提示词,以适配其特定的零售内容审核策略。在 737 个对话窗口的测试集中,微调后的模型显著提升了行为与主体分类的 Macro F1 分数。该方案利用 AWS 托管服务构建了包含人工验证、评估及部署控制的自动化工作流,实现了生产环境的持续优化。
Allen AI 发布 Olmo-core 3,一套面向大规模 MoE 的开放训练框架,设计目标是把 MoE 训练扩展到万亿参数级。
Condé Nast 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现系统,将内容检索时间从 250 分钟缩短至 2 分钟以内。该系统采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频信号进行联合编码,支持基于意图的语义搜索。此前编辑团队依赖标题和描述手动查找素材,导致运营效率低下。
微软研究院实习生构建了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Amazon Bedrock AgentCore Runtime Instances 支持在单个 EC2 实例上部署多智能体,实现长达 14 天的持久化会话与 GPU 访问。该方案通过共享文件系统协作,利用 NVIDIA L4 GPU 运行 ACE-Step 模型,约 9 秒即可渲染 20 秒 48 kHz 立体声音频。
Amazon Bedrock 在印度区域上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 模型,支持数据在印度境内处理。
Amazon Bedrock 现支持在首尔和新加坡区域对 Anthropic Claude Opus 5 和 Claude Sonnet 5 进行本地推理。请求在指定 AWS 区域内处理且数据不离开该区域,满足金融、医疗等行业的严格数据驻留要求。
AWS 展示了一套基于 Amazon Quick 和 Amazon Bedrock AgentCore 的合同智能平台架构,通过 AI 代理提取并验证合同数据以解决 RAG 在大规模聚合查询中的局限。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的适用边界与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配 Gradio 应用试用。
在 Amazon SageMaker AI 上部署同一个 AWS vLLM-Omni DLC 镜像的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,生成的 MP4 存回 S3,示例提供命令行与 Streamlit 界面。
Mistral 宣布在慕尼黑开设新枢纽,设立专注于物理 AI 和工业 AI 的研究团队,直接服务企业合作伙伴。该枢纽将推进与宝马在碰撞模拟、与西门子能源在工业 AI 应用的合作,并与慕尼黑工业大学建立研究伙伴关系,利用风洞设施开发汽车空气动力学数字孪生。
AWS 介绍了一种基于 Amazon Nova Act 和 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
针对 Amazon Textract 适配器从训练到生产跨 AWS 账户迁移需提工单、且仅迁移模型权重而查询定义与训练数据不随迁的瓶颈,该方案用 AWS CloudFormation 和 Terraform 模板实现适配器生命周期自动化。
AWS 结合 Amazon EKS、EFA 与 DeepEP,为大规模 MoE 模型的 RLHF/GRPO 强化学习后训练提供架构方案,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 循环,通过 DeepEP 优化 Expert Parallelism 的 all-to-all 通信,缓解跨节点带宽瓶颈。
AWS 展示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型走迷宫,基于 GRPO 从 VisGym SFT 检查点出发,在固定 64 个迷宫的评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率,并支持实时流式响应。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。该系统已服务超过 4,000 名 AWS 高管领导者,用于实时业务评审中的对话式数据分析。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 现已上线 Amazon SageMaker JumpStart,可部署到全托管实时推理端点,仅需几秒参考音频和对应文本即可克隆音色,无需重新训练。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout 方案,为工业气体与焊接分销商提供交互式仪表盘和自然语言搜索,业务用户无需提 IT 工单即可查询租赁数据。
Liquid AI 发布 LFM2.5-VL-DSpark 实验性草稿模型,为 LFM2.5-VL-3B 视觉语言模型引入推测解码路径。该模型增加 280M 参数,在 H100 上实现最高 2.66x 解码加速,并支持 llama.cpp、MLX-VLM 和 SGLang。
GitHub Copilot 应用重构了 Pull Request 视图,以支持包含 2,200 个文件和超百万行变更的超大 diff 渲染。通过采用双几何架构,将代码行高度与动态评论块高度分离,解决了评论高度未知导致的滚动卡顿问题。该方案确保了在极端负载下,即使存在 400 多条内联评论,审查体验依然保持快速流畅。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的卸载工具链,读者可据此判断物理 AI 的部署取舍。
GPT-6 改进了提示词缓存,带来更高的缓存命中率、新的诊断工具、显式断点以及可降低延迟与成本的控制项。
NVIDIA 发布 Halos 全栈安全系统,用于物理 AI 在设计、验证与部署各环节的安全工程。面向自动驾驶,Halos 覆盖 DRIVE AGX Thor。
NVIDIA 在开罗大埃及博物馆举办活动,展示埃及 AI 生态从能力建设走向规模化落地,其 Deep Learning Institute 埃及学员规模一年增长超十倍。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。NVIDIA 还联合 Open Secure AI Alliance 推动研究成果与工具共享。
NVIDIA 在纽约气候周上介绍了五家以 AI 为基础推进清洁能源的公司。ThinkLabs AI 用 NVIDIA CUDA 平台打造数字孪生与智能体,帮助南加州爱迪生将电网并网申请评估时间从 30-45 天缩短至两分钟。
Hugging Face 发布 tokenizers v1,在保持与 v0.23 相同 token ID、API、词表和 merge ranks 的前提下重写性能,速度常达 v0.23 的数十倍。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》首发即登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 及新支持的 Firefox 浏览器上串流游玩。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin 相对 GB300 的吞吐倍数与 99% 扩展效率,可据此判断推理成本走向。
Emerald AI、Google 和 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态管理用电。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
曼彻斯特大学团队基于 NVIDIA Earth-2 的 CorrDiff 生成式降尺度模型,用一年英国逐小时污染数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 的单节点八卡上仅用两天完成训练。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,其中 DSX MaxLPS 在 Lambda 的 HGX B200 集群上完成首次验证:19 个节点以 85% 功率运行,达到与 16 节点满功率相同的功率预算,集群 token 吞吐提升 24%(约 400 万 token/秒升至 500 万),每瓦性能提升 23%。
推荐理由:原文给出 DSX MaxLPS 在 Lambda 集群的实测数字与 DSX Flex 的电网响应案例,可据此判断同功率预算下的吞吐提升空间。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。