uniopen 如何定制 Amazon Nova 以符合零售审核策略
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并优化提示词,以适配其特定的零售内容审核策略。在 737 个对话窗口的测试集中,微调后的模型显著提升了行为与主体分类的 Macro F1 分数。该方案利用 AWS 托管服务构建了包含人工验证、评估及部署控制的自动化工作流,实现了生产环境的持续优化。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并优化提示词,以适配其特定的零售内容审核策略。在 737 个对话窗口的测试集中,微调后的模型显著提升了行为与主体分类的 Macro F1 分数。该方案利用 AWS 托管服务构建了包含人工验证、评估及部署控制的自动化工作流,实现了生产环境的持续优化。
Allen AI 发布 Olmo-core 3,一套面向大规模 MoE 的开放训练框架,设计目标是把 MoE 训练扩展到万亿参数级。
OpenAI 称其阻断了一场针对模型推理内容的蒸馏窃取活动,该活动 7 月 1 日起低量出现,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及 15000 多个关联账号,7 月 28 日前已全部关停,OpenAI 将核心参与者与 Moonshot AI 相关人员关联。
推荐理由:事件披露了推理蒸馏攻击的完整时间线与云平台防护差异,可据此理解模型推理泄露的攻防现状。
微软研究院实习生构建了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
针对 Amazon Textract 适配器从训练到生产跨 AWS 账户迁移需提工单、且仅迁移模型权重而查询定义与训练数据不随迁的瓶颈,该方案用 AWS CloudFormation 和 Terraform 模板实现适配器生命周期自动化。
AWS 结合 Amazon EKS、EFA 与 DeepEP,为大规模 MoE 模型的 RLHF/GRPO 强化学习后训练提供架构方案,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 循环,通过 DeepEP 优化 Expert Parallelism 的 all-to-all 通信,缓解跨节点带宽瓶颈。
AWS 展示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型走迷宫,基于 GRPO 从 VisGym SFT 检查点出发,在固定 64 个迷宫的评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 指出,生物安全正成为 AI 军备竞赛的新前线,而提升生物能力的模型同样能用于防御。
Latent Space 访谈 Google 的 John Platt,介绍其团队提出的 Empirical Research Assistance(ERA)。
小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,位列开源权重模型首位,定价 $0.435/M 输入、$0.87/M 输出 token,采用 MIT 许可。
推荐理由:小米首次进入前沿开源模型序列,其RL环境与训练配方开源,可观察后训练成本压缩到何种程度。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型由 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 组成,通过学习式集成与重排序融合两者互补优势。
MIT Technology Review 与 Times of San Diego 用 15 个月调查,绘制出首张美墨边境监控塔附近死亡事件综合地图与分析。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高 2.5 倍。
推荐理由:MLPerf v6.1 首次提交数据给出 Vera Rubin 相对 GB300 的吞吐倍数与 99% 扩展效率,可据此判断推理成本走向。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,供员工直接分享。
曼彻斯特大学团队基于 NVIDIA Earth-2 的 CorrDiff 生成式降尺度模型,用一年英国逐小时污染数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 的单节点八卡上仅用两天完成训练。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 在近三十年企业 CRM 部署数据构建的专有合成数据集上后训练而成。
推荐理由:Salesforce 首个 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 后训练,读者可了解其训练方式与落地节奏。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,其中 DSX MaxLPS 在 Lambda 的 HGX B200 集群上完成首次验证:19 个节点以 85% 功率运行,达到与 16 节点满功率相同的功率预算,集群 token 吞吐提升 24%(约 400 万 token/秒升至 500 万),每瓦性能提升 23%。
推荐理由:原文给出 DSX MaxLPS 在 Lambda 集群的实测数字与 DSX Flex 的电网响应案例,可据此判断同功率预算下的吞吐提升空间。
Google Research 利用 UK Biobank 和 Biobank Japan 数据,评估了跨人群多基因风险评分(PRS)的迁移学习性能。研究发现,当目标人群样本量超过 15k 时,仅使用目标人群数据训练的模型优于混合欧洲数据的模型。对于遗传相关性高的性状,混合数据在样本量达 25-40k 前仍具优势,而血脂等特异性性状则更早失去混合数据的增益。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做轻量微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准分数从 22.6% 提升到 29.7%。训练可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上跑 OpenAI 兼容服务。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM、16 个基准、超 34K 道题的评测结果训练,在未被告知基准对应能力的情况下自动识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 的得分与通用推理关联更强,HarmBench 的版权类问题同样如此,说明单一基准分数会混合多种信号。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google 发布 TimesFM-3,这是其新一代时间序列基础模型,原生预训练支持多变量预测,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,采用交替注意力架构与 Contiguous Patch Masking,单次前向传播即可生成整个预测区间,并为每个目标输出 10 到 90 分位的 9 个分位数。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
Google 在 Earth AI 计划下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据检索、特征工程、模型训练评估并生成报告,把原本需要数周人工数据工程的建模流程压缩到数分钟。
推荐理由:Google 官方给出 PPE 在公共卫生、粮食安全与疫情预测上的量化对比,可看自动地理空间建模相对人工流程的差距。
Google Research 发布 GlucoFM,一个面向连续血糖监测(CGM)的自监督基础模型,采用双流设计分离缓慢血糖趋势与短期波动,并保留时间与缺失信息。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索,并提供完整训练方案。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:对结构压缩并量化的模型,直接从压缩前的原始全精度模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始教师蒸馏的恢复配方,并附与 QAT 的稳定性对比数据。
METR 研究显示 AI 在网络安全领域加速显著,数学研究加速轻微,AI 研究优化无可测加速。多所高校团队发布 SPADE 框架,通过自博弈生成合成可执行环境,在 30B 规模下使 Qwen3 模型在 AIME 等基准上性能提升 8.1 分。
Google 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,并构建出睡眠时长变异性、心血管适能指数(步数除以静息心率)等新复合特征。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP。微软同时推出持续更新的基准,追踪后续 Skala 版本的计算性能。
IBM 研究团队在 Hugging Face 博客发布 ALTK-Evolve 的后续研究,用 AppWorld 的 585 个多步任务测试八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型对比显示智能体记忆的注入剂量需按模型能力校准,并给出检索与缓存的成本权衡。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,源码与模型权重随研究论文公开。用户可在 UI 或 API 中选择区域、时间范围、编码器变体(Nano 128 维 1.4M 参数、Tiny 192 维 6.2M 参数、Base 768 维 89M 参数)、分辨率与影像源,导出 int8 存储的 COG。
Google Research 提出知识画像(knowledge profiling)框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光 VLM,可同时完成报告生成、疾病存在与否定判断、病灶定位及多标签分类等任务,并支持生成式与双推理模式。
IBM 研究团队发布 ALTK-Evolve,与 ACE 一样让智能体从自身轨迹中学习可复用经验,但把记忆投递从固定改为按任务和模型能力校准。
Hugging Face 最新论文提出两项系统改动,让大语言模型知识蒸馏的训练成本大幅下降:一是离线缓存教师模型的 top-100 logits,训练时无需再加载教师模型;二是融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。
Google DeepMind 发布 WeatherNext AI 模型,在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取约一天的预警时间,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报多出约一天预警时间,并开源模型权重与代码,读者可据此判断气象预报工作流的可用变化。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与配套的 CoE Audit 审计指标。
推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此判断自主科研智能体的可信度评估方式。