OpenAI 如何对抗模型蒸馏攻击
文章指出 OpenAI 正在打击旨在提取模型推理能力的保护性模型蒸馏计划,并加强防御措施。
文章指出 OpenAI 正在打击旨在提取模型推理能力的保护性模型蒸馏计划,并加强防御措施。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率,并支持实时流式响应。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。该系统已服务超过 4,000 名 AWS 高管领导者,用于实时业务评审中的对话式数据分析。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
UK AISI 利用 EvalEval 基础设施公开分享评估结果,以支持更可复现和可验证的评估科学。此次发布包含 HealthBench、FrontierMath 等五个基准在 Claude Opus 4.6 和 GPT-5.4 等六个前沿模型上的验证结果及配置信息。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM、16 个基准、超 34K 道题的评测结果训练,在未被告知基准对应能力的情况下自动识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 的得分与通用推理关联更强,HarmBench 的版权类问题同样如此,说明单一基准分数会混合多种信号。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该榜单多语言标签页上的首个印度语言。
推荐理由:Open ASR 榜单新增印地语与印度英语评测集,并公开说话人元数据,读者可了解语音评测如何从单一 WER 转向按人群拆解。
Hugging Face 发布研究,用共识分歧探针、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。
推荐理由:通过三项探针量化 ASR 模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结等拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型难以在场景变化中持续保持对拓扑结构的理解。图像与视频生成工具在维持拓扑关系上同样不可靠。
Google Research 提出知识画像(knowledge profiling)框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。
DharmaOCR 在葡萄牙语专属基准上取得 0.925 分,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语数据的监督微调与 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上保持优势。
Hume 发布 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个专有与开源语音模型、15 个以上评估维度和 60 多项指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:Hume 用百万级人工评分构建语音评测基准,揭示现有基准高估真实表现的盲区。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间跨框架迁移企业级 Java 应用的能力。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,支持评测结果交叉发布与解读,并链接到开放模型、榜单和统一元数据存储。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:通过飓风 Melissa 的实战案例,读者可以了解 AI 天气模型在路径与强度双预测上的具体表现。
Google 发布研究实验 Vantage,通过生成式 AI 在模拟环境中创建对话,评估批判性思维、协作、创造性思维等未来技能,现已在 Google Labs 开放英文注册。
Google Research 提出一套框架,通过改编自 IRI、ERQ 等心理问卷的情境判断测试(SJT),评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Mistral 提出用 LLM as a Judge 评估 RAG 系统,让"裁判 LLM"按数值、二元或定性量表为"生成 LLM"的答案打分,并汇总为加权总分。