跳到正文

#评测/基准

今日 0 条
9月30日周三
9月26日周六
  1. AWS Machine Learning Blog34

    NarrateAI:在 Amazon Bedrock 上实现生产级 LLM 质量保障

    NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率,并支持实时流式响应。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。该系统已服务超过 4,000 名 AWS 高管领导者,用于实时业务评审中的对话式数据分析。

9月23日周三
9月22日周二
9月2日周三
  1. Hugging Face Blog32

    Hugging Face 推出 BenchMIRT:审计 LLM 基准测试究竟在测什么

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM、16 个基准、超 34K 道题的评测结果训练,在未被告知基准对应能力的情况下自动识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 的得分与通用推理关联更强,HarmBench 的版权类问题同样如此,说明单一基准分数会混合多种信号。

8月28日周五
  1. Hugging Face Blog62

    Open ASR Leaderboard 新增首个全球南方语言评测集 Monsoon

    Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该榜单多语言标签页上的首个印度语言。

    推荐理由:Open ASR 榜单新增印地语与印度英语评测集,并公开说话人元数据,读者可了解语音评测如何从单一 WER 转向按人群拆解。

8月21日周五
8月13日周四
  1. Microsoft Research41

    MindTopo:微软研究院推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结等拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型难以在场景变化中持续保持对拓扑结构的理解。图像与视频生成工具在维持拓扑关系上同样不可靠。

8月12日周三
7月16日周四
7月15日周三
7月1日周三
6月30日周二
5月16日周六
4月14日周二
4月3日周五
4月1日周三
3月17日周二
4月9日周三

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有