跳到正文

#Hugging Face

今日 0 条
9月29日周二
9月22日周二
9月16日周三
9月2日周三
  1. Hugging Face Blog32

    Hugging Face 推出 BenchMIRT:审计 LLM 基准测试究竟在测什么

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM、16 个基准、超 34K 道题的评测结果训练,在未被告知基准对应能力的情况下自动识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 的得分与通用推理关联更强,HarmBench 的版权类问题同样如此,说明单一基准分数会混合多种信号。

8月28日周五
  1. Hugging Face Blog62

    Open ASR Leaderboard 新增首个全球南方语言评测集 Monsoon

    Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该榜单多语言标签页上的首个印度语言。

    推荐理由:Open ASR 榜单新增印地语与印度英语评测集,并公开说话人元数据,读者可了解语音评测如何从单一 WER 转向按人群拆解。

8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 9 项基准中 7 项超过其全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:对结构压缩并量化的模型,直接从压缩前的原始全精度模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始教师蒸馏的恢复配方,并附与 QAT 的稳定性对比数据。

8月21日周五
8月19日周三
  1. Hugging Face Blog62

    IBM 研究:智能体到底需要多少记忆?

    IBM 研究团队在 Hugging Face 博客发布 ALTK-Evolve 的后续研究,用 AppWorld 的 585 个多步任务测试八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型对比显示智能体记忆的注入剂量需按模型能力校准,并给出检索与缓存的成本权衡。

8月13日周四
  1. Hugging Face Blog70

    Hugging Face 用智能体复现 ICML 2026 的 2200 余篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条核验论文主张,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占该会议全部论文的 34%。

    推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的观察。

8月11日周二
8月10日周一
7月15日周三
7月1日周三

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有