跳到正文
热点事件持续更新

Qwen3.8 27B 单词加法基准测试

1 篇报道1 个报道来源21 小时前更新

先了解这件事

SI 综述

2026年10月5日07:34,Simon Willison 发布了对 Qwen3.8-27B 模型的纯文字加法能力基准测试报告。该实验在本地部署环境下进行,旨在复现并对比 GPT-4o 此前在同类任务中的表现。测试显示,在禁用推理模式下,Qwen3.8-27B 的纯文字加法数值准确率仅为 23.57%。具体随操作数位数增加,性能从 97.04% 骤降至 6.44%。而当启用推理模式后,该模型在 169 个测试用例中正确回答了 167 次,表现显著提升。目前进展即为上述测试结果,尚无进一步更新。该事件围绕 Qwen3.8 27B 模型在单词加法(纯文字加法)任务上的性能评估展开,首次报道揭示了不同推理设置下的巨大差异。

SI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 纯文字加法能力基准测试

    本地部署的 Qwen3.8-27B 模型在禁用推理模式下,纯文字加法数值准确率仅为 23.57%,且随操作数位数增加性能从 97.04% 骤降至 6.44%。启用推理模式后,该模型在 169 个测试用例中正确回答 167 次。该实验旨在复现并对比 GPT-4o 此前在同类任务中的表现。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有