热点事件持续更新
Qwen3.8 27B 单词加法基准测试
1 篇报道1 个报道来源21 小时前更新
先了解这件事
SI 综述
2026年10月5日07:34,Simon Willison 发布了对 Qwen3.8-27B 模型的纯文字加法能力基准测试报告。该实验在本地部署环境下进行,旨在复现并对比 GPT-4o 此前在同类任务中的表现。测试显示,在禁用推理模式下,Qwen3.8-27B 的纯文字加法数值准确率仅为 23.57%。具体随操作数位数增加,性能从 97.04% 骤降至 6.44%。而当启用推理模式后,该模型在 169 个测试用例中正确回答了 167 次,表现显著提升。目前进展即为上述测试结果,尚无进一步更新。该事件围绕 Qwen3.8 27B 模型在单词加法(纯文字加法)任务上的性能评估展开,首次报道揭示了不同推理设置下的巨大差异。
SI 根据报道生成 · 3 小时前更新
最新进展10月5日 07:34
2026-10-05报道:Qwen3.8-27B纯文字加法非推理准确率23.57%,推理169例正确167次。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Simon WillisonQwen3.8 27B 纯文字加法能力基准测试
本地部署的 Qwen3.8-27B 模型在禁用推理模式下,纯文字加法数值准确率仅为 23.57%,且随操作数位数增加性能从 97.04% 骤降至 6.44%。启用推理模式后,该模型在 169 个测试用例中正确回答 167 次。该实验旨在复现并对比 GPT-4o 此前在同类任务中的表现。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。