Simon Willison·· 22 小时前
Qwen3.8 27B 纯文字加法能力基准测试
Qwen3.8 27B addition in words
SI 导读
本地部署的 Qwen3.8-27B 模型在禁用推理模式下,纯文字加法数值准确率仅为 23.57%,且随操作数位数增加性能从 97.04% 骤降至 6.44%。启用推理模式后,该模型在 169 个测试用例中正确回答 167 次。该实验旨在复现并对比 GPT-4o 此前在同类任务中的表现。
SI 评分34
来源:Simon Willison · simonwillison.net