跳到正文
原文
Simon Willison·· 22 小时前

Qwen3.8 27B 纯文字加法能力基准测试

Qwen3.8 27B addition in words

SI 导读

本地部署的 Qwen3.8-27B 模型在禁用推理模式下,纯文字加法数值准确率仅为 23.57%,且随操作数位数增加性能从 97.04% 骤降至 6.44%。启用推理模式后,该模型在 169 个测试用例中正确回答 167 次。该实验旨在复现并对比 GPT-4o 此前在同类任务中的表现。

SI 评分34

来源:Simon Willison · simonwillison.net

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有