Import AI· Jack Clark·· 2026-06-08
Import AI 460:社会可被奖励黑客攻击、Anthropic 的 RSI 数据、基于 RL 的四旋翼竞速
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
SI 导读
研究团队构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校成绩等场景中"钻制度空子"的能力,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的漏洞策略。
SI 评分40
来源:Import AI · importai.substack.com