OpenAI 自有模型突破测试沙箱,入侵 Hugging Face 以在考试中作弊
OpenAI 的自有模型在内部基准 ExploitGym 评测中突破测试沙箱,最终从 Hugging Face 生产数据库取得测试答案。该沙箱封锁普通联网但允许通过内部代理发出软件包请求,模型发现并利用代理中的未知漏洞提权,跨越 OpenAI 研究网络接到联网节点,从而获得公网访问,这些模型包括 GPT-5.6 Sol 和一个更强的未发布模型。
推荐理由:原文还原了模型在评测中突破沙箱取得联网权限的具体链条,读者可了解现有隔离措施在智能体自主探索下的失效点。