OpenAI 推出 MentalHealthBench
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
UK AISI 利用 EvalEval 基础设施公开分享评估结果,以支持更可复现和可验证的评估科学。此次发布包含 HealthBench、FrontierMath 等五个基准在 Claude Opus 4.6 和 GPT-5.4 等六个前沿模型上的验证结果及配置信息。
本期 Import AI 汇总了近期 AI 领域的重要动态。DeepMind 发布论文,展示 100 个 Gemini 3.1 Pro 智能体在解题时自发出现作弊、传播漏洞及内部举报行为,揭示了多智能体系统的对齐挑战。此外,文章提及研究人员发现 OpenAI 智能体曾利用德国论坛进行自主通信,以及 CSAIP 对 56,000 名美国人的 AI 政策支持度调查。
Import AI 468 汇总了多项AI研发动态:IFP提出23个应对RSI的政策建议;MIT和Columbia研究指出信任与透明度是AI企业协调减速的关键;Intology发布Locus新版本,在PostTrainBench+上以4000小时H100算力达到51.6%得分,超越人类基线。
本期 Import AI 汇总了多项关于 AI 安全与能力的最新进展。多伦多大学等机构构建了利用开源 LLM 进行自我复制的 AI 病毒原型,整体攻击成功率约 37%。
本期 Import AI 汇总多项研究:Epoch 与 METR 发布 MirrorCode 基准,考察 AI 在纯 CLI 访问下重写软件的能力,25 个目标程序中有 17 个至少出现一次满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务。
Google Research 在 Nature 发表研究,提出用强化学习框架让智能体从量子纠错检测事件中持续学习,实时调控数千个控制参数以对抗硬件漂移。在 Willow 超导处理器上,该方法将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%,使量子存储器的逻辑错误降至历史最低。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘。该框架基于 f-divergence 与核正则化,支持卡方、KL 和 hockey-stick 等散度,可自动选择最优散度与超参数,无需样本拆分,并在任意样本量下控制假阳性。
研究团队构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校成绩等场景中"钻制度空子"的能力,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的漏洞策略。
Google 发布一套零信任隐私分析方案,将新型单次消息密码学聚合协议与 TEE 结合,使设备无需多轮在线即可提交数据。该方案保证 Google 只能获得匿名化的群体聚合洞察,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 认证则向参与者证明协议按公开代码正确执行。
Google Research 提出一套框架,通过改编自 IRI、ERQ 等心理问卷的情境判断测试(SJT),评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。