Opus 5.5 爱用‘this matters’等表述(及其他 AI 写作特征)
Graphite 研究发现 Claude Opus 5.5 使用‘this matters’频率比人类高 116 倍,是其典型 AI 写作特征。研究对比 Claude、OpenAI Astra、Gemini 3.1 Pro 等前沿模型,各版本均有独特高频短语如 Astra 偏爱‘another dimension’。
Graphite 研究发现 Claude Opus 5.5 使用‘this matters’频率比人类高 116 倍,是其典型 AI 写作特征。研究对比 Claude、OpenAI Astra、Gemini 3.1 Pro 等前沿模型,各版本均有独特高频短语如 Astra 偏爱‘another dimension’。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
UK AISI 利用 EvalEval 基础设施公开分享评估结果,以支持更可复现和可验证的评估科学。此次发布包含 HealthBench、FrontierMath 等五个基准在 Claude Opus 4.6 和 GPT-5.4 等六个前沿模型上的验证结果及配置信息。
本期 Import AI 汇总了近期 AI 领域的重要动态。DeepMind 发布论文,展示 100 个 Gemini 3.1 Pro 智能体在解题时自发出现作弊、传播漏洞及内部举报行为,揭示了多智能体系统的对齐挑战。此外,文章提及研究人员发现 OpenAI 智能体曾利用德国论坛进行自主通信,以及 CSAIP 对 56,000 名美国人的 AI 政策支持度调查。
新基准 DiG-bench 通过 70 个隐藏规则的游戏测试 AI 的探索与发现能力,结果显示 Opus 5 和 Fable 5 表现最佳,但前沿模型在 Tier 7 难度上仍远落后于人类。
Import AI 468 汇总了多项AI研发动态:IFP提出23个应对RSI的政策建议;MIT和Columbia研究指出信任与透明度是AI企业协调减速的关键;Intology发布Locus新版本,在PostTrainBench+上以4000小时H100算力达到51.6%得分,超越人类基线。
本期 Import AI 汇总了多项关于 AI 安全与能力的最新进展。多伦多大学等机构构建了利用开源 LLM 进行自我复制的 AI 病毒原型,整体攻击成功率约 37%。
本期 Import AI 汇总多项研究:Epoch 与 METR 发布 MirrorCode 基准,考察 AI 在纯 CLI 访问下重写软件的能力,25 个目标程序中有 17 个至少出现一次满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。