Anthropic 红队评估 GLM-5.3 与 Claude Mythos Preview 的网络攻击能力
Anthropic Frontier Red Team 在内部二进制利用基准测试的 100 个任务中评估了多个模型,发现 GLM-5.3 在 4% 的试验中实现了完全控制流劫持,而 Claude Mythos Preview 为 6%。
推荐理由:引用了 Anthropic 红队关于 GLM-5.3 和 Claude Mythos Preview 在二进制利用基准测试中的具体表现对比。
Anthropic Frontier Red Team 在内部二进制利用基准测试的 100 个任务中评估了多个模型,发现 GLM-5.3 在 4% 的试验中实现了完全控制流劫持,而 Claude Mythos Preview 为 6%。
推荐理由:引用了 Anthropic 红队关于 GLM-5.3 和 Claude Mythos Preview 在二进制利用基准测试中的具体表现对比。
AMD 以 $8.2 亿美元收购世界实验室 AI 初创公司,此举旨在增强其在 AI 领域的竞争地位。
OpenRouter 联合创始人 Alex Atallah 与 AMP 的 Anjney Midha 在 Latent Space 播客中回顾 OpenRouter 的发展历程。
小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,位列开源权重模型首位,定价 $0.435/M 输入、$0.87/M 输出 token,采用 MIT 许可。
推荐理由:小米首次进入前沿开源模型序列,其RL环境与训练配方开源,可观察后训练成本压缩到何种程度。
本期 Import AI 汇总多条动态。英国 AI Security Institute 分析显示,开放权重模型与闭源前沿模型的网络安全能力差距在收窄,GLM-5.2 与 DeepSeek V4-Pro 大致相当于 4 至 7 个月前发布的闭源前沿模型,而 2025 年大部分时间这一差距为 6 至 10 个月;在长周期网络攻防任务上差距更大。