跳到正文

#DeepSeek

今日 0 条
9月30日周三
  1. Simon Willison77

    Anthropic 红队评估 GLM-5.3 与 Claude Mythos Preview 的网络攻击能力

    Anthropic Frontier Red Team 在内部二进制利用基准测试的 100 个任务中评估了多个模型,发现 GLM-5.3 在 4% 的试验中实现了完全控制流劫持,而 Claude Mythos Preview 为 6%。

    推荐理由:引用了 Anthropic 红队关于 GLM-5.3 和 Claude Mythos Preview 在二进制利用基准测试中的具体表现对比。

9月26日周六
9月22日周二
  1. Latent Space82

    小米发布 MiMo-V2.6-Pro 与 Flash 开源全模态模型,训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 智能指数 46,位列开源权重模型首位,定价 $0.435/M 输入、$0.87/M 输出 token,采用 MIT 许可。

    推荐理由:小米首次进入前沿开源模型序列,其RL环境与训练配方开源,可观察后训练成本压缩到何种程度。

7月20日周一
  1. Import AI52

    Import AI 465:开放与闭源模型差距收窄、Kimi K3 与 Demis 的 AGI 监管方案

    本期 Import AI 汇总多条动态。英国 AI Security Institute 分析显示,开放权重模型与闭源前沿模型的网络安全能力差距在收窄,GLM-5.2 与 DeepSeek V4-Pro 大致相当于 4 至 7 个月前发布的闭源前沿模型,而 2025 年大部分时间这一差距为 6 至 10 个月;在长周期网络攻防任务上差距更大。

© 2026 SI·Hot · Super Intelligence Hot · 超级智能热点 · 网站数据均来源于网络公开资料,版权归来源方所有