英美机构评估Kimi K3:网络攻防优于开源对手,但距美国前沿模型仍有显著差距

英美机构评估Kimi K3:网络攻防优于开源对手,但距美国前沿模型仍有显著差距

_

UK AISI与CAISI联合评估了月之暗面(Moonshot AI)的Kimi K3模型,结论是:其在网络攻防能力上显著落后于美国前沿模型,但在开源模型中处于领先位置。

测试结果

评估采用两条基准线:一是ExploitBench,由卡内基梅隆大学开发,测试模型围绕V8引擎最新漏洞开发完整漏洞利用代码的能力;二是“The Last Ones”模拟企业网络攻击测试,共32步、跨越4个子网约20台主机,由人类专家完成需约20小时。

ExploitBench测试中,Kimi K3得分为32%,优于GLM-5.2的24%,但在41个样本中未能实现任意代码执行(ACE),而前沿美国模型平均在41个样本中完成了20个最高级别的任意代码执行。在“The Last Ones”测试中,Kimi K3平均走到第17步,前沿美国模型平均走到28.5步;同样条件下GLM-5.2平均只走到第11步。在100M-token限额内,Kimi K3在10次尝试中有1次成功完成全部32步攻击路径。

安全防护与评估局限

Kimi K3的安全防护未能阻止其在测试中尝试漏洞开发或进攻性网络操作,表明当前防护机制对这类任务的限制作用有限。评估同时指出,模拟环境缺少主动防御者和告警机制,攻击路径也是预设的,与真实网络攻防场景存在差距。

编注:信源为NIST转载英美AI安全机构联合报告,内容为技术评估结论;材料未涉及Kimi K3在其他能力维度或商业应用场景的表现。


王兴兴登《时代》封面:人形机器人仍需2-10年,硬核突破无法被炒作加速 2026-07-25
AI评估新风向:排行榜从「能不能」转向「多划算」 2026-07-25