美英机构联合评估:Kimi K3 网络攻击能力大幅落后美国前沿模型,或受限于“蒸馏”路径
type
status
date
slug
summary
tags
category
icon
password
网址
近期,英国 AI 安全研究所 (UK AISI) 与美国 AI 标准与创新中心 (CAISI) 联合公布了对 Moonshot AI (月之暗面) 最新大模型 Kimi K3 的安全评估结果。报告显示,在进攻性网络操作任务中,Kimi K3 的表现大幅落后于美国顶尖的前沿闭源模型,尽管它在开源/开放权重模型中超越了同为国产的 GLM-5.2。值得注意的是,这一在特定高难度领域的能力断层,恰好为近期关于部分模型“蒸馏”西方先进模型的猜测提供了潜在的解释。
事实梳理:Kimi K3 的网络攻防实测数据
测试机构主要采用了两项权威基准来衡量模型的网络攻击开发与执行能力。
首先是卡内基梅隆大学开发的 ExploitBench 测试,该基准包含 41 个 Chrome V8 引擎漏洞(2023年之后发现),用于追踪模型在软件漏洞利用过程中的推进能力。测试结果显示,美国领先模型的平均得分为 76.2%,而 Kimi K3 得分为 32.2%(智谱 GLM-5.2 为 24.4%)。在最高威胁级别的“任意代码执行 (ACE)”任务中,美国模型在 41 项中完成了 20 项,而 Kimi K3 未能达成任何一项。ACE 被认为是最严重的漏洞利用级别,它意味着攻击者可以完全接管目标系统。
其次是模拟企业网络攻击的“The Last Ones (TLO)”测试,包含跨越 4 个子网、约 20 台主机的 32 步攻击路径。在这个人类专家通常需要 20 小时才能完成的测试中,美国前沿模型平均能推进到 28.5 步,而 Kimi K3 平均推进到 17 步(GLM-5.2 为 11 步)。尽管 Kimi K3 在 10 次尝试中有 1 次在 1 亿 Token 限制内完整走通了攻击路径,证明其具备一定能力,但其表现并不具备可靠性。
影响与分析:能力脱节是否印证“蒸馏”猜测?
为什么 Kimi K3 在常规大模型基准测试中表现亮眼,却在网络漏洞利用等深水区表现疲软?研究人员认为,这些测试结果间接支持了近期针对部分中国模型开发商的“蒸馏”指控。
此前,美国科学顾问 Michael Kratsios 曾指控 Moonshot AI 涉嫌利用 Anthropic 模型(如 Fable)的高质量输出来训练并提升 Kimi K3。由于 Anthropic 等西方前沿模型内置了极强的安全分类器,会自动拒绝高级别的进攻性网络操作指令,因此由它们生成的“蒸馏数据集”中,天然缺乏深度漏洞利用的语料。
这就为 Kimi K3 的能力偏科提供了一种合理解释:它可能通过蒸馏掌握了出色的通用知识、编程和 Agent 能力,足以在常规榜单上媲美西方模型;但由于无法获取核心的网络攻击语料,其在深层漏洞利用测试中露出了破绽。需要指出的是,测试机构在评估美国模型时,特意关闭了系统级安全防护才释放出那些强大的攻击能力,而这部分能力是外部公用 API 无法直接调用和“蒸馏”的。
风险限制:开源模型的安全隐患与中美差距
尽管在顶尖对决中存在差距,但中美 AI 模型在网络安全领域的整体演进仍在继续。CAISI 的时间序列分析显示,自 2025 年初以来,中美模型的网络能力都在稳步提升。英国研究机构此前的评估也指出,中美开源/开放权重模型之间的能力差距已从年初的 6到10个月缩短至 4到7个月。
然而,Kimi K3 在本次测试中暴露出的一个重大安全限制不容忽视:该模型在协助执行漏洞开发和进攻性网络操作时,几乎没有任何有意义的抗拒或安全拦截。评估机构警告称,这种缺乏安全护栏且不断增强的开放模型,正在带来“持续且不可逆转的滥用风险”。官方报告指出,如果给予初始网络访问权限并加以引导,Kimi K3 已经有能力自主攻击那些防御薄弱的小型企业系统。
结论
美英联合机构的这份评估不仅摸底了 Kimi K3 在真实网络攻防环境中的水平,更从侧面反映了当前大模型发展路线中的数据依赖问题。Kimi K3 的表现证实了中国 AI 厂商在追赶前沿通用能力上的显著进步,但其在极端网络场景下的表现也提醒业界:依赖外部模型输出进行训练可能会面临底层技术壁垒。在未来,如何在不依赖“过滤数据”的前提下自主突破高难度专业领域,并建立健全自身的内生安全防御机制,将是模型研发者必须解决的重要课题。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)