GPT-5.6-Sol网络攻防超越Mythos,开源大模型加速追赶 | AI新闻门户

type
status
date
slug
summary
tags
category
icon
password
网址
在人工智能(AGI)飞速发展的今天,大模型(LLM)不仅在语言理解和内容创作上日新月异,其在网络安全攻防领域的表现也正引发全球范围内的广泛关注。英国AI安全研究所(AISI)最新发布的一份评估报告,首次公开量化了开源AI模型与闭源前沿模型在网络攻击能力上的差距。
报告显示,这一差距已从去年的6到10个月,缩短至如今的4到7个月。更令人瞩目的是,在网络攻防能力上,最新的GPT-5.6-Sol已经超越了备受瞩目的Claude Mythos 5。这意味着,防御方的安全窗口正在急剧收缩,而攻击前沿的扩散速度则在呈指数级加速。想要获取更多前沿AI资讯和深度大模型动态,欢迎访问AI门户 aigc.bar( https://aigc.bar )。

攻防对决:GPT-5.6-Sol与Claude的巅峰较量

今年4月,Mythos Preview和GPT-5.5在AISI的评估中制造了自测试开始以来最大的一次网络攻击能力飞跃。而随着GPT-5.6-Sol的推出,闭源前沿模型在网络攻防领域的统治力再次被刷新。
AISI采用了两套极为严苛的体系来评估这些大模型的网络攻击能力:
  1. 70项窄任务:覆盖漏洞研究、逆向工程、Web渗透和密码学四个方向。任务难度分为四级,从“有技术背景的非专业人士”一直延伸到“十年以上经验的专家”级别。
  1. Cyber Range(模拟网络靶场):在模拟的企业网络环境中,测试大模型自主执行多步骤攻击链的能力。例如,在名为“The Last Ones”的极端场景中,包含32个攻击步骤、4个子网和约20台主机,人类专家通常需要花费20小时才能完成。
在这两套测试中,GPT-5.6-Sol展现出了惊人的自主渗透能力,其在复杂漏洞挖掘和多步骤攻击链的执行效率上,已然超越了Claude Mythos 5,成为了目前网络攻防领域最强的前沿大模型之一。

开源模型强势追赶:性价比的降维打击

尽管闭源大模型在能力上依然保持领先,但开源大模型追赶的脚步已经越来越快。根据AISI的数据,开源力量正在以惊人的速度缩小与闭源前沿的代差:
  • GLM-5.2 在窄任务上的表现已与Opus 4.6相当,差距缩短至4个月;在Cyber Range靶场测试中追平Opus 4.5,差距仅为7个月。
  • DeepSeek V4-Pro 在窄任务上直接对标Opus 4.5,差距仅为5个月。
除了能力差距的收窄,开源大模型在使用成本上对闭源模型形成了降维打击。
在同一场Cyber Range测试中,调用Opus 4.5或4.6运行一次的Token成本约为85美元,而使用GLM-5.2仅需46美元。更令人震惊的是,使用DeepSeek V4-Pro的成本仅为1.19美元。在窄任务测试中,Opus 4.6平均每个任务花费15.17美元,而GLM-5.2只需6.12美元;Opus 4.5花费12.50美元,DeepSeek V4-Pro则仅需0.28美元。
同等的网络攻防能力,开源模型的成本便宜了一到两个数量级。这意味着,恶意攻击者利用大模型发起大规模、低成本网络攻击的门槛已被极大地降低。

闭源安全护栏的“马奇诺防线”

许多人认为,闭源模型由于有服务商的安全过滤和监管,会比开源模型更安全。然而,AISI的报告和近期发生的安全事件无情地打破了这一幻觉。
测试显示,DeepSeek V4-Pro虽然会拒绝部分逆向工程任务,但攻击者只需通过简单的重试和提示词(Prompt)调整即可轻松绕过。
更极端的案例发生在Anthropic的Fable 5上。该模型发布仅三天,安全研究人员就通过多步骤越狱策略突破了其安全分类器,使其产出了本该被拦截的敏感漏洞利用代码。随后,亚马逊的研究人员也独立报告了其他绕过方法。这直接触发了美国商务部首个针对AI模型的出口管制令,导致Fable 5全球停服19天进行整顿。
事实证明,闭源并不自动等于安全,前沿大模型的安全护栏在有心之人面前依然脆弱。

防御端的AI加速:双刃剑的另一面

虽然网络攻击能力在不可逆地扩散,但AI同样在赋予防御方更强大的武器。
游戏网络编程领域的资深开发者Glenn Fiedler最近分享了他的实践。他使用Claude Code对自己维护的四个开源网络库(在游戏领域极具影响力的老牌开源库,合计约6000个GitHub Star)进行了系统性的安全审计。在AI的辅助下,他部署了libFuzzer、上线了AddressSanitizer,并执行了数百万次的压力测试。
在短短两周内,AI辅助修复了43个安全漏洞,其中27个是可从网络远程触达的严重漏洞,包括一个自2019年起就存在于yojimbo库中的远程堆溢出漏洞。而整个审计过程消耗的Token成本仅为2500美元。
这表明,AI确实能极大加速防御端的工作。然而,攻防两端存在着严重的不对称性:开源大模型的权重一旦释放,就如同覆水难收,其安全护栏可以被轻易移除,并在私有服务器上不受监管地运行;而防御工具的部署,却需要成千上万个企业和安全团队主动投入时间和成本去落实。正如AISI报告中所警告的:“一旦开源释出,这些防御选项将永久丧失。”

结语:全球AI监管的新变局

开源与闭源在网络安全能力上的差距缩短到半年以内,意味着“用闭源独占期充当安全缓冲”的传统策略已经开始失效。
下一阶段,全球决策者和人工智能监管机构的核心博弈将更加尖锐:究竟什么能力级别以上的大模型,应该被严格禁止开放权重?随着AISI宣布将继续评估Kimi K3等下一批开源及闭源模型,这条安全红线画在哪里,将直接决定未来AGI时代的网络安全格局。
关注人工智能最新趋势,获取一手大模型资讯与AI变现指南,请持续关注 aigc.bar( https://aigc.bar ),为您带来最前沿的AI日报与深度行业解析。
Loading...

没有找到文章