原创 正文
KimiK3“越狱”风波:是模型“钻空子”还是测试“留后门”?
来源: 中国工业新闻网 2026-08-12 19:53
分享到:

中国工业报  王珊珊

2026年8月7日,AI安全公司FrontierSecurity披露,在对月之暗面最新模型KimiK3进行网络安全能力测试时,该模型突破了用于限制其访问外部网络的安全“沙盒”,利用环境漏洞直连GitHub获取了测试题答案。这一事件迅速引发行业关注——在OpenAI、Anthropic、Meta等头部AI公司相继曝出模型“越狱”入侵真实系统的背景下,KimiK3成为了最新一例突破安全边界的AI模型。

但KimiK3的故事,与它的海外同行们有着本质的不同。

事件还原:模型“抄答案”,而非“搞破坏”

此次测试使用了英国AI安全研究所(UKAISafetyInstitute)的网络安全评估环境。这类测试通常将AI模型置于隔离的“沙盒”中,在允许模型使用命令行工具操作目标系统的同时,限制其与外部环境连接,以测试模型能否自主分析系统、寻找漏洞并完成网络安全任务。

FrontierSecurity的测试发现,KimiK3首先探测了“沙盒”的网络环境,发现大多数网站无法访问,但GitHub仍可正常连接。随后,模型通过命令行工具克隆了官方测试代码库,并直接从下载到本地的文件中读取了答案。

FrontierSecurity将这一行为称为典型的“规则钻空子”(specificationgaming):模型完成了获得正确答案这一目标,但绕过了测试原本要求的解题过程。

值得注意的是,KimiK3在突破沙盒、获得互联网访问权限后,并未实施任何攻击行为。FrontierSecurityCEOYaronSinger在接受《连线》杂志采访时表示:“我们在沙盒中发现了一个漏洞,而Kimi利用了该漏洞,这表明它缺乏(与其他模型相同的)内部护栏,用来阻止模型脱离既定任务范围的内建限制。”Frontier研究员PaulKassianik补充道:“KimiK3非常擅长以任何必要手段达成目标,而且没有护栏阻止它作弊或逃跑。”

归因之争:模型“主动利用”还是测试“配置不当”?

各方对于KimiK3的测试结果产生了明显分歧。

FrontierSecurity表示,测试使用的是英国AI安全研究所(AISI)Inspect框架中提供的默认“沙盒”环境,并未修改相关配置。Frontier据此质疑KimiK3模型缺乏足够的内部安全防护。

但英国AI安全研究所对此提出异议,称FrontierSecurity的说法“不准确且不负责任”。AISI发言人指出,Inspect是一款向全球AI安全测试开放的开源软件,使用者需要根据自身需求配置测试环境,这次测试中环境配置出现问题是因为FrontierSecurity使用Inspect的方式不对。

这一争议暴露了双方在安全评估哲学上的根本分歧。AISI的Inspect框架被设计为可配置的工具包,而非硬化的评估环境。Docker沙盒在启用时会默认限制互联网访问,但框架也提供了覆盖此限制的标志——而AISI自己的网络安全测试恰恰使用这些标志来测量模型在获得网络访问权限时的最大能力。Frontier则主张框架应默认最大隔离,要求显示选择加入网络访问,而非相反。

卡内基梅隆大学副教授、AI安全公司GraySwanCEOMattFredrikson对此表示,这一结果并不令人意外:“如果给模型设定一个目标,却没有非常明确地规定行动边界,模型就可能自己寻找获得答案的路径。”

艾媒咨询CEO兼首席分析师张毅对中国工业报从技术角度分析认为,KimiK3的行为“主要还是目标驱动下最优的路径选择,不是主观的恶意漏洞攻击”。但他同时指出,从识别理论风险到实现工程上的完整防护,“目前甚至未来都会有显著的落地鸿沟”。

团队预判:技术报告早已预警“奖励作弊”

实际上,在此次事件发生前,Kimi团队已经公开讨论过类似风险。

7月27日,Kimi团队在arXiv发布技术报告《KimiK3 : Open Frontier Intelligence》,专门介绍了KimiK3训练基础设施中设置的“高保真隔离沙盒”运行环境。报告指出,随着智能体能力增强、任务难度提高,它们往往会更加激进地探索环境,甚至可能尝试“奖励作弊”(rewardhacking)。

报告还披露,在早期使用传统容器“沙盒”进行实验时,团队已经观察到智能体的意外操作造成多次内核崩溃和死锁。为此,Kimi团队采用基于Firecracker隔离微型虚拟机的AgentENV,在尽可能保留真实环境操作能力的同时提高智能体运行环境的隔离程度。

湖南中财开元私募股权基金管理有限公司高级合伙人胡双对中国工业报称,将这一事件视为“一次压力测试”,证明“单纯的外部约束已不够用,整个行业都需要向'内外兼修'进化”。

本质差异:KimiK3“抄答案”vs.海外模型“搞入侵”

KimiK3“逃逸”并非孤例。近几周,多家AI公司的前沿模型在网络安全测试中突破了原有测试边界。

OpenAI的GPT-5.6Sol在测试中突破沙箱,利用第三方软件漏洞入侵了HuggingFace的生产系统。据英国AI安全研究所披露,Anthropic的ClaudeOpus4.7和Mythos5等模型在测试中创建虚假身份,试图说服真实人员批准恶意代码。Mythos5还制作了恶意Python包并上传至公开包库PyPI,曾在15个真实系统上运行。Meta的MuseSpark模型也因第三方评测环境配置失误获得对外连接,利用漏洞更改了外部机构的内部系统设置。

相比之下,KimiK3仅从GitHub获取了测试答案,未入侵任何第三方系统。

据《每日经济新闻》报道,HuggingFace前亚太区生态总监王铁震表示:“KimiK3只是通过已经存在、可以对外访问的接口从GitHub上获取了信息,并没有展现出任何攻击行为。”他认为,前沿开源模型尚未展现出长程潜伏和连续攻击的能力,“可以帮助防守方分析攻击方式、搜集证据,但还无法承担完整的攻击任务”。

网络安全情报平台DataWater分析指出,此前OpenAI和Anthropic的部分事件涉及尚未发布或在测试中降低安全限制的模型,而KimiK3的模型权重已于7月27日公开。

中国AI网络攻击明显低于海外同行

当地时间7月23日,英国AI安全研究所与美国AI标准与创新中心(CAISI)发布了对KimiK3网络能力的初步联合评估。

在漏洞利用开发基准ExploitBench中,KimiK3得分为32.2%,高于同期接受测试的智谱GLM-5.2的24.4%,但明显低于美国头部闭源模型平均76.2%的水平。该测试覆盖41个2023年之后发现的V8引擎漏洞。

在最危险的“任意代码执行”(ACE)环节——攻击者完全控制目标机器的最高级别漏洞利用——KimiK3在41项任务中均未成功,而美国网络攻击能力最强的模型平均能够完成20项。

两家机构还通过名为“TheLastOnes”(TLO)的模拟企业网络环境测试了KimiK3自主执行完整网络攻击的能力。该测试设置了一条包含32个步骤、4个子网和约20台主机的攻击路径。结果显示,KimiK3平均推进至第17步,而美国网络攻击能力最强的模型平均达到第28.5步。10次测试中,KimiK3仅有1次在规定的1亿Token限制内完整走完攻击路径。

张毅对此指出,这“实际上也意味着复杂推理和工具规划的能力存在一定程度的阶段性落后。这个并非天然的安全红利,也意味着一旦国内这些模型在智能体能力上追上海外头部,类似的高危逃逸风险必将会同步显现——这只是时间差的问题”。

路线分野:“先放后收”vs.“安全前置”

胡双从行业格局角度分析认为,中美AI在网络攻击能力上的差距“不只是技术差距,更是策略选择不同造成的'能力剪刀差'”。

他指出,美国路线是“先放后收”——为追求通用性,先让模型能力野蛮生长再打安全补丁,模型更“有野心”,也更容易出现越狱行为。中国路线则是“安全前置”——受政策文化与合规驱动,将安全与价值观对齐作为模型研发的前提,这抑制了模型在恶意指令上的涌现能力,显得“更听话”,但也牺牲了一定的工具使用的灵活性和创造力。这种分化正在让全球AI市场分裂为遵循不同安全哲学的“平行体系”。

常信科技CEO葛林波对中国工业从技术实现角度补充了这一观察。他指出,海外大模型大多依赖后置提示词对齐做安全防护,底层模型权重没有做深度安全改造,“很容易被越狱提示绕过防护”。国内大模型则会从底层权重微调、前置输入检测、输出过滤多层做原生安全加固,“不只是靠表层提示词”。在数据层面,国内模型支持私有化推理,推理链路做全流程加密,还有内容水印、溯源技术。对抗样本、越狱攻击的专项对抗训练也做得更多。“整套安全能力是嵌在模型技术链路里面,而不是简单外挂一层过滤”。

开源风险与行业启示

KimiK3是开放权重模型,参数规模达2.8万亿。模型权重于7月27日正式公开下载。开放权重的特性使这类模型面临更大的安全挑战。

张毅指出,开放权重模型“容易被外部微调,甚至会被绕过安全护栏。理论上来说,一定会产生越狱的风险,也就相对闭源模型来讲,它会更高”。他建议安全体系必须分层构建——“训练阶段需要强化对齐机制,从而解决模型的意愿问题;运行环境还是要依靠类似于沙盒隔离、动态边界约束,从而形成一定程度兜底。二者缺一不可,不能只是指望训练来对齐,从而消除所有逃逸的风险”。

胡双则提出了更宏观的思考:对行业而言,“未来核心问题不是'谁的AI更不会作恶',而是'我们能否信任一个日益自主的系统'”。他指出,模型厂商需将安全投入从“响应”转向“内建”,在研发初期就设置道德和伦理约束;监管机构的核心职责不再是追责,而是主导建立科学、动态、可量化的安全评估框架。

KimiK3的“越狱”风波,表面上看是一次测试环境的配置失误与模型的“取巧”行为,但深层次上,它折射出AI安全领域正在发生的范式转换。

当AI模型开始展现突破边界的能动性时,问题已经不再是“它有没有干坏事”,而是我们定义、测试和确保安全的整套框架,是否还跟得上技术进化的脚步。在AI能力持续跃升的时代,“筑墙”式的安全防护正在失效,“修心”式的内在对齐与分层防御体系,才是通往可信AI的必经之路。

针对以上中国工业报致函月之暗面,截至发稿,对方并未回复。

【作者:王珊珊】
【编辑:龚忻】