泡泡资讯网

【英国人工智能安全研究所 (UK AISI) / 美国人工智能标准与创新中心 (

【英国人工智能安全研究所 (UK AISI) / 美国人工智能标准与创新中心 (CAISI) 对 Kimi K3 的初步评估】在 UK AISI / CAISI 进行的初步网络能力评估中,Kimi K3 的性能显著低于美国的最新前沿模型。

【1】在开发漏洞利用程序时,Kimi K3 的性能显著低于最新的前沿网络模型(图一)。美国顶尖模型的综合成绩显著领先,分别比Kimi K3高约 44个百分点,比GLM-5.2高约 51.8个百分点。换算成比例,美国模型的得分约为Kimi K3的 2.4倍、GLM-5.2的 3.1倍。

【2】网络安全能力随时间的演进美国和中国最强模型的总体能力随时间变化的初步比较。美国趋势线由美国前沿模型的结果构成。y 轴上每增加 400 点,解决任务的概率就会增加 10 倍。误差线和阴影区域表示 95% 置信区间。

在相近时间点,蓝色美国趋势线接近2900 Elo,因此Kimi K3与美国前沿趋势之间仍有大约900 Elo的距离。

【3】网络攻击能力的五个阶段美国顶尖模型在约一半样本中能够构建完整漏洞利用链,而Kimi K3和GLM-5.2虽然能发现和复现不少漏洞,却没有完成从漏洞到任意代码执行的完整闭环。

结论:Kimi K3 performs significantly below the most recent frontier cyber-capable models on preliminary cyber evaluations