
中国开源大模型KimiK3近日以亮眼成绩在全球爆红,但美国人工智能公司AnthropicCEO阿莫代伊在出席美国国会AI安全听证会时,却声称K3蒸馏了其模型,甚至是一款“尚未公开的未来模型”。
对此,中国人工智能初创企业月之暗面明确进行否认。
7月21日,月之暗面副总裁黄震昕在接受媒体采访时明确表示,K3性能跃升的核心来自底层原创架构创新,“并非对现有模型进行蒸馏复刻”。
KimiK3于7月中旬推出,总参数规模为2.8万亿,采用稀疏混合专家架构。按照月之暗面公布的技术资料,模型运行时从896个专家模块中激活16个,并引入KimiDeltaAttention混合线性注意力机制以及AttentionResiduals注意力残差技术。
月之暗面称,这些架构调整与训练方法、数据配方的改进,使K3将计算资源转化为模型能力的整体效率较KimiK2提高约2.5倍。
而之后,由于K3发布在编程和智能体任务中取得较高排名,迅速受到海外开发者和科技行业关注。但与美国头部闭源模型之间迅速缩小的性能差距的同时,也让有关中国人工智能企业是否依赖模型蒸馏的阴谋论再次升温。
“蒸馏”是将大参数模型迁移到小模型的常用技术,更类似于模仿学习,而非抄袭或者搬运。Anthropic将蒸馏技术污名化,试图抹黑中国竞品,给自己脸上“贴金”。
去年,中国的人工智能模型DeepSeek横空出世震动美国市场,该模型可与美国人工智能巨头的产品抗衡,成本却远低于对方。时任特朗普政府人工智能与加密货币顾问的萨克斯却暗示,DeepSeek蒸馏了美国模型。
今年2月,ChatGPT的开发者OpenAI致信美国国会议员,附和起类似论调,鼓动美国政客不应允许中国通过“盗用并包装美国创新成果”来发展人工智能。
同月,Anthropic也指控DeepSeek、月之暗面和MiniMax,并多次要求美国政府限制中国的人工智能。
Anthropic称上述中国模型公司通过约2.4万个虚假账户,与其Claude模型进行了超过1600万次交互,以提取模型能力,相关行为违反了其服务条款和地区访问限制。
而美方这类对华无端指控就屡见不鲜。中方多次强调,中国的科技成就一不靠偷,二不靠抢,是包括广大知识分子在内的中国人民凭借智慧和汗水拼搏奋斗出来的。美方打着国家安全的旗号,渲染炮制所谓中方“窃取”美方科研成果别有用心。
中方敦促美方个别官员摒弃冷战思维和零和博弈的过时观念,正确看待并维护中美在科技、人文领域的交流合作,多做有利于增进中美互信与合作的事。