泡泡资讯网

我有一种预感:第二个震惊硅谷的“梁文峰”,已经出现了! 谁能想到,DeepSe

我有一种预感:第二个震惊硅谷的“梁文峰”,已经出现了!

谁能想到,DeepSeek之后,第二个让华尔街集体冒冷汗的中国人,竟然是一个几个月前还被嘲笑“掉队”的90后。

他叫杨植麟。

7月16日,杨植麟创办的月之暗面突然扔出Kimi K3。没有铺天盖地预热,也没有开几十场发布会,直接把模型往桌上一拍:2.8万亿参数,原生多模态,100万token上下文,还要开放模型权重。

硅谷一开始以为,这又是一款中国公司用“参数大”制造噱头的模型。毕竟过去两年,见过太多把参数吹上天、一跑分就露馅的“大力出奇迹”选手。华尔街那帮分析师,甚至懒得调整财报模型,只当是又一轮国产大模型的常规刷榜。

但三天之后,风向变了。

起因是开源社区有人拿Kimi K3跑了一轮“硬核”测试——不是那种精心调过提示词的刷分题,而是丢进去一份满是公式、图表和手写批注的百页技术文档,让它直接提取关键数据并重绘逻辑框架。

结果不仅准确率高得离谱,更让海外开发者倒吸凉气的是推理成本:处理同样体量的任务,Kimi K3的消耗只有Claude 3.7的十分之一出头。

硅谷技术论坛开始有人翻出杨植麟的履历——清华学霸,卡内基梅隆博士,Transformer作者之一,曾参与XLNet和Transformer-XL的核心研发。换句话说,这位被国内媒体一度贴上“掉队”标签的90后,十年前就在啃Transformer底层架构,如今不过是在自己最熟悉的战场上打了一场翻身仗。

真正让华尔街后背发凉的,不是参数大小,而是Kimi K3背后那套“非主流”的技术路线。

过去业内默认一条铁律:大模型想变强,就得堆算力、堆显卡。谁囤的H100多,谁就能笑到最后。硅谷巨头们疯狂扩建数据中心,本质上是在赌——“算力即护城河”。

但杨植麟偏偏没走这条路。

Kimi K3采用的是MoE架构,全称是混合专家模型。听起来唬人,其实原理不难懂:好比一家大公司,过去每来一个问题,全公司几千号人都要放下手里的活一起讨论(这就是传统密集模型的“全员参战”)。而MoE架构呢?来了问题,先由一个“路由系统”判断该找哪几位专家,然后只让这几个专家开会决策。其他人该干嘛干嘛。

这带来的结果是:Kimi K3虽然总参数高达2.8万亿,但每次推理实际激活的参数量只有约360亿到420亿。也就是说,它用“调动少数精锐”的方式,实现了接近“全军出击”的效果,而电费(算力成本)却省了一大截。

如果说DeepSeek之前靠“性价比”让硅谷第一次感受到中国AI的工程能力,那Kimi K3就是把这套逻辑推向了极致:不需要囤积天价显卡,也能做出顶级模型。华尔街突然意识到,他们押注的“算力军备竞赛”叙事,可能要被改写了。

更让硅谷睡不着觉的,是杨植麟宣布开放模型权重。

开源在AI圈不稀奇,但把这种体量、这种效率的模型权重直接开放,在海外头部玩家那里几乎不可想象。OpenAI靠闭源筑起商业壁垒,谷歌、Anthropic死死攥着模型细节,生怕被人抄了后路。而月之暗面这一手,等于直接告诉全世界:技术图纸我公开了,你们随便研究。

这背后透着一股自信——我们的护城河不是模型权重,而是工程迭代速度和成本控制能力。你拿去用,但你想复制我的迭代效率?没那么容易。

杨植麟本人倒是淡定。有媒体问他怎么看待“掉队”说法,他只回了一句:“我们的目标从来不是跑赢谁,而是跑到AGI的终点。”这种话从别人嘴里说出来像口号,但从一个搞了十几年底层架构的人口中说出,更像是在陈述工作计划。

当然,质疑声也有。有人担心开源导致核心技术外流,有人质疑2.8万亿参数的训练稳定性,还有人翻出之前Kimi在某些评测中表现平平的记录。

但无论如何,Kimi K3用实打实的低成本高效果,向世界证明了一件事:中国AI不只靠工程师红利和廉价算力,而是在底层架构上找到了自己的解题思路。