全球开源模型参数规模第一
“2.8万亿”如何炼成Kimi K3登顶之路
7月27日深夜,北京月之暗面开源人工智能(AI)模型Kimi K3,同步放出模型权重、技术报告及三项关键训练Infra(底层通信库、高性能计算算子与智能体沙箱),开发者可下载部署用于研发或嵌进产品。Kimi K3参数规模达2.8万亿,创下全球开源模型参数规模第一。同时,它也是首个登顶Frontend Code Arena国际权威代码盲测榜的国产大模型,且在权威的Artificial Analysis智能指数中排全球第三,是开源界的“领头羊”。更关键的是,它第一次让免费可下载的开源模型能力摸到顶尖闭源系统下沿——过去只有交订阅费才能用的超级AI大脑,现在有机会让所有人用上。
开源和闭源有何不同
开源和闭源指的是软件源代码(程序员编写的原始代码)要不要向社会公开,这是两种截然不同的模式。
开源的软件源代码完全公开,任何人都可以自由查看、修改、学习、分发,还可以在此基础上进行二次开发。开源不只是可以免费下载和使用,更重要的是,全世界的用户都能在使用中寻找软件的漏洞、修复漏洞,甚至增加新功能。开源软件的安全性更高,隐私也更受保护,因为软件没有“后门”,还会受到所有人的监督。
当然,开源模型也不能想怎么用就怎么用,还得遵守特定的开源许可证。这是一份由软件开发者定下的法律协议,明确规定别人能做什么、必须做什么、不能做什么。比如,能不能拿它做商业用途?改了之后是不是还得继续开源?这方面的代表,除了Kimi K3,还有Linux和Python等。
闭源模型也叫作专有软件或商业软件。源代码是公司的核心商业机密,不对外开放。公众和用户只能使用编译好、无法直接阅读的运行程序。也就是说,版权归原作者或开发公司,只有这二者有权修改和更新代码。人们通常买了授权、成为会员或支付服务费才能使用。用户使用闭源模型,基本就是面对一个“黑箱”,不知道软件后台是怎么运行的,只能相信开发者的安全保障。其典型代表有Windows、macOS这样的操作系统,Microsoft Office、Adobe Photoshop这样的专业软件,以及《英雄联盟》等大多数游戏。
开源与闭源可以从知识共享、使用门槛和安全性这几个方面来区分。打个比方,开源模型很像一座无门槛的社区图书馆,谁都能进去看书(使用模型),还能复印一部分甚至把整本书带回家,随便涂改或扩写(微调或二次开发),甚至自己加上几章再转发给别人(发布衍生模型)。这方面比较典型的有Llama和DeepSeek。
而顶尖的闭源模型像一座门槛很高的绝密档案馆,读者得先得到批准,再像隔着防弹玻璃一样看书,或者只能看复印件却不能带走,更不能进入档案馆内部查看原始档案、卷宗和图纸。这方面比较典型的有OpenAI的GPT-4o、Anthropic的Claude 3.5。原因在于,这些闭源模型付出了巨额成本,尤其是训练成本高达数亿甚至数十亿美元,这是公司的商业机密,也是用来赚钱的核心产品。
最大的智慧容器用起来很“灵”
一些科技公司一直在努力,想让开源模型的性能接近甚至在某些领域超过闭源模型。Kimi K3的出现,起到了这个作用。如果说开源模型是分散在各个社区的普通图书馆,那么拥有2.8万亿超大规模参数的Kimi K3,就是在开源界盖起的一座面向公众的超级图书馆,改变了图书馆和档案馆之间的关系和竞争格局。Kimi K3把参数量直接增至2.8万亿,相当于把原来只有档案馆才买得起的绝版孤本和前沿文献,如长程编程、自主设计芯片、图纸等深层知识,都搬进了这座新建的超级图书馆。这相当于给AI大脑做了一次“扩容手术”,也打开了AI世界的另一扇门。
Kimi K3采用了先进的MXFP4(4位浮点数)进行权重压缩,2.8万亿参数被压缩进大约1.4TB的物理文件中。打个比方,这相当于把140万本纯文本电子书浓缩进一块指甲盖大小的固态硬盘——容量惊人,体积却很小。
Kimi K3的2.8万亿参数规模,不只是中国有史以来最大的AI模型,在整个人类科技史上也是开源软件里最大的智慧容器。在此之前,全球开源模型的第一名和第二名分别是中国的DeepSeek V4-Pro(1.6万亿参数)和美国的Llama 3旗舰版(4050亿参数)。
更难得的是,拥有2.8万亿参数的Kimi K3用起来并不笨拙。这是因为其结构采用了极致稀疏的混合专家架构(MoE)。它的整个“数字大脑”内部被划分为896个独立专家模块,如同896个不同学科的终身教授。当用户提问、它生成每一个词元(Token)时,会经过独创的路由器算法,只让其中专业对口的16位专家同时思考,其余专家安静休息。这样一来,Kimi K3既有大模型的容量,又能像小模型一样灵活运行,成本也因此降低。
在全球能源和芯片都很紧张的大背景下,中国研究团队虽然算力受限,但依然把“数字大脑”训练到世界顶级尺寸,依靠的是“用算法的聪明来补硬件的短板”。在大型AI模型中,要用到转换器(Transformer),其作用就像是把人类语言和逻辑做超级拆解和重建。但传统转换器有个致命弱点:上下文越长(如百万字文档),产生的临时缓存就会爆炸式增长,因为AI必须记住前面看过的所有词。这些记忆会变成巨大的缓存,堆积在显存里。不管是对昂贵的高带宽显存,还是对通信带宽来说,这都是很难突破的瓶颈。
但Kimi K3独创了KDA机制,这是一种线性注意力的变体,工作机制类似于循环神经网络。它在处理文本时,不需要保留所有缓存,而是通过一套数学公式,让每个特征维度都有自己的遗忘率和记忆率——就像大脑在处理信息时,会自动筛选重要信息、忽略无关细节,相当于做了一种特别高明的“无损压缩”。于是,科学家省掉了最卡脖子的网络带宽开销,突破了信息流动的瓶颈,让有限的算力“养活”了2.8万亿参数。
“Kimi时刻”算法如何驱动逆袭
既然在有限的算力下把2.8万亿参数“养活”了,月之暗面做的下一个决定是:把这张“顶级大脑图纸”完全开源,免费发给全世界。这个历史性举动被外媒称为“Kimi时刻”。它的意义在于,打破信息、技术和资本的垄断,让所有人共享AI发展的红利,同时也让AI发展得更快、更理性。
Kimi K3的开源,意味着全球任何一家中小企业都可以免费使用,无需像使用OpenAI或Anthropic那样付费。用上Kimi K3,就等于直接在本地或云端免费部署了一个全球顶尖水平的开源智慧大脑。这样一来,不光给使用者省了钱,还能打破国际闭源寡头试图制造AI鸿沟、长期轻松赚钱的局面。
那么,在算力受限的情况下,中国团队是怎么把“数字大脑”养到世界顶级尺寸的?答案是:靠极致的算法调优和工程创新。
硅谷相信的是“规模法则”,觉得只要投入百亿级美元购买芯片、消耗成倍的电力,就能做出超级智能。但以月之暗面为代表的团队,选择的是另一条路:冷静打磨出KDA混合线性注意力机制、896选16的极致稀疏混合专家架构。这种把算法逼到数学极限的做法,最终打造出了超级图书馆。
Kimi K3能够诞生在北京中关村,并非偶然。中关村是中国乃至全球大模型密度最高、备案数量最多的AI集聚地。目前在北京备案上线的大模型已超过250款,稳居全国第一。这些AI模型依靠的是AI人才,而中关村聚集着各种规模的创业公司,如字节跳动的豆包、百度的文心一言、月之暗面等。
有了好算法和好人才,还得有钱。AI“烧钱”,虽说2.8万亿参数模型的训练靠算法能省点钱,但研发和未来运行仍然需要庞大的资金支持。好在中关村背后站着中国最雄厚的互联网资本与科技基金。人才、技术、资金三股力量拧在一起,让月之暗面开发出了Kimi K3,并且宣布正式向全球公开完整模型权重。这向世界传递了一个明确信号:AI进步不光靠堆显卡,用算法和工程智慧同样能实现逆袭。
普通人离Kimi K3还有多远
对普通人来说,用上Kimi K3,可以说是近在眼前,但也远在天边。
说近在眼前,是因为普通人不需要搞懂高深的计算机知识,也不用买昂贵的显卡,就能立刻免费享用这个全球最强的开源大脑。月之暗面已经把Kimi K3接入了大家熟悉的Kimi智能助手(App、网页端或微信小程序)。用户只需要像平时聊天一样,在对话框里输入问题,或者直接勾选“长思考”模式,就能免费使用这个2.8万亿参数的超级图书馆。而且,由于Kimi K3的API接口价格非常便宜,未来几周,大家日常使用的各种手机App,可能都会悄悄换上Kimi K3的“数字大脑”。大家在不知不觉中,就能享受到它的全栈网页生成和长文本处理能力。所谓全栈网页生成,是指Kimi K3这种大模型仅凭用户的一句话、一张设计图或手机截图,就能在几十秒内把网页的“前端”和“后端”代码全部写完、拼装好,直接变成一个能放到公网上运行的真实网站。也就是说,用户不用学编程,说句话就能自动生成一个能用的网站。
说远在天边,是因为如果想把这个“数字大脑”完整下载到自己的设备上,并在断网的环境下运行,几乎不可能。首先,要在本地安装并运行这个拥有2.8万亿参数、896个专家的大模型,普通家用电脑或顶配游戏电脑都无法支撑。其次,光是买设备就要花费上百万元人民币,后期维护费用更是高昂。所以,目前本地完整版是只属于大型企业和科研机构的“奢侈品”。
还有一个需要重视的问题是,开源越强,被滥用的风险也越大(如深度伪造、诈骗)。因此,全世界都很关注中国怎么管好开源AI的安全。在刚刚结束的2026世界人工智能大会暨人工智能全球治理高级别会议上,中国明确了“开放普惠”的治理思路。面对1.4TB完整权重可能带来的“越狱”、隐私泄露和网络攻击等风险,中国正在通过合规备案、全栈评测、应用安全管理等方式来应对。
开源模型最大的风险在于,权重一旦被下载,原厂就无法控制用户的二次微调,因而可能会被黑客或恶意组织故意抹除安全护栏。对此,中国正在建立“敏捷监管与全栈布局”,防止有人用大规模算力对开源模型做恶意微调。
延伸阅读
开源与开放权重是一回事吗?
虽然大家都把Kimi K3称为开源模型,但月之暗面宣布的是公布完整模型权重,二者并非一回事。
开源必须公开完整的源代码、训练框架、构建脚本和相关数据,而开放权重是公开模型训练完成后的参数(权重),开发者和用户可以下载、在本地部署或进行微调,但底层的训练代码、训练数据集、数据清洗方法等核心细节并未完全公开。
科技公司为了防止竞争对手直接复制自家AI模型的核心内容,同时又愿意让别人使用自己开发的模型,就会采取开放权重这种折中的办法。开放权重足够满足大多数开发者和用户的日常应用和微调需求,不过,通常会附带特定的使用协议,如限制商业用途或二次分发,所以使用之前需看清楚授权条款。
Kimi K3本质上属于开放权重模型。但如果一个AI模型允许全球开发者和用户免费下载、本地运行、自由修改,还能在业务中部署,那它就具备了开源的普惠属性,因此也可称为开源大模型。

已有0人发表了评论