page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

1.4TB权重、几十张显卡:Kimi K3的“免费”到底有多贵?

mogoec 2026-07-30 8

这几天,月之暗面的Kimi K3成了全球AI行业绕不开的话题。

月之暗面在2026年7月16日正式发布Kimi K3,并于7月27日开放完整模型权重。官方资料显示,K3拥有2.8万亿总参数、1040亿激活参数,采用混合专家架构,每个Token会从896个路由专家中选择16个参与计算,同时支持原生多模态和100万Token上下文。月之暗面也明确表示,在其评测体系中,K3整体表现仍落后于Claude Fable 5和GPT-5.6 Sol,但已经进入前沿模型水平。 重也可以免费下载。

于是,一个非常现实的问题出现了:

既然模型免费,我是不是可以把它下载到公司电脑上,以后就不用再交API费了?

从法律许可层面看,你确实可以下载;从物理条件看,大多数公司却根本跑不起。

这正是开放权重大模型最反常识的地方:

免费的是模型复制权,不是运行模型所需要的显卡、电力、网络和机房。


一、先把“开源”两个字说清楚

很多人听到“开源模型”,会自然联想到Linux、Firefox或者开源播放器。

传统开源软件开放的是源代码。代码由人编写,也可以被人阅读。程序员能够逐行查看程序逻辑,修改功能、修复漏洞,再编译成自己的版本。

大模型开放的核心则是“权重”。

可以把大模型想象成一颗训练完成的人工大脑,权重就是这颗大脑内部数以万亿计的连接强度。拿到权重以后,开发者可以运行模型、量化模型、微调模型,也可以基于它训练衍生版本,但很难像阅读软件源代码一样,指出某个具体数字究竟代表哪条知识或哪种能力。

因此,Kimi官方采用的表述是“open-weight”,也就是开放权重模型

按照开放源代码促进会的定义,一个完整的开放源代码AI系统,不仅要给予使用、研究、修改和再分发的权利,还应提供足以理解和修改系统的信息。仅公布权重,而没有完整公开训练数据和全过程,通常更适合称为开放权重,而不是传统意义上的完全开源。 当宽松,允许使用、复制、修改、部署、微调和销售衍生版本。不过,它并不是毫无限制:

当企业经营“模型即服务”业务,且连续12个月总收入超过2000万美元时,需要与月之暗面另行签订协议;当商业产品月活用户超过1亿,或者月收入超过2000万美元时,需要在产品界面显著展示“Kimi K3”。企业纯内部使用则不受这两项要求限制。 法不是“K3完全免费、想怎么用就怎么用”,而是:

模型权重可以免费获得,绝大多数研究、内部部署和一般商业应用可以使用,但仍需遵守专门许可条款。


二、权重免费,为什么模型还是装不进电脑?

K3拥有2.8万亿参数,并从监督微调阶段开始采用MXFP4权重量化。

FP4可以粗略理解为每个参数使用4比特存储。按照最理想的理论值计算:

2.8万亿参数 × 4比特 ÷ 8,约等于1.4TB。

这只是权重本身的理论下限。真正部署时还要考虑量化比例因子、模型配置、运行时缓冲区、激活值、上下文缓存和并发请求占用,因此实际需要的存储和显存通常会更高。 卡RTX 5090拥有32GB显存,官方建议零售价从1999美元起,整卡功耗最高约575瓦。 运行开销,只考虑把1.4TB权重塞进显存:

  • 理论上至少需要约44张RTX 5090;
  • 按官方起售价计算,显卡本身就要87956美元;
  • 44张显卡满载功耗约25.3千瓦;
  • 还没有计算CPU、内存、硬盘、交换机、散热和电源损耗。

而且,这只是数学上的“容量够了”。

消费级显卡缺少适合超大规模模型部署的高速互联和成熟服务器拓扑。你很难找到能够稳定安装44张RTX 5090的普通主板,更难让它们以数据中心加速卡集群的效率互相通信。

所以,“显存加起来够大”并不意味着“模型就能正常运行”。

这就像你买了44辆家用轿车,总载重量可能超过一辆重型卡车,但不能因此认为它们可以组成一辆重型卡车。


三、MoE每次只用16个专家,为什么还要保存896个?

K3采用MoE,也就是混合专家架构。

它包含896个路由专家,每个Token只选择其中16个参与计算。这种设计可以降低单次推理所需的计算量,让一个2.8万亿参数模型不必在每一步都计算全部参数。官方给出的激活参数量约为1040亿。 容易产生的误解:

每次只激活16个专家,不等于服务器只需要保存16个专家。

可以把K3想象成一家拥有896个专科的超级医院。

一位患者可能只需要16个科室会诊,但医院无法提前知道下一位患者会用到哪16个科室。因此,896个科室必须全部存在,医生也必须保持可调度状态。

K3也是如此。

不同Token会被路由到不同专家。为了保证模型能够连续生成内容,全部专家权重都必须存储在系统中,并能被迅速调入计算。

MoE节省的主要是计算量,不是模型的全部存储量

这也是为什么很多MoE模型看起来“激活参数不大”,完整部署却仍然需要庞大的显存和高速互联。


四、到底需要多少张数据中心显卡?

关于K3需要多少张卡,必须区分三个概念:

  1. 权重勉强装得下;
  2. 模型能够运行;
  3. 模型能够面向多人稳定提供服务。

这三种状态的硬件要求完全不同。

NVIDIA H200拥有141GB高带宽显存,最高功耗约700瓦。只按1.4TB权重计算,大约10张H200的显存容量就可能达到理论下限,但真实部署还要为运行时和上下文缓存预留空间,因此不能按照10张卡直接采购。 的K3部署方案显示:

  • H200的基础部署拓扑为16张,即2个8卡节点;
  • H200高吞吐配置会扩展到32张;
  • H100由于单卡显存更小,推荐使用32张;
  • B200等高显存加速卡也从16张配置起步;
  • 更大规模的服务方案可以扩展到32张或64张。 推理效率出发,建议K3部署在拥有64张或更多加速卡的超节点架构上。这里的64张,并不是“模型启动所需的绝对最低数量”,而是为提高通信效率、并发能力和整体吞吐给出的生产级建议。 。

有人说“K3至少要64张卡才能运行”,并不准确;但如果一家企业希望它像商业API一样,能够承受大量并发请求、快速响应并保持稳定,硬件规模确实可能向几十张甚至64张以上发展。

仅以700瓦级加速卡计算:

  • 16张卡的GPU功耗约11.2千瓦;
  • 32张卡约22.4千瓦;
  • 64张卡约44.8千瓦。

这还只是GPU本身。

加上CPU、内存、NVLink或高速网络、存储、电源转换损耗和制冷系统以后,整套基础设施的用电需求会明显增加。

普通办公室不是没有地方摆服务器,而是供电、散热、噪声、消防和网络条件都不适合运行这种集群。


五、不买服务器,租云计算是不是就便宜了?

云计算确实能够省去一次性采购、机房建设和硬件维护,但它并不等于便宜。

AWS公布的EC2 Capacity Blocks价格显示,一台配备8张H200的p5e.48xlarge实例,在部分地区的有效价格约为39.799美元每小时。 H200基础部署拓扑,需要同时租用两台8卡实例。

如果全天候运行30天:

39.799美元 × 2台 × 24小时 × 30天,约为57311美元。

这只是云服务器租金,还没有计算数据传输、存储、模型部署工程、监控系统和运维人员成本。

相比之下,K3官方API定价为:

  • 缓存命中输入:每百万Token 0.3美元;
  • 普通输入:每百万Token 3美元;
  • 输出:每百万Token 15美元。 使用10亿输入Token和1亿输出Token,并且输入全部按照未缓存价格计算:
  • 输入费用约3000美元;
  • 输出费用约1500美元;
  • 合计约4500美元。

这个用量对许多中小型企业来说已经不算低,但仍然远低于持续租用16张H200的月度成本。

同一时期,OpenAI GPT-5.6 Sol的官方API价格为每百万输入Token 5美元、输出Token 30美元;Anthropic Claude Fable 5为输入10美元、输出50美元。K3在官方定价上确实对前沿闭源模型形成了明显压力,但这并不意味着所有闭源模型都比K3贵,也不能只看Token单价判断模型是否适合具体业务。 是“模型免费还是收费”,而是:

在相同任务成功率、响应速度、上下文长度和服务稳定性下,完成一项业务任务到底要花多少钱。


六、为什么硬件厂商愿意支持开放权重?

7月24日,英伟达CEO黄仁勋发布了自己的第一条X帖子,分享了一封支持开放权重模型的公开信。

截至2026年7月30日,微软公布的签署名单已经超过230家企业和机构,包括NVIDIA、AMD、微软、Google、Meta、OpenAI、Amazon、IBM、Intel、Hugging Face、Linux基金会和多家云计算企业。Anthropic没有出现在当天公布的签署名单中。 的公司,为何会支持免费开放的模型?

原因并不矛盾。

模型权重开放以后,更多企业能够研究、修改和部署前沿模型,模型厂商之间的竞争会加剧,API价格可能下降。但企业想自己运行模型,仍然需要购买或租赁GPU、服务器、网络和数据中心资源。

换句话说:

开放权重压低的是模型许可和调用环节的门槛,却可能扩大整个社会对算力基础设施的需求。

微软在公开信中也明确提到,开放权重会促进模型、云计算、芯片、应用和服务之间的竞争。 消灭硬件公司的生意,反而可能把更多企业带进GPU和云计算市场。

模型像免费的菜谱,芯片厂商卖的是厨房设备,云计算厂商经营的是按小时出租的中央厨房。


七、企业究竟什么时候应该私有化部署?

自己部署K3并不是错误选择。

对于以下几类机构,私有化部署可能具有合理性:

1. 数据必须留在本地

金融、医疗、政务、工业设计和核心研发数据可能不能发送到外部API。此时,模型私有化带来的合规和数据控制价值,可能高于硬件成本。

2. 使用量长期稳定且足够大

API按量计费适合需求波动明显的企业。如果一家公司的请求量长期处于极高水平,硬件能够保持较高利用率,自建集群才有可能摊薄单位推理成本。

3. 需要深度修改模型

企业如果需要持续微调、修改推理框架、研究模型内部行为,或者开发大量衍生版本,拥有权重和完整部署环境会更加灵活。

4. 需要摆脱单一供应商依赖

开放权重允许企业更换云服务商、使用不同推理引擎,或者逐步迁移到自己的基础设施,这种选择权本身具有战略价值。

但对于普通个人、内容团队、创业公司和多数中小企业,更合理的顺序通常是:

先使用官网验证能力,再使用API验证业务,最后才评估是否私有化部署。

不要因为模型权重免费,就跳过需求验证,直接采购服务器。


八、老板真正应该看到的,不是模型价格,而是总拥有成本

传统软件的成本结构大致是:

开发昂贵,复制便宜,运行成本较低。

前沿大模型的成本结构则更像:

训练极其昂贵,复制权重接近免费,但每一次推理都要消耗显存带宽、计算能力和电力。

因此,开放权重改变的不是物理规律,而是产业分工。

过去,企业只能向模型公司购买能力;现在,企业可以选择:

  • 直接使用模型公司的API;
  • 向第三方云平台购买推理服务;
  • 在公有云上租赁GPU自行部署;
  • 建设私有集群;
  • 对模型进行量化、蒸馏或微调;
  • 换用规模更小、任务更匹配的模型。

选择变多了,竞争也更充分了。

但选择变多,不代表每一种选择都便宜。

以后再看到“某某前沿模型免费开放”的消息,不妨先问五个问题:

  1. 开放的是代码、权重,还是连训练数据也开放?
  2. 模型权重有多大,采用什么精度?
  3. 最低可运行配置和生产配置分别是多少?
  4. 每月API费用与自建集群总成本相差多少?
  5. 企业究竟需要使用模型,还是必须拥有模型?

这五个问题,基本可以帮我们识别大模型新闻中的“免费”究竟意味着什么。

Kimi K3的权重已经向全世界开放。

但它并没有让2.8万亿参数的模型变成一款能够随手安装的桌面软件。它只是把过去掌握在模型公司手里的前沿能力,变成了任何具备足够算力的人都可以研究和部署的基础设施。

门确实打开了。

只不过,门后面不是一台电脑,而是一座机房。

关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部