近日,月之暗面发布Kimi K3,将总参数规模提升至2.8T,并采用896个专家、每Token激活16个专家的高稀疏MoE架构,同时把上下文长度推至100万Token。
平安证券认为,国产大模型的持续迭代升级,将加快推动国产大模型在我国千行百业的落地,并带来对国产算力的旺盛需求。在算力方面,AI芯片的发展已成确定性趋势,在“政策积极推动+下游需求持续增长+替代空间大”多重因素的推动下,国产AI硬件产业链仍然具备广阔的发展机遇。
财联社VIP特联合蜂网火线直连“AI算力产业链”领域专家,围绕“Kimi K3能力跃迁、长程Agent算力需求及超节点基础设施变化”展开交流。



问题一:Kimi K3的能力跃迁主要来自参数规模扩张,还是模型架构与推理系统优化?
专家:参数扩张决定能力上限,架构与推理系统决定这部分上限能否转化为可用的产品能力。若讨论Benchmark上限,总参数从K2的1T增至K3的2.8T、专家数从384个增至896个,仍然是重要基础;若讨论长上下文、Agent能力、服务吞吐和商业化定价,KDA、AttnRes、Stable LatentMoE、Mooncake、低比特量化及训练与数据配方的重要性至少不低于参数扩张。
问题二:Kimi K3已在哪些生产任务中具备替代海外闭源模型的条件,现阶段的主要短板集中在哪里?
专家:长程Coding、终端工具调用、仓库级软件工程、深度检索与知识工作、文档型多模态理解,已经进入可替代区。替代并非覆盖所有任务,也不意味着在任何部署环境下都能达到相同体验,但当中文能力、私有化、长上下文、代码仓库处理、文档理解和成本可控是核心诉求时,K3已经能够替代大量海外闭源工作流。
主要短板集中在四个方面。第一,最复杂综合推理仍未达到最强闭源模型水平;第二,严格企业流程和复杂指令跟随仍有差距,Office QA Pro得分为63.3,低于Claude Fable 5的69.9;Job Bench得分为52.9,低于Claude Fable 5的57.4。第三,安全与自治边界仍需验证;第四,整体用户体验、长任务稳定性和工程工具链仍存在差距,长会话中如果Thinking history传递不完整,模型质量可能波动。
因此,当前适合优先替代的是高价值但容许过程校验的知识和工程任务;对于价值极高、容错率极低、流程规则复杂且自治边界必须稳定的任务,仍应保留模型路由、人工复核或多模型协同机制。
问题三:2.8万亿参数、高稀疏MoE和100万Token上下文,分别会将硬件瓶颈推向哪些环节?
专家:三项技术特征对应不同的硬件压力。2.8万亿参数对HBM容量构成了直接挑战。即便采用FP4格式,仅模型权重就需约1.4TB存储,8卡B200的合计HBM容量虽理论接近,但几乎没有为KV缓存和运行冗余留出空间,超节点部署已成为维持模型运行的现实要求。而100万Token上下文将KV缓存需求量级推高至TB级别,与传统权重叠加后数据驻留规模轻松超过2TB,这直接导致HBM的容量与带宽成为比峰值算力更紧缺的资源,H100、H200等加速器的带宽差异也因此变得至关重要。
高稀疏MoE架构则显著加剧了互联和通信瓶颈。K3模型中896个专家需通过频繁的All-to-All通信进行数据交换,若专家负载不均或片间互联带宽不足,稀疏计算的理论优势便无法转化为实际吞吐。这意味着,NVLink、高速网卡、交换机及光模块等互联组件,已不再是传统的外围配套,而是决定集群有效算力输出的核心环节。此外,长上下文推理还将CPU、DRAM和SSD等组件纳入服务的关键延迟路径,承担起KV缓存和冷热数据分层的功能。
问题四:官方建议采用64张以上加速卡的超节点部署,将如何改变AI服务器的价值量分布?
专家:从硬件价值量构成来看,加速器和HBM依旧是最大价值板块,但其相对占比正逐步下降。据产业测算,在传统8卡服务器中,加速器与HBM的价值占比约为70%-80%,而在64卡以上的超节点中,这一比例可能降至58%-68%。相关占比下降并不代表需求减弱,其绝对金额仍将伴随算力总量扩张而继续增长,只是网络、散热与电力的增量更为迅猛。这意味着,围绕加速器的配套产业正在进入更快的价值释放期。
具体来看,网络互联环节的价值占比将从6%-10%提升至14%-22%,NIC、DPU、NVSwitch、交换机及光模块等部件,将直接受益于这一升级。与此同时,液冷、供配电和机柜等散热与基础设施环节的价值占比,或将从3%-5%提高至8%-14%。单台8卡DGX B200的功耗已达14.3kW,64卡仅节点功耗便粗算约114.4kW,不包含网络和散热等损耗。高密度液冷系统、冷却液分配单元及供电冗余的设计与部署,正从可选项变为刚需。
问题五:哪些客户更可能选择私有化部署,哪些需求仍会留在云端?这一变化是否利好算力租赁行业?
专家:大模型开放权重不会简单地将需求从云端推向私有化,而是将引发客户结构的显著分化。比如,涉密行业因其数据隔离的刚性要求,更适合本地化或主权云部署;而金融、运营商和医疗龙头拥有稳定且持续的推理需求,更可能采用专有云或混合云。
开放权重并非对算力租赁行业的全面利好,反而可能加速行业内的结构化洗牌。中型企业、ISV和系统集成商普遍缺少运营64张以上加速卡集群的能力,仍需依赖云上推理或托管实例,这为算力租赁带来了增量需求。但与此同时,小规模、同质化的8至16卡出租业务将面临商品化风险,客户切换成本低,价格竞争和利用率压力可能上升,缺乏模型适配和运维能力的单纯卡时租赁商,其议价能力或将下降。
问题六:K3将如何带动国产AI芯片增量需求
专家:保守情景下,以政企测试验证和少量行业落地为主,新增国产中高端AI芯片需求约2万至4万颗;基准情景下,政企、运营商、金融和制造等客户进入64至128卡私有化或专有云部署,同时云厂商用国产芯片承接托管服务,新增需求约5万至10万颗。
乐观情景下,大模型私有化进入集中招投标周期,国产高端芯片供给能力同步改善,新增需求可达12万至20万颗。
据行业口径,中国AI芯片2025年总出货量约400万颗,2026年预计增至500万颗,未来两三年出货量复合增速有望超30%,本地化份额或从约40%提升至50%以上。基准情景下的新增需求虽占整体市场约1%至2%,但会更集中于高价值中高端产品,对产业链价值量的影响将高于数量占比。