virtual-insanity
← 뒤로

참조 260719_HANAchina_65600

stub 2026-07-19

SemiAnalysis:Kimi K3的KDA机制提高注意力效率,但将需要更多的GPU、HBM、DRAM和网络,而非更少! - 华尔街见闻 Kimi K3的线性注意力虽引发对硬件需求的短期担忧,但SemiAnalysis指出,其超2.8万亿参数与大规模推理架构,反将加剧对高端GPU、HBM及高速互联的需求。专家并行设计推高芯片间通信压力,而线性注意力带来的成本下降,或借杰文斯悖论(效率提升刺激应用扩张)推动AI规模化落地,长期支撑基础设施持续增长。

首页 资讯 股票 债券 商品 外汇 公司 硬AI 快讯 会员 VIP会员 大师课 法律信息 版权声明 用户协议 付费内容订阅协议 隐私政策 华尔街见闻 关于我们 广告投放 版权和商务合作 联系方式 意见反馈 SemiAnalysis:Kimi K3的KDA机制提高注意力效率,但将需要更多的GPU、HBM、DRAM和网络,而非更少! 李佳 07/19 14:32 Kimi K3的线性注意力虽引发对硬件需求的短期担忧,但SemiAnalysis指出,其超2.8万亿参数与大规模推理架构,反将加剧对高端GPU、HBM及高速互联的需求。专家并行设计推高芯片间通信压力,而线性注意力带来的成本下降,或借杰文斯悖论(效率提升刺激应用扩张)推动AI规模化落地,长期支撑基础设施持续增长。 月之暗面旗下大模型Kimi K3采用线性注意力机制,引发市场对英伟达、HBM以及网络设备需求可能受到削弱的担忧。 不过,半导体研究机构SemiAnalysis近日给出了截然不同的判断:K3庞大的参数规模和推理架构需求,不仅不会削弱高端AI硬件需求,反而可能进一步强化对英伟达高端GPU、HBM以及高速互联设备的需求。 SemiAnalysis指出,K3参数规模超过2.8万亿,模型权重容量超过1.5TB HBM。即便在相对有限的用户并发场景下,KV缓存仍需要大量卸载至CPU DDR5内存及NVMe存储,HBM空间并不会出现明显富余。 更重要的是,月之暗面此前透露,K3的高效推理部署需要至少64颗芯片组成的大规模扩展域架构。这一硬件需求与英伟达GB200/GB300 NVL72等机架级AI系统的设计方向高度匹配。 SemiAnalysis认为,市场此前将线性注意力理解为“削弱GPU需求”的逻辑存在偏差。真正的影响可能恰恰相反:更高效的模型架构降低了AI推理成本,将推动更多应用落地,进而刺激GPU、HBM、DRAM以及网络基础设施的长期需求。 市场担忧主要来自Kimi K3采用的Kimi Delta Attention(KDA)机制。 相比传统Transformer注意力机制,KDA能够显著降低KV缓存的数据传输需求,最高可减少约10倍的网络带宽压力。这一变化令部分投资者联想到DeepSeek R1发布后市场对AI硬件需求的担忧,认为模型效率提升可能降低对高端算力硬件的依赖。 但SemiAnalysis认为,这一判断忽视了大模型推理中的另一项核心需求——参数规模带来的计算和互联压力。 K3拥有超过2.8万亿参数,其模型权重本身就需要依赖大规模分布式计算系统完成部署。与此同时,K3采用WideEP(Wide Expert Parallelism)优化策略,将896个专家模块分布到多颗GPU上,使单颗GPU仅需承载部分专家权重,从而提升计算利用率。 不过,WideEP也带来了新的挑战:专家之间频繁的数据交换需要更强大的网络互联能力。SemiAnalysis指出,GB200/GB300 NVL7

![[og_SemiAnalysisï¼Kimi_K3çKDAæºåæé.jpg]]