一篇读懂 CoWoS:卡住 AI 芯片出货脖子的,不是制程是封装
NVIDIA 新卡发布的节奏,很多时候不是被 4nm 产线决定的,而是被台积电一项叫 CoWoS 的 2.5D 封装产能决定的——它把 GPU 裸片和 HBM 并排装进同一个封装。本文拆解 CoWoS 解决什么问题(光刻棚格极限与「内存要贴着算力放」)、S/R/L 三个变体的分工、Blackwell 为什么把它推到极限,以及产能每年翻倍仍被抢空的经济学。
阅读全文 →
系列文章
ARCHIVE 共 8 条一篇读懂 CoWoS:卡住 AI 芯片出货脖子的,不是制程是封装
NVIDIA 新卡发布的节奏,很多时候不是被 4nm 产线决定的,而是被台积电一项叫 CoWoS 的 2.5D 封装产能决定的——它把 GPU 裸片和 HBM 并排装进同一个封装。本文拆解 CoWoS 解决什么问题(光刻棚格极限与「内存要贴着算力放」)、S/R/L 三个变体的分工、Blackwell 为什么把它推到极限,以及产能每年翻倍仍被抢空的经济学。
OpenAI 的算力帝国账本:一万四千亿美元承诺、三家芯片厂兜底与十月刚开张的 AI 债务市场
一年时间,OpenAI 与英伟达、AMD、博通、甲骨文、微软签下约 1.4 万亿美元量级的算力承诺——芯片商既是供应商,又是投资人,如今还亲自组织债务融资。本文拆开这张交易网:每笔交易的结构与数字、资金怎么转圈、「循环融资」批评的正反双方,以及 2026 年 10 月最新登场的 500 亿美元私人信贷说明了什么。
一篇读懂 HBM:AI 算力的「内存墙」是怎么被摞高的
看 GPU 规格表,带宽那行数字比 FLOPS 更能决定大模型推理的快慢——HBM 用「立体堆叠 + 超宽接口」两个动作,把内存带宽做到了同代 DDR 的十几倍。本文拆解 HBM 的原理、四代演进、良率与封装的难点,以及它为什么既是 AI 芯片的标配,又是整条产业链最紧的瓶颈。
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
Kubernetes 怎么把 GPU 分给容器:Device Plugin、GPU Operator 与共享三路线
GPU 在 Kubernetes 里是「整数个的扩展资源」,一块 H100 跑一个小推理服务就是浪费。本文拆解 Device Plugin 汇报机制、GPU Operator 的组件分工,对比时间片、MIG、MPS 三条共享路线的隔离性与适用场景,并展望 1.34 起 GA 的 DRA 会怎么改玩法。
算力的度量衡:从 FLOPS 到卡时,看懂算力新闻的单位
FLOPS、算力、卡时、集群规模混着说,是看懂算力新闻的第一道坎。本文厘清 FLOPS 与 FLOPs 一字之差的两个概念,给出 6ND 训练算力估算经验与卡时换算方法,解释峰值与有效算力之间的 MFU 差距,最后附一张看懂算力新闻的换算清单。
算力芯片格局速览:GPU、ASIC 与推理卡的分工
芯片发布一场接一场,参数眼花缭乱。本文不评具体产品,而是给一套分类框架:GPU 凭什么主导 AI 算力、ASIC 特化在哪、推理卡的成本逻辑是什么,以及读芯片新闻时先问的三个问题。
英伟达数据中心 GPU 产品线全景对比(2026):从 V100 到 Rubin 的七代算力跃迁
系统梳理英伟达数据中心级 GPU 从 Pascal 到 Rubin 的完整产品谱系,附七代完整规格对比表、中国市场特供线专题、AMD/Intel 竞品对比、选型指南与 TCO 数据,数据截至 2026 年 9 月。