算力的度量衡:从 FLOPS 到卡时,看懂算力新闻的单位

先把单位摆正

读算力新闻常有一种挫败感:这句话说「多少 EFLOPS 集群」,下一句说「几万张卡跑了三个月」,再下一句又是「总算力翻倍」——单位换来换去,量级全靠感觉。其实翻来覆去就是三个量:算力的速度、算力的总量,以及把总量折算成硬件与时间的组合。把这三件事分清,新闻立刻可读。

FLOPS 与 FLOPs:一字之差,两个概念

FLOPS(floating point operations per second,每秒浮点运算次数)是速度:形容一张卡、一台机器或一个集群干活有多快,前面通常挂 T(万亿)、P(千万亿)、E 这类词头,每级正好差一千倍。FLOPs(末尾小写 s)是总量:完成一次训练或推理总共要做多少次浮点运算,形容任务的「工作量」。一个像时速,一个像里程。「这次训练用了 10 的 25 次方 FLOPs」说的是干了多少活;「集群算力 100 EFLOPS」说的是干活的速度有多快。两者混用是算力报道里最常见的笔误,读者要先把它们分开。

训练总算力怎么估:6ND 经验公式

训练总算力有一个广为引用的估算经验:总算力 ≈ 6 × 参数量 × token 数(常写作 6ND,N 是参数量、D 是 token 数)。来历可以定性讲清:模型做一次前向,每个参数大致参与约 2 次浮点运算(一次乘、一次加);反向传播要再算梯度并回传,运算量约是前向的两倍。加起来,训练阶段每个参数每过 1 个 token 大约做 6 次运算——系数 6 就是这么来的。

量级演示:一个 10B(10 的 10 次方)参数的模型训练 1T(10 的 12 次方)token,总算力约 6 × 10^10 × 10^12 = 6 × 10^22 FLOPs,即 10 的 22 到 23 次方量级。这个公式反过来用更实用:听说某次训练用了多少 FLOPs,除以 6、再除以参数量,就能大致反推它吃掉了多少 token。注意这只是量级估算——注意力、激活与不同精度格式都会带来偏差,但数量级不会错。

卡时:换算成「几万张卡跑几个月」

媒体爱用的说法是「N 万张卡跑了 M 个月」,背后的单位是卡时(GPU-hour):1 张卡跑 1 小时就是 1 卡时。换算链路是:

总卡时   = 卡数 × 天数 × 24
总有效 FLOPs ≈ 总卡时 × 3600 × 单卡峰值(FLOPS) × MFU

举例说明方法(数字为演示量级,不对应任何具体项目):假设集群有 1 万张卡,单卡峰值按千 TFLOPS(10 的 15 次方 FLOPS)量级计,MFU 按 40% 估,连跑 30 天——总有效算力约 10^4 × 10^15 × 0.4 × 2.6×10^6 秒 ≈ 10^25 FLOPs 量级。反着算更常用:先用 6ND 估出任务需要多少 FLOPs,再除以「单卡峰值 × MFU × 每天秒数」,就知道大概要多少张卡跑多少天。看到「几万张卡」的报道,用这套换算立刻能检查各处数字是否自洽。

峰值与有效:MFU

上面反复出现的 MFU(Model FLOPs Utilization,模型算力利用率)值得单独说:它是「实际用上的算力」与「硬件峰值算力」的比值。厂商宣传的是峰值;真实训练里,数据搬运、卡间通信、流水线等待、负载不均都在吃掉峰值,工程上做得不错的训练 MFU 常见在百分之几十的量级(大致三到五成,做得差可能更低)。所以看到「集群总算力是多少」,不要直接乘时间当有效算力,先问一句 MFU 按多少估。推理同样有利用率问题,只是瓶颈形态不同。

推理侧的账不一样

推理的算力账与训练不同。每生成一个 token,前向运算量大致是 2 × 参数量(只用前向那一份)——同一个 10B 模型,每出一个 token 约 2 × 10^10 次运算,生成几百个 token 就要乘上几百倍,输出越长账越大。单看计算并不惊人,真正的问题在访存:每一步都要把全部权重读一遍,加上随上下文增长的 KV Cache,显存带宽常常先于算力成为瓶颈。推理服务之所以普遍用批处理把多路请求凑在一起做前向,正是为了让一次权重搬运同时服务多个请求,摊薄访存成本。这也呼应了本站 KV Cache 与投机解码两文的核心:KV Cache 直接决定访存量,必须精打细算;投机解码把「读一遍权重」的成本摊到多个 token 上摊薄。算力速度不缺,缺的是把数据喂到计算单元手里的带宽。

一张换算清单

最后把「看懂算力新闻」的动作列成清单:

  1. 报道说「N 万张卡跑 M 天」:先算总卡时 = N 万 × M × 24。
  2. 想知道干了多少活:总卡时 × 3600 × 单卡峰值 × MFU ≈ 总有效 FLOPs(峰值查卡的官方规格,MFU 按三到五成估)。
  3. 报道说「训练用了 X FLOPs」:除以 6、除以参数量 ≈ 训练 token 数,检查与宣传的模型规模是否匹配。
  4. 只报集群总算力、不给时间与任务量:这是营销口径,换算不出任何东西,看看就好。

分清速度与总量,记住 6 与 2 两个系数,再随手估一个 MFU——大部分算力新闻的数字游戏,到这里就拆完了。

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?