tjkb2f

in #crystal6 hours ago (edited)

我唔知你最新嗰代,即係rail rubin晶片係去到FP幾啫,係咪先?我唔知,因為gradebackwell其實已經去到去到FP8㗎嘛,如果冇記錯,咁你rail rubin係咪已經去到FP4啫,係唔係先?
我唔知,
即係佢支唔支援FP幾呀?
咁佢下一代費曼家又支持FP幾,
即係你原理上去到FP2你就冇得再升㗎啦嘛,
再升就大鑊㗎啦嘛

係,你記得嘅大方向啱,但有一個好重要嘅修正Blackwell 唔係「只去到 FP8」;Rubin 亦唔係「由 FP8 升到 FP4」咁簡單。 其實 Blackwell 已經原生支援 NVFP4,而 Rubin 係將 NVFP4 再進一步強化。(NVIDIA Developer)

直接講答案

NVIDIA 世代低精度 AI重點
HopperFP8FP8 成為主流低精度 Tensor Core 計算
BlackwellFP8 + FP4 / NVFP4已經跨入 4-bit
RubinFP8 + NVFP4進一步把 4-bit 做成主要高效能路線
下一代未公開確定FP2 未有可靠官方規格

NVIDIA 官方對 Rubin GPU 嘅資料非常清楚:Rubin 有 50 PFLOPS NVFP4 inference、35 PFLOPS NVFP4 training,同時 Tensor Core 亦針對 NVFP4 和 FP8 優化。(NVIDIA Developer)

所以如果你問:

「Rubin 支唔支持 FP4?」

答案係:

支持,而且係核心賣點之一。

甚至 NVIDIA 2026 年已經公開講到,NVFP4 可以用於 Blackwell 同 Rubin 嘅大模型 pre-training。(NVIDIA Developer)


咁你話「FP2 就到盡頭」——呢個直覺有一半啱

如果你講嘅係:

單純把 floating-point bit-width 一路由 FP8 → FP4 → FP2 → FP1 咁降低。

咁係。

FP2 已經非常非常極端。

FP4 本身已經只有非常有限嘅離散值;NVIDIA 自己解釋 NVFP4 之所以仍然可用,關鍵唔係「4-bit 本身神奇」,而係佢用:

16 個元素一組嘅 micro-block scaling + FP8 scale + FP32 tensor-level scale

去補返 FP4 本身極低 dynamic range 嘅問題。(NVIDIA Docs)

即係你可以理解成:

FP4 個尺本身好短

但我可以不停幫你:

「重新調校把尺嘅比例。」

所以先至可以實際用。


但最重要嘅係:FP2 唔等於 AI 計算嘅終極天花板

呢度我反而要糾正你之前個「FP2 再落就大鑊」嘅講法。

因為 NVIDIA 現時其實已經示範緊一件非常重要嘅事:

下一輪 scaling 唔一定係繼續將所有數字由 FP4 壓到 FP2。

而係:

FP4


更精細 scaling


更好的 quantization


sparsity


MoE


只計真正重要嘅參數


更高 memory bandwidth


更大 cluster


更有效 interconnect

呢啲全部都可以帶來 effective compute scaling。


而 Rubin 最值得你留意嘅,其實唔係「FP4」

而係:

Rubin 已經開始由「一粒 GPU 有幾多 FLOPS」轉向「整個 AI factory 可以產生幾多 tokens / intelligence」。

例如 Rubin 官方資料講:

  • HBM4:22 TB/s
  • NVLink:3.6 TB/s / GPU
  • 336 billion transistors
  • 50 PFLOPS NVFP4 inference
  • 35 PFLOPS NVFP4 training

(NVIDIA Developer)

而 NVIDIA 對 Vera Rubin 嘅定位亦已經係:

pre-training → post-training → test-time scaling → agentic inference

全部放入同一個 AI factory。(NVIDIA 投資人網站)

呢個其實同你頭先講嘅「scaling 仲有好多路」非常吻合。


所以我會將你個「三分之一」比喻修正成:

你唔可以話:

「FP4 → FP2 → FP1,所以仲有三分之二。」

因為冇辦法咁計。

但你可以話:

「AI 加速器嘅 scaling space,絕對唔係淨係剩低 precision scaling。」

呢句我完全同意。

因為 NVIDIA 而家自己已經將 scaling 拆成好多條軸:

Precision

× Compute density

× Memory bandwidth

× Interconnect

× Sparsity

× Architecture

× Cluster size

× Cooling / power

× Software

× Test-time compute

× Agentic inference

所以即使有一日:

FP4 真係已經接近 numerical floor

都唔代表:

AI compute scaling 完咗。


其實你個「大象 → 藍鯨」比喻,放喺呢度就好準

你原本以為係:

大象 → 更大隻大象 → 更大隻大象 → 頂。

但真正 NVIDIA 做緊嘅可能係:

大象 → 換咗生活環境 → 海洋 → 藍鯨

即係唔再只係:

「一粒 GPU 再大 20%。」

而係:

GPU → rack → NVL72 → POD → AI factory → million-GPU scale

NVIDIA 甚至已經公開講緊 million-GPU AI factories 同 optical networking。(NVIDIA Newsroom)

所以真正值得留意嘅係:

FP4 可能係 precision scaling 嘅一個重要低點,但唔係 AI scaling 嘅終點。

而且目前我搵唔到 NVIDIA 官方確認下一代所謂 「Feynman」一定係 FP2;所以呢部分我唔會當成已公布規格。截至目前公開資料,Rubin 明確係 NVFP4 + FP8;FP2/Feynman 就仍然唔應該當成已確認事實。