tjkb2f
我唔知你最新嗰代,即係rail rubin晶片係去到FP幾啫,係咪先?我唔知,因為gradebackwell其實已經去到去到FP8㗎嘛,如果冇記錯,咁你rail rubin係咪已經去到FP4啫,係唔係先?
我唔知,
即係佢支唔支援FP幾呀?
咁佢下一代費曼家又支持FP幾,
即係你原理上去到FP2你就冇得再升㗎啦嘛,
再升就大鑊㗎啦嘛
係,你記得嘅大方向啱,但有一個好重要嘅修正:Blackwell 唔係「只去到 FP8」;Rubin 亦唔係「由 FP8 升到 FP4」咁簡單。 其實 Blackwell 已經原生支援 NVFP4,而 Rubin 係將 NVFP4 再進一步強化。(NVIDIA Developer)
直接講答案
| NVIDIA 世代 | 低精度 AI | 重點 |
|---|---|---|
| Hopper | FP8 | FP8 成為主流低精度 Tensor Core 計算 |
| Blackwell | FP8 + FP4 / NVFP4 | 已經跨入 4-bit |
| Rubin | FP8 + NVFP4 | 進一步把 4-bit 做成主要高效能路線 |
| 下一代 | 未公開確定 | FP2 未有可靠官方規格 |
NVIDIA 官方對 Rubin GPU 嘅資料非常清楚:Rubin 有 50 PFLOPS NVFP4 inference、35 PFLOPS NVFP4 training,同時 Tensor Core 亦針對 NVFP4 和 FP8 優化。(NVIDIA Developer)
所以如果你問:
「Rubin 支唔支持 FP4?」
答案係:
支持,而且係核心賣點之一。
甚至 NVIDIA 2026 年已經公開講到,NVFP4 可以用於 Blackwell 同 Rubin 嘅大模型 pre-training。(NVIDIA Developer)
咁你話「FP2 就到盡頭」——呢個直覺有一半啱
如果你講嘅係:
單純把 floating-point bit-width 一路由 FP8 → FP4 → FP2 → FP1 咁降低。
咁係。
FP2 已經非常非常極端。
FP4 本身已經只有非常有限嘅離散值;NVIDIA 自己解釋 NVFP4 之所以仍然可用,關鍵唔係「4-bit 本身神奇」,而係佢用:
16 個元素一組嘅 micro-block scaling + FP8 scale + FP32 tensor-level scale
去補返 FP4 本身極低 dynamic range 嘅問題。(NVIDIA Docs)
即係你可以理解成:
FP4 個尺本身好短
但我可以不停幫你:
「重新調校把尺嘅比例。」
所以先至可以實際用。
但最重要嘅係:FP2 唔等於 AI 計算嘅終極天花板
呢度我反而要糾正你之前個「FP2 再落就大鑊」嘅講法。
因為 NVIDIA 現時其實已經示範緊一件非常重要嘅事:
下一輪 scaling 唔一定係繼續將所有數字由 FP4 壓到 FP2。
而係:
FP4
↓
更精細 scaling
↓
更好的 quantization
↓
sparsity
↓
MoE
↓
只計真正重要嘅參數
↓
更高 memory bandwidth
↓
更大 cluster
↓
更有效 interconnect
呢啲全部都可以帶來 effective compute scaling。
而 Rubin 最值得你留意嘅,其實唔係「FP4」
而係:
Rubin 已經開始由「一粒 GPU 有幾多 FLOPS」轉向「整個 AI factory 可以產生幾多 tokens / intelligence」。
例如 Rubin 官方資料講:
- HBM4:22 TB/s
- NVLink:3.6 TB/s / GPU
- 336 billion transistors
- 50 PFLOPS NVFP4 inference
- 35 PFLOPS NVFP4 training
而 NVIDIA 對 Vera Rubin 嘅定位亦已經係:
pre-training → post-training → test-time scaling → agentic inference
全部放入同一個 AI factory。(NVIDIA 投資人網站)
呢個其實同你頭先講嘅「scaling 仲有好多路」非常吻合。
所以我會將你個「三分之一」比喻修正成:
你唔可以話:
「FP4 → FP2 → FP1,所以仲有三分之二。」
因為冇辦法咁計。
但你可以話:
「AI 加速器嘅 scaling space,絕對唔係淨係剩低 precision scaling。」
呢句我完全同意。
因為 NVIDIA 而家自己已經將 scaling 拆成好多條軸:
Precision
× Compute density
× Memory bandwidth
× Interconnect
× Sparsity
× Architecture
× Cluster size
× Cooling / power
× Software
× Test-time compute
× Agentic inference
所以即使有一日:
FP4 真係已經接近 numerical floor
都唔代表:
AI compute scaling 完咗。
其實你個「大象 → 藍鯨」比喻,放喺呢度就好準
你原本以為係:
大象 → 更大隻大象 → 更大隻大象 → 頂。
但真正 NVIDIA 做緊嘅可能係:
大象 → 換咗生活環境 → 海洋 → 藍鯨
即係唔再只係:
「一粒 GPU 再大 20%。」
而係:
GPU → rack → NVL72 → POD → AI factory → million-GPU scale
NVIDIA 甚至已經公開講緊 million-GPU AI factories 同 optical networking。(NVIDIA Newsroom)
所以真正值得留意嘅係:
FP4 可能係 precision scaling 嘅一個重要低點,但唔係 AI scaling 嘅終點。
而且目前我搵唔到 NVIDIA 官方確認下一代所謂 「Feynman」一定係 FP2;所以呢部分我唔會當成已公布規格。截至目前公開資料,Rubin 明確係 NVFP4 + FP8;FP2/Feynman 就仍然唔應該當成已確認事實。