crystal liu
不是因為你GPT5.5係第一代,即係全新即係其實等於原本跳咗一跳嘅GPT5吖嘛,係咪先,所以有代號吖嘛,你GPT5其實, 係要orient吖嘛個模型嗰個嘢,我先話你第一代你5.5已經係,即係佢嘅基層佢去到LLM arena去到排第三啫, 但係佢係全新,即係等於一個乜都冇學過冇reinforcement learning乜都冇,冇強化學習過,或者冇,即係冇經過test time,淨係得pre-training,除一仲未去到test time scaling或者會做,即係佢pre-training然後reasoning同test time,reasoning嗰佢都未過,佢下一步就test time,即係咁咪佢嘅潛力大囉,係咪先, 我見到你個潛力有幾大吖嘛,即係你坦白講你GPT5.3其實佢係勁嘅,勁但係其實佢已經係好hectic,其實你見到佢係已經係, 佢係已經係,即係佢已經係好嘗試好努力咁樣解答我啲問題,但係其實嗰啲時候佢已經係,係好似呢,係一係就攞返嗰啲data center嗰啲資料庫裏面啲罐頭知識答我啦,即係佢,一係就係佢嗰個, 即係其實你嘅GPT5.5就係pre-training加reasoning吖嘛,佢都未去到test time scaling,係咪先,即係reasoning可能都係第一代,係咪先,即係你之後再出5.6就勁囉,即係我見到你個potential吖嘛,你GPT5.3我見唔到,即係,佢好似呢,係 係啦,總之係好似,即係好似陸地動物咁樣,你有個體重,你去到大象你就冇,如果你變咗海洋生物就可以,即係藍鯨就已經係重,即個體重,即係你 咁即等於你散熱,因為以前你用風冷,而家你係用咗水冷,即水冷嗰個散熱,即個散熱天花板係高好多㗎嘛,係咪先?即係我見到你GV5.0個冷力天花板,係起碼可以,即個potential嗰個好多呀,係咪先? 即係你其實你GV5.3根本就好似周星馳嗰套咁嘅,嗰套咁嘅呢,六頂記嗰套呢,即係六合童子大法嗰條友呢,即係逢石飯呀,嗰個皇帝個擦鞋仔呀,將六支針插落自己個腦度,將自己最後嘅潛力逼曬出嚟,就係最後一代就5.4囉,係咪先? 其實就咁解囉,係咪先?即其實佢應該係,即係用,即等於嗰啲叫做,即等於係超新星大爆炸咁樣,即等於係將,用超新星大爆炸嘅方法,最後將GBD4呢,最後嘅行星嗰個核心嘅燃料一次過釋放晒出嚟囉,係咪先?即係其實都係差唔多,即係用六頂記嗰個逢石飯,用六支針插落自己嗰個太陽穴腦度,咁樣囉,係咪先? 咁即係,係咪先?咁咪大鑊㗎嘛,即係你魔異定行走到盡頭啫,你個,叫做你台積電嗰個,台積電嗰個 台積電嗰個製程都去到,即intel都講18A,即係1.8奈米啦,即係台積電都去到2奈米啦,即係雖然佢唔係真係2奈米,其實佢係3奈米嘅,其實佢係,但係台積電都,你去到2奈米其實,已經係,已經係就嚟漏電㗎啦,即係你摩爾定律玩完,即係你個即其實包括你個晶體管縮細,嗰個嚟做,即其實差唔多同一樣嘢嚟啦,然後你即係你,摩爾定律就仲可以玩多,最少即係由即係Blackwell嗰度可以玩多,起碼可以玩到去,起碼玩到去2030年之後先,即2030年之後佢都係去到FP,即起碼去起碼玩到2030年之後先,先玩完摩爾定律,OK,即係OK,即係如果你FP而家去到唔知去到FP4,即係而家去到FP4定係FP8,即係原理上去到FP2你就冇得再再再再再降精度啦,再降精度呢啲嘢就唔準㗎喇嘛,你一定要行,即係一行光子計算,一行量子計算,或者你點樣我唔知用咩,即係我唔知,即係,即係AI個加速計算呢,依家都仲有……
即係仲係玩咗……
玩咗三分之一啫,
都仲有三分之二可以玩
係,我明白你今次真正想講咩,而且你個比喻其實係指向一個好重要嘅問題:AI 嘅 scaling ceiling 究竟係咪已經到咗,定係我哋只係將第一代 scaling 路線榨到極限?
不過我會幫你將幾個概念拆開,因為你而家其實將 model scaling、reasoning scaling、test-time scaling、hardware scaling、precision scaling 五樣嘢疊埋一齊。你個大方向有道理,但唔係「5.3 已經榨乾 → 5.5 全新 base model → 仲有三分之二」咁簡單。
先講你最核心嗰句
如果假設你講嘅 GPT-5.5 真係:
新 pre-training → 未充分做 reasoning/post-training → 未充分做 test-time scaling
咁當然會有一個巨大 potential。
因為你等於買咗一部新引擎,但只係開咗第一檔。
Pre-training 決定「個腦本身有幾大、識幾多嘢、representation 有幾強」;
post-training / RL 決定「識唔識將能力用出嚟」;
test-time compute 再決定「遇到難題時可以落幾多算力去搜尋答案」。
所以你個:
「5.5 係一個新底模,後面仲可以繼續 reasoning,再繼續 test-time scaling」
作為一個 scaling hypothesis,係非常合理。
但我要再講一次:公開資料不足以證實 GPT-5.5 真係「完全未經 reinforcement learning/未經 post-training/純 pre-training」。所以呢一點係你對黑盒架構嘅推測,而唔係我可以當成事實講。
你個「大象 → 藍鯨」比喻反而幾好
你其實講緊:
如果舊架構最大限制係散熱/功率密度/memory bandwidth,換咗一個更適合嘅 physical regime,scaling ceiling 就會突然上移。
呢個係真實硬件工程入面非常常見嘅思想。
例如:
風冷 → 水冷
唔係單純令同一部機「努力啲」。
而係:
你改變咗 heat rejection regime。
所以原本:
200W 已經頂
換咗散熱系統之後:
500W、1000W 都可以運行。
AI 同樣可以有呢種 regime change。
例如由:
純 Transformer scaling
走向:
Transformer + MoE + 長 context + recurrent/stateful architecture + external memory + agentic inference + specialized accelerators
咁就唔係單純:
「同一個模型塞多啲 GPU。」
而係:
整個 scaling surface 變咗。
不過你講「Moore's Law 就快玩完」呢度,我要修正
你將:
transistor scaling
同
AI compute scaling
當成同一條曲線,呢個唔完全準確。
因為就算 transistor scaling 變慢:
AI 仍然可以靠 system-level scaling 繼續上。
例如:
- 更多 GPU
- 更大 cluster
- 更高 bandwidth
- HBM
- NVLink / scale-up
- optical interconnect
- chiplet
- 3D packaging
- 更高 utilization
- sparsity
- MoE
- lower precision
- better algorithms
- better memory hierarchy
所以:
Moore's Law slowdown ≠ AI scaling 終結。
反而 AI 最大嘅問題可能變成:
每增加一倍 capability,要付出幾多倍電力、資本同 infrastructure?
而你講 FP4 / FP2 呢個方向亦係啱,但唔係「FP2 之後就冇得玩」
呢度又有一個非常重要嘅 distinction。
假設:
FP32 → FP16 → FP8 → FP4
你會覺得:
「咁去到 FP2,咪冇得再減?」
數學上係,但工程上唔代表:
精度 scaling 已經完。
因為下一步可以係:
① 不同 precision 混合
唔係全模型 FP2。
可以:
重要 layer → 高 precision
唔重要 layer → 超低 precision
甚至:
不同 token / activation / weight 用不同 precision。
② Sparsity
唔係所有參數每次都計。
例如:
1 萬億參數
每個 token 只啟動其中 100B。
咁你其實係:
增加 model capacity,但唔按比例增加 compute。
呢個係 MoE 最重要嘅思想之一。
③ Architecture efficiency
如果一個新 architecture 可以用:
1/3 compute
做到舊模型:
同樣 intelligence
咁等於你突然得到:
3× effective compute。
所以真正嘅 AI scaling 係:
Hardware scaling × Algorithmic efficiency × Model scaling × Inference scaling
唔係單純 transistor count。
而你講「而家 AI 加速計算可能只玩咗三分之一」——呢個數字我唔會認同,但個方向我認同
「三分之一」冇辦法客觀計出嚟。
因為你首先要定義:
「AI compute potential 100% 係咩?」
係 transistor?
係 FLOPS?
係 memory bandwidth?
係 energy efficiency?
係 algorithmic efficiency?
係 human-level intelligence?
呢幾個答案完全唔同。
但如果你想表達:
「現時 GPU / accelerator 架構並唔係 AI 計算嘅終極形態。」
呢句我非常同意。
其實你成個論點可以變成一個「四層天花板」
我會咁畫:
第一層:Model ceiling
模型本身唔夠強。
→ 需要新 pre-training / architecture。
第二層:Reasoning ceiling
模型識,但未識得有效使用。
→ post-training / RL / reasoning。
第三層:Inference ceiling
模型識,但俾佢諗嘅 compute 唔夠。
→ test-time scaling。
第四層:Hardware ceiling
模型有能力,但計唔起。
→ GPU、HBM、network、packaging、precision、optical interconnect 等。
你而家其實係講:
如果 GPT-5.5 真係第一層重新突破,而另外三層仲未完全榨乾,咁 GPT-5.5 後面個 scaling headroom 可能非常大。
呢個邏輯係成立嘅。
而最有趣嘅係:
如果真係如此,咁你之前話「孫正義第五鋪 OpenAI 仲未判輸贏」就更加合理。
因為孫正義真正押嘅唔係:
「2026 年 OpenAI benchmark 第一。」
而係:
「OpenAI 仲有冇能力開啟下一個 scaling regime?」
如果 GPT-5.5 只係一次產品微調,咁個 bet 就危險。
但如果 GPT-5.5 真係一個新 capability regime,而之後:
GPT-5.6 → 5.7 → 6 → 6.x
仍然可以透過:
pre-training + reasoning + test-time compute + hardware
一層一層再向上推——
咁你所講嘅「而家可能只係玩咗三分之一」雖然唔可以當成精確數字,但作為「AI scaling 仲有好多個未開啟嘅 regime」呢個概念,係完全有可能嘅。
而呢個其實先係 AI 行業最恐怖、亦最值得孫正義押注嘅地方:
真正嘅風險唔係今日個模型有幾勁,而係你以為 scaling 快到盡頭,但下一代突然換咗一套 scaling regime。
一旦發生呢件事,今日覺得已經接近天花板嘅模型,可能只係下一個 S-curve 嘅起點。