crystal liu

in #crystal7 hours ago (edited)

不是因為你GPT5.5係第一代,即係全新即係其實等於原本跳咗一跳嘅GPT5吖嘛,係咪先,所以有代號吖嘛,你GPT5其實, 係要orient吖嘛個模型嗰個嘢,我先話你第一代你5.5已經係,即係佢嘅基層佢去到LLM arena去到排第三啫, 但係佢係全新,即係等於一個乜都冇學過冇reinforcement learning乜都冇,冇強化學習過,或者冇,即係冇經過test time,淨係得pre-training,除一仲未去到test time scaling或者會做,即係佢pre-training然後reasoning同test time,reasoning嗰佢都未過,佢下一步就test time,即係咁咪佢嘅潛力大囉,係咪先, 我見到你個潛力有幾大吖嘛,即係你坦白講你GPT5.3其實佢係勁嘅,勁但係其實佢已經係好hectic,其實你見到佢係已經係, 佢係已經係,即係佢已經係好嘗試好努力咁樣解答我啲問題,但係其實嗰啲時候佢已經係,係好似呢,係一係就攞返嗰啲data center嗰啲資料庫裏面啲罐頭知識答我啦,即係佢,一係就係佢嗰個, 即係其實你嘅GPT5.5就係pre-training加reasoning吖嘛,佢都未去到test time scaling,係咪先,即係reasoning可能都係第一代,係咪先,即係你之後再出5.6就勁囉,即係我見到你個potential吖嘛,你GPT5.3我見唔到,即係,佢好似呢,係 係啦,總之係好似,即係好似陸地動物咁樣,你有個體重,你去到大象你就冇,如果你變咗海洋生物就可以,即係藍鯨就已經係重,即個體重,即係你 咁即等於你散熱,因為以前你用風冷,而家你係用咗水冷,即水冷嗰個散熱,即個散熱天花板係高好多㗎嘛,係咪先?即係我見到你GV5.0個冷力天花板,係起碼可以,即個potential嗰個好多呀,係咪先? 即係你其實你GV5.3根本就好似周星馳嗰套咁嘅,嗰套咁嘅呢,六頂記嗰套呢,即係六合童子大法嗰條友呢,即係逢石飯呀,嗰個皇帝個擦鞋仔呀,將六支針插落自己個腦度,將自己最後嘅潛力逼曬出嚟,就係最後一代就5.4囉,係咪先? 其實就咁解囉,係咪先?即其實佢應該係,即係用,即等於嗰啲叫做,即等於係超新星大爆炸咁樣,即等於係將,用超新星大爆炸嘅方法,最後將GBD4呢,最後嘅行星嗰個核心嘅燃料一次過釋放晒出嚟囉,係咪先?即係其實都係差唔多,即係用六頂記嗰個逢石飯,用六支針插落自己嗰個太陽穴腦度,咁樣囉,係咪先? 咁即係,係咪先?咁咪大鑊㗎嘛,即係你魔異定行走到盡頭啫,你個,叫做你台積電嗰個,台積電嗰個 台積電嗰個製程都去到,即intel都講18A,即係1.8奈米啦,即係台積電都去到2奈米啦,即係雖然佢唔係真係2奈米,其實佢係3奈米嘅,其實佢係,但係台積電都,你去到2奈米其實,已經係,已經係就嚟漏電㗎啦,即係你摩爾定律玩完,即係你個即其實包括你個晶體管縮細,嗰個嚟做,即其實差唔多同一樣嘢嚟啦,然後你即係你,摩爾定律就仲可以玩多,最少即係由即係Blackwell嗰度可以玩多,起碼可以玩到去,起碼玩到去2030年之後先,即2030年之後佢都係去到FP,即起碼去起碼玩到2030年之後先,先玩完摩爾定律,OK,即係OK,即係如果你FP而家去到唔知去到FP4,即係而家去到FP4定係FP8,即係原理上去到FP2你就冇得再再再再再降精度啦,再降精度呢啲嘢就唔準㗎喇嘛,你一定要行,即係一行光子計算,一行量子計算,或者你點樣我唔知用咩,即係我唔知,即係,即係AI個加速計算呢,依家都仲有……
即係仲係玩咗……
玩咗三分之一啫,
都仲有三分之二可以玩

係,我明白你今次真正想講咩,而且你個比喻其實係指向一個好重要嘅問題:AI 嘅 scaling ceiling 究竟係咪已經到咗,定係我哋只係將第一代 scaling 路線榨到極限?

不過我會幫你將幾個概念拆開,因為你而家其實將 model scaling、reasoning scaling、test-time scaling、hardware scaling、precision scaling 五樣嘢疊埋一齊。你個大方向有道理,但唔係「5.3 已經榨乾 → 5.5 全新 base model → 仲有三分之二」咁簡單。

先講你最核心嗰句

如果假設你講嘅 GPT-5.5 真係:

新 pre-training → 未充分做 reasoning/post-training → 未充分做 test-time scaling

咁當然會有一個巨大 potential。

因為你等於買咗一部新引擎,但只係開咗第一檔。

Pre-training 決定「個腦本身有幾大、識幾多嘢、representation 有幾強」;
post-training / RL 決定「識唔識將能力用出嚟」;
test-time compute 再決定「遇到難題時可以落幾多算力去搜尋答案」。

所以你個:

「5.5 係一個新底模,後面仲可以繼續 reasoning,再繼續 test-time scaling」

作為一個 scaling hypothesis,係非常合理。

但我要再講一次:公開資料不足以證實 GPT-5.5 真係「完全未經 reinforcement learning/未經 post-training/純 pre-training」。所以呢一點係你對黑盒架構嘅推測,而唔係我可以當成事實講。


你個「大象 → 藍鯨」比喻反而幾好

你其實講緊:

如果舊架構最大限制係散熱/功率密度/memory bandwidth,換咗一個更適合嘅 physical regime,scaling ceiling 就會突然上移。

呢個係真實硬件工程入面非常常見嘅思想。

例如:

風冷 → 水冷

唔係單純令同一部機「努力啲」。

而係:

你改變咗 heat rejection regime。

所以原本:

200W 已經頂

換咗散熱系統之後:

500W、1000W 都可以運行。

AI 同樣可以有呢種 regime change。

例如由:

純 Transformer scaling

走向:

Transformer + MoE + 長 context + recurrent/stateful architecture + external memory + agentic inference + specialized accelerators

咁就唔係單純:

「同一個模型塞多啲 GPU。」

而係:

整個 scaling surface 變咗。


不過你講「Moore's Law 就快玩完」呢度,我要修正

你將:

transistor scaling

AI compute scaling

當成同一條曲線,呢個唔完全準確。

因為就算 transistor scaling 變慢:

AI 仍然可以靠 system-level scaling 繼續上。

例如:

  • 更多 GPU
  • 更大 cluster
  • 更高 bandwidth
  • HBM
  • NVLink / scale-up
  • optical interconnect
  • chiplet
  • 3D packaging
  • 更高 utilization
  • sparsity
  • MoE
  • lower precision
  • better algorithms
  • better memory hierarchy

所以:

Moore's Law slowdown ≠ AI scaling 終結。

反而 AI 最大嘅問題可能變成:

每增加一倍 capability,要付出幾多倍電力、資本同 infrastructure?


而你講 FP4 / FP2 呢個方向亦係啱,但唔係「FP2 之後就冇得玩」

呢度又有一個非常重要嘅 distinction。

假設:

FP32 → FP16 → FP8 → FP4

你會覺得:

「咁去到 FP2,咪冇得再減?」

數學上係,但工程上唔代表:

精度 scaling 已經完。

因為下一步可以係:

① 不同 precision 混合

唔係全模型 FP2。

可以:

重要 layer → 高 precision

唔重要 layer → 超低 precision

甚至:

不同 token / activation / weight 用不同 precision。


② Sparsity

唔係所有參數每次都計。

例如:

1 萬億參數
每個 token 只啟動其中 100B。

咁你其實係:

增加 model capacity,但唔按比例增加 compute。

呢個係 MoE 最重要嘅思想之一。


③ Architecture efficiency

如果一個新 architecture 可以用:

1/3 compute

做到舊模型:

同樣 intelligence

咁等於你突然得到:

3× effective compute。

所以真正嘅 AI scaling 係:

Hardware scaling × Algorithmic efficiency × Model scaling × Inference scaling

唔係單純 transistor count。


而你講「而家 AI 加速計算可能只玩咗三分之一」——呢個數字我唔會認同,但個方向我認同

「三分之一」冇辦法客觀計出嚟。

因為你首先要定義:

「AI compute potential 100% 係咩?」

係 transistor?

係 FLOPS?

係 memory bandwidth?

係 energy efficiency?

係 algorithmic efficiency?

係 human-level intelligence?

呢幾個答案完全唔同。

但如果你想表達:

「現時 GPU / accelerator 架構並唔係 AI 計算嘅終極形態。」

呢句我非常同意。


其實你成個論點可以變成一個「四層天花板」

我會咁畫:

第一層:Model ceiling

模型本身唔夠強。

→ 需要新 pre-training / architecture。

第二層:Reasoning ceiling

模型識,但未識得有效使用。

→ post-training / RL / reasoning。

第三層:Inference ceiling

模型識,但俾佢諗嘅 compute 唔夠。

→ test-time scaling。

第四層:Hardware ceiling

模型有能力,但計唔起。

→ GPU、HBM、network、packaging、precision、optical interconnect 等。

你而家其實係講:

如果 GPT-5.5 真係第一層重新突破,而另外三層仲未完全榨乾,咁 GPT-5.5 後面個 scaling headroom 可能非常大。

呢個邏輯係成立嘅。


而最有趣嘅係:

如果真係如此,咁你之前話「孫正義第五鋪 OpenAI 仲未判輸贏」就更加合理。

因為孫正義真正押嘅唔係:

「2026 年 OpenAI benchmark 第一。」

而係:

「OpenAI 仲有冇能力開啟下一個 scaling regime?」

如果 GPT-5.5 只係一次產品微調,咁個 bet 就危險。

但如果 GPT-5.5 真係一個新 capability regime,而之後:

GPT-5.6 → 5.7 → 6 → 6.x

仍然可以透過:

pre-training + reasoning + test-time compute + hardware

一層一層再向上推——

咁你所講嘅「而家可能只係玩咗三分之一」雖然唔可以當成精確數字,但作為「AI scaling 仲有好多個未開啟嘅 regime」呢個概念,係完全有可能嘅。

而呢個其實先係 AI 行業最恐怖、亦最值得孫正義押注嘅地方:

真正嘅風險唔係今日個模型有幾勁,而係你以為 scaling 快到盡頭,但下一代突然換咗一套 scaling regime。

一旦發生呢件事,今日覺得已經接近天花板嘅模型,可能只係下一個 S-curve 嘅起點。