crystal liu
我想問,
Anthropic係佢Fable 5勁,
即係Fable 5即係,
嗯,
即係佢Mythos 5就最勁,
Fable 5就係即係像男人咁樣冇咗一個X染色體冇咗生育能力嘅性能版,
咁佢開放畀免費用戶用嘅,
Sonnet 5勁啲定係Opus 4.8勁啲?
因為Opus 4.7呢,
我唔知,
應該Opus 4.7就係,
即係Opus 4.8同Opus 4.7都係,
到依家都仲未開放,
即係都係要畀錢先用到,
即係都係免費用戶用唔到,
都仲未開放畀免費用戶嘅使用啦,
咁即係畀免費用戶使用最高階嘅模型Sonnet 5勁定係Opus 4.8勁啲呢?
如果淨係講能力,答案其實幾明確:
Opus 4.8 > Sonnet 5
但個差距,已經細到比以前細好多。
可以咁理解:
- 🥇 Mythos 5(最高層)
- 🥈 Fable 5
- 🥉 Opus 4.8
- 4️⃣ Sonnet 5
- 5️⃣ Sonnet 4.6
- 6️⃣ Haiku 4.5
呢個大概就係而家 Anthropic 嘅能力梯隊。(Anthropic)
點解仲要保留 Opus 4.8?
原因有幾個:
最困難推理
- Opus 4.8仍然係旗艦級模型。
最高可靠性
- 對法律、科研、企業等高風險工作,Anthropic仍然主推 Opus。(Anthropic)
Agent 長任務
- 做幾十步甚至上百步嘅任務,Opus通常更穩。
Sonnet 5 去到咩程度?
呢個先係重點。
Anthropic今次推出 Sonnet 5,其實個定位就係:
用大約三四成成本,做到九成幾 Opus 嘅能力。
官方同第三方測試都指出:
- 大部分 benchmark 已經非常接近 Opus 4.8。
- 有少數 Agent benchmark(例如 Terminal-Bench)甚至略勝 Opus 4.8。
- 不過整體推理、複雜分析、最難問題,Opus 4.8仍然保持優勢。(Vellum)
免費用戶角度
如果你問:
「免費可以用到最高級係乜?」
答案就係:
✅ Sonnet 5。
而且佢已經勁到:
- 日常問答:★★★★★
- Coding:★★★★★
- 長文分析:★★★★★
- Agent:★★★★★
- 超高難推理:★★★★☆(Opus 仲好少少)
如果用你個比喻
你之前個比喻幾有趣,我可以稍微修正一下:
- Mythos 5:完全體。
- Fable 5:性能版,接近完全體,但有部分能力限制。
- Opus 4.8:上一代皇牌旗艦,火力仍然非常強。
- Sonnet 5:將 Opus 大部分能力濃縮落一個更平、更快、更普及嘅版本。
所以,如果以百分比去形容(只係方便理解,唔係官方數字):
- Mythos 5:100
- Fable 5:97–99
- Opus 4.8:95
- Sonnet 5:90–94
即係 Sonnet 5 已經追到 Opus 4.8 後面,但未正式超越佢。對絕大部分免費用戶嚟講,Sonnet 5 已經係一個非常高水平嘅模型;只有遇到最複雜、最高要求嘅推理同專業工作時,Opus 4.8 先至會明顯佔優。(Vellum)