Fable 5 變笨?關鍵可能在推論配額
這份調查想釐清 Claude Fable 5 為何會「昨天很好用、今天卻變笨」。作者透過代理程式記錄 Claude Code 的傳輸資料,分析 65 個使用日、逾 4.3 萬次模型呼叫;結果顯示,即使用 xhigh 或 max effort,實際取得的 thinking tokens 仍可能很少,甚至為零。重點不是模型權重一定被削弱,而是使用者拿到的 inference regime,包括推理預算、路由與服務容量,可能隨時間改變。
現實應用
這對拿 Claude Code 做大型重構、除錯、研究或長時間 agent 任務的人最有感。作者統計整體每次呼叫的 thinking tokens 中位數只有 123,39.2% 呼叫沒有 thinking tokens;七月至八月的單次呼叫中位數則由 156 降至 77,單回合總量由 2,301 降至 1,797。若團隊用訂閱方案處理高風險工作,就不能只看模型名稱與 effort 選項,還要記錄每次輸出的推理量、成功率及重試情況。
期望評估
低標來看,我認為這份資料至少證明「主觀覺得變笨」可以轉成可觀測指標,也提醒大家 benchmark 的高推理配置不等於日常服務品質。高標來看,我猜這會推動供應商揭露實際推理配額、路由狀態與品質 SLA。不過這不是固定題庫的前後測,而是單一使用者的真實工作負載;任務難度、Claude Code 版本及工作型態都可能影響結果,尚不能直接斷言 Anthropic 主動 nerf 模型。
商業策略分析
最直接受影響的是付費訂閱者、AI coding 工具商與採購企業。商業上真正賣出去的不只是 model ID,而是穩定可重現的推論品質。我認為值得跟進,但現階段比較合理的做法是建立自家固定測試集、分開比較訂閱與 API 表現,並保留替代模型;若關鍵流程只靠品牌 benchmark 採購,風險會被低估。
延伸連結
註:原始長文與逐筆資料未能完整取得,數字主要依作者公開說明與討論頁整理,資料來源有限。