Jev 把 LLM 變成決策引擎

2026/09/22(二) 07:09・精選・原始出處

Jev 是 TypeSafe AI 提出的「System One model」,但把它理解成 Decision Model 更直接:輸入文字或半結構化資料,輸出不是回答,而是分類、分數與信心值。它支援是非、選項及區間評分,適合把 LLM 的語意理解直接接進程式流程;首款模型只按輸入計費,每百萬 token 為 0.042 美元,問題還能平行處理。

現實應用

最實際的場景是垃圾訊息判定、自動標籤、案件優先級、內容排序與搜尋 reranking。例如先用 BM25 找出 100 筆候選資料,再讓 Jev 判斷各結果和查詢的相關程度。客服、內容平台、電商及內部知識搜尋團隊都用得上,尤其適合只需要決策、不需要生成文案的後端流程。

期望評估

我認為低標期望,是用很低的成本替既有規則引擎補上一層語意分類,減少大量手寫條件,並快速跑數百到數千筆 eval。高標期望則是成為應用程式裡的通用決策 API:開發者描述目前狀態與問題,就能取得型別固定、方便運算的機率結果。不過它不會說明判斷依據,因此高風險決策不能只看單一分數。

商業策略分析

這會影響提供文字分類、搜尋排序與傳統 AutoML 的服務商,也替 LLM 業者打開「不賣生成文字、改賣決策」的新產品線。我猜真正價值不只在便宜,而是輸出穩定、容易接入既有系統;若分類量大,值得做小規模驗證。反過來,招募、授信等涉及公平性的用途要非常保守,黑箱分數可能把模型偏見一起藏起來,導入前必須建立資料切片、偏差測試與人工覆核。

實作細節

呼叫時先建立 state,內容可為字串、字串陣列或鍵值資料,再附上一個或多個問題。Noul 題回傳 0 到 1 的真實機率;Choice 題提供各選項的機率分布;Score 題依帶有描述的數值級距回傳分數。多題會平行評估,適合一次完成多項標註。已知限制是只有數值結果,無法可靠追查哪些內容訊號影響判斷。

延伸連結