LFM2.5 把本機 Agent 塞進手機

2026/08/04(二) 21:58・精選・原始出處

Liquid AI 的 LFM2.5-2.6B,是一款把 Agent 直接放進筆電、手機與邊緣裝置的小型模型。它以約 34T tokens 預訓練,將 context window 延伸到 128K,再透過 SFT、領域教師模型、MOPD 蒸餾與 Agentic RL,學會工具呼叫、網路搜尋及多步驟工作。官方測試顯示記憶體需求不到 2.5GB,在 Apple M5 Max 可達 220 tokens/s、Ryzen AI Max+ 395 約 113 tokens/s,實際能拿來做本機研究助理、自動化操作與隱私資料處理。

現實應用

適合需要大量執行、資料不能離開裝置,又不想一直支付雲端推論費的團隊,例如企業內部查詢、門市終端、個人知識庫、手機助理與離線設備。它支援 llama.cpp、MLX、vLLM、SGLang、ONNX,也比較容易接進 OpenClaw、Hermes Agent 等既有 Agent harness。

期望評估

我認為低標期望,是用一般電腦取得反應夠快、能穩定遵循指令與呼叫工具的本機 Agent;即使任務複雜度有限,也能省下一部分 API 成本並降低資料外流風險。

我猜高標期望,是讓 App 直接內建可離線運作的工作代理,在手機上完成搜尋、整理、表單操作與跨工具流程。官方 benchmark 顯示它在多項 instruction following、tool use 測試能與大約四倍尺寸的模型競爭,但這仍需用自家流程重新驗證。

商業策略分析

受影響最大的會是依賴雲端小模型 API 的自動化服務,以及開發邊緣 AI 的硬體與軟體商。我認為它的意義不是全面取代大型模型,而是把高頻、規則明確、涉及隱私的工作移到本機,大模型只處理真正困難的部分。值得先做 PoC,尤其是呼叫量大或網路不穩的產品;純程式開發代理則不宜急著替換,因為官方也承認 coding 仍明顯落後較大的模型。

實作細節

安裝需使用 transformers>=5.0.0pip install -U transformers,再以 AutoModelForCausalLM.from_pretrained("LiquidAI/LFM2.5-2.6B") 載入。相容 GPU 可啟用 FlashAttention 2;不想安裝也能直接開 WebGPU demo。已知限制除了 coding 較弱,手機速度、記憶體與 128K 長上下文的實際表現,也會受到量化方式和硬體影響。

延伸連結