LLM 模型選型
整理模型評測與成本的比較方法;模型資料公開時,可依工作用途檢視候選。
為什麼做
只看特定評測的分數,無法知道指定工作是否成功;只看 token 單價,也無法知道完成工作可能花多少。評測平均每題成本描述的是評測當時的費用,不是處理個人任務的實際支出。
設計前提
把評測表現、評測平均每題成本與原廠 token 價格分開呈現,再依用途和明確的用量假設一起比較。分數不換算成成功率,評測成本也不當作個人任務的總額。
證據怎麼處理
評測分數須連同來源、版本與設定理解,只代表特定測試下的結果。供應商提供的價格與模型資料要標出來源,不與外部評測結果混成一項證據。本站沒有公開自有模型測試成績;外部榜單資料在再利用授權與版本確認前,也不會據此發布排名或推薦。
工具提供的操作
在核准的模型資料可用時,工具介面支援依用途檢視候選、搜尋與篩選模型、比較評測分數和成本、查看效率前緣,以及按指定 token 用量估算 API 請求費用。模型資料目前尚未公開啟用,因此這些介面能力不代表目前有可選模型或可用推薦。
目前限制
評測分數不是成功率;特定評測也不能直接推定繁體中文寫作、翻譯品質或一般 Agent 能力。成本試算仰賴填入的 token 和價格假設,不包含未填入的搜尋、工具呼叫、快取儲存、稅金與其他費用。請查看模型選型工具的資料狀態,以及比較方法對證據、價格與試算範圍的說明。