模型推薦 / 推薦方法
選型的單位,
是一件完成的工作。
本站依工作用途整理候選模型,再看價格與證據限制。推薦是編輯判斷,不是 benchmark 排名,也不是由幾個分數加權得到的綜合分。
目前資料核對日為 2026-10-02,涵蓋 17 個候選、35 個來源與 5 種用途。涵蓋九家廠商的文字 API 候選。依公開評測分析、原廠文件與價格形成本站用途建議;不是全市場能力排名,可靠性尚待工作樣本驗證。
先分用途,再看證據
整理與摘要、翻譯與寫作、程式開發、研究推理及 Agent 工作分開判斷。省錢候選適合先試可快速驗收的小工作;日常主力是較複雜工作的起點;難題升級只在任務難度或重試成本值得時考慮。資料不足時保留空位,不強迫填滿每個選項。
用途理由來自已列出的公開評測分析、原廠文件和價格資訊。高推理設定的評測表現不能套用到低推理成本,也不能推算本站日常任務成功率。
證據類型各自支持不同結論
| 證據 | 能支持什麼 | 限制 |
|---|---|---|
| 外部評測 | 指定資料集、提示、工具和推理設定下的結果 | 不同版本與框架不直接混比;評測分數不是日常成功率。 |
| 原廠文件或報告 | 廠商公布的模型規格、定位與價格 | 需標示為原廠資訊,不是本站獨立驗證。 |
| 本站經驗 | 本站具體工作樣本的驗收情況 | 需要樣本數、全部嘗試、用量與驗收條件。 |
| 社群回報 | 值得進一步查核的問題 | 保留連結、日期、版本與情境,不能直接換算錯誤率。 |
本站目前沒有足夠的工作樣本估算首次成功率、平均重試或每個成功任務成本。沒有樣本就標示尚未實測,不依單價、benchmark 或網路印象補數字。
單次 API 費用不是完成成本
成本頁以原廠標準付費文字 API 價格估算指定輸入、輸出 token 和已知工具費。結果只表示這組用量假設下的單次請求費用,不代表一件工作會成功,也不含規劃、重試、修正或人工驗收。
價格查核日不是生效日。分時價格與已確認的上下文級距會在模型資料中註明;超出已確認範圍就停止試算。快取、稅金、促銷和未填入的工具費不會自行補成估值。若推理計費尚未確認,頁面會標示限制。
來源價格超過 72 小時未重新查核時,試算頁會顯示提醒。更新來源頁不等於本站已人工確認新價格。
來源引用與資料接入
本站參考 Artificial Analysis 公開分析和原廠文件,保留來源、閱讀日期及參考設定,不匯出其原始分數、圖表或榜單順序。LiveBench、SWE-bench 和 Artificial Analysis 的完整資料接入須另外確認來源條件;評測程式的開源授權不直接代表榜單資料可再發布。
描述公開資料時會區分事實、來源分析與本站自己的推薦理由。必要引用用於支持本文論述並標示來源,不整批重製榜單或圖表。可參考智慧財產局說明及引用要件。
查核與更新
來源頁面與模型識別資訊會定期檢查;價格解析或來源結構異常時保留上次核對值並提出審核需求,不以新的檢查時間掩蓋舊價格。來源取得成功不代表內容已人工查核。新模型、用途理由、價格結構與推薦等級需核對後更新,不因單次評測變動自動升降級。