先試在易驗收的文字與資料整理,控制批量工作預算。
- 適合先試
- 格式轉換、分類、簡單抽取與一般翻譯的初步候選。
- 何時升級
- 遇到多重限制、專業術語或需要交叉查證時,改用較強候選並人工驗收。
- 價格
- 輸入 $0.3 · 輸出 $2.5 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
用途建議:Markdown・整理・摘要(省錢候選) 翻譯・一般寫作(省錢候選)
原廠定位支持輕量處理與翻譯;本站尚無繁體中文盲測,也無首次成功率或重試紀錄。
價格查核 2026-10-02。原廠 Standard 付費文字 API;不含快取儲存、工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
低成本的程式與日常文字候選,適合有明確檢查方式的小任務。
- 適合先試
- Markdown 整理、小型程式修正、有測試或明確輸出格式的子任務。
- 何時升級
- 錯誤原因涉及多個檔案、修正反覆失敗或需求含糊時,升級主力候選。
- 價格
- 輸入 $1 · 輸出 $5 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
用途建議:Markdown・整理・摘要(日常主力) 程式開發・除錯(省錢候選) Agent 程式工作(省錢候選)
原廠 coding 評測使用特定 scaffold 與高推理預算;不能套用為一般設定的錯誤率或單次成本。沒有本站實測可靠性。
價格查核 2026-10-02。原廠標準全球 API;本站僅試算 200k 輸入以內;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
先作為程式除錯與多步工作主力候選,再用自己的任務驗證值不值得。
- 適合先試
- 多檔案除錯、需求整理、較複雜的指令與工具工作。
- 何時升級
- 需要跨長文件整合、複雜推理或主力候選已無進展時,試難題候選。
- 價格
- 輸入 $2 · 輸出 $10 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
用途建議:翻譯・一般寫作(日常主力) 程式開發・除錯(日常主力) 論文分析・複雜推理(日常主力) Agent 程式工作(日常主力)
原廠能力定位不是本站實測;沒有同提示、同 effort 下的跨模型重試比較。繁體中文品質未另驗證。
價格查核 2026-10-02。原廠標準全球 API;本站僅試算 200k 輸入以內;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
把較高單價留給難題候選,而不是每次格式整理都直接使用。
- 適合先試
- 困難除錯、長文件分析、需要多步整合與推理的候選工作。
- 何時升級
- 已是本頁的難題候選;若仍失敗,重新界定問題、補足資料或找專業協助。
- 價格
- 輸入 $4 · 輸出 $20 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
用途建議:程式開發・除錯(難題升級) 論文分析・複雜推理(難題升級) Agent 程式工作(難題升級)
較高價格不保證更少錯誤;本站沒有證據證明其每個成功任務更便宜,也不宣稱是全市場能力上限。
價格查核 2026-10-02。原廠標準全球 API;本站僅試算 200k 輸入以內;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
讓低單價處理可快速驗收的小任務,限制重試次數。
- 適合先試
- 格式轉換、分類、短文抽取與可檢查的批量工作。
- 何時升級
- 多檔案除錯或兩次修正仍無進展時,改用 Sol/Sonnet。
- 價格
- 輸入 $0.1 · 輸出 $0.5 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
本站未驗證首次成功率;ChatGPT/Codex 介面體驗不能直接當作標準 API 的錯誤率。
價格查核 2026-10-02。Standard 全球文字 API;本站限制輸入加計費輸出合計 200k 以內,不含快取寫入、工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
一般開發與工具工作的主力候選,不必每次都用最高推理。
- 適合先試
- 程式開發、需求拆解、可驗證的多步工具工作。
- 何時升級
- 卡在難解根因或跨領域推理時,再試 Astra/Opus。
- 價格
- 輸入 $2 · 輸出 $10 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
本站未驗證首次成功率;ChatGPT/Codex 介面體驗不能直接當作標準 API 的錯誤率。
價格查核 2026-10-02。Standard 全球文字 API;本站限制輸入加計費輸出合計 200k 以內,不含快取寫入、工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
保留給既有流程比較;新整合優先評估同價的 6.1 Sol。
- 適合先試
- 已驗收的既有程式與 Agent 工作流程。
- 何時升級
- 以同一任務比較 6.1 Sol,再決定是否遷移。
- 價格
- 輸入 $2 · 輸出 $10 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
本站未驗證首次成功率;ChatGPT/Codex 介面體驗不能直接當作標準 API 的錯誤率。
價格查核 2026-10-02。Standard 全球文字 API;本站限制輸入加計費輸出合計 200k 以內,不含快取寫入、工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
把高預算留給難解問題,先設定停止與驗收條件。
- 適合先試
- 困難除錯、跨長文件整合、複雜推理與研究。
- 何時升級
- 主力失敗且預期修正價值高時才選用;仍失敗就補足證據與問題定義。
- 價格
- 輸入 $10 · 輸出 $50 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
本站未驗證首次成功率;ChatGPT/Codex 介面體驗不能直接當作標準 API 的錯誤率。
價格查核 2026-10-02。Standard 全球文字 API;本站限制輸入加計費輸出合計 200k 以內,不含快取寫入、工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
Opus 已不夠時再提高預算,不把最高價當作日常預設。
- 適合先試
- 艱難研究、長時間 Agent 與主力已無進展的推理。
- 何時升級
- 先比較 Opus 在較高 effort 的表現;Fable 仍失敗就重新拆解任務。
- 價格
- 輸入 $10 · 輸出 $50 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
原廠建議多數工作先用 Opus;不同 effort 與框架不能當成相同品質。
價格查核 2026-10-02。原廠標準全球 API;本站僅試算 200k 輸入以內;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
Google 生態系的程式與工具工作候選。
- 適合先試
- 結構化文件、開發工具、多步需求處理。
- 何時升級
- 複雜推理或反覆修正失敗時,與 Sol/Sonnet/Opus 比較。
- 價格
- 尚未納入:原廠有截至 2026-12-31 的限期價格。本頁標準價試算不混入促銷,暫不加入成本比較;請查看原廠當期價格。
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
原廠能力定位尚未經本站繁體中文或 Agent 樣本驗證。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
先用在可跑測試的程式與資料子任務,觀察實際 token 與重試。
- 適合先試
- 小型修正、結構化抽取、可核對的推理草稿。
- 何時升級
- 上下文依賴複雜或回圈重試時,升級主力候選。
- 價格
- 輸入 $0.3 · 輸出 $1.2 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
別名可能更新底層版本;尖峰與離峰單價不同,不宣稱固定成本最低。
價格查核 2026-10-02。原廠 cache miss 尖峰價:週一至五 UTC 01–04、06–10(中國公眾假期除外);離峰另價;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
程式與工具工作的跨廠商主力替代。
- 適合先試
- 工具呼叫、程式修正與多步分析。
- 何時升級
- 推理反覆無進展時,改試難題候選並重新驗收。
- 價格
- 輸入 $2 · 輸出 $6 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
搜尋與其他工具費另計;不能以即時搜尋功能推定回答正確。
價格查核 2026-10-02。原廠標準文字 API;不含搜尋、工具、快取或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
評測參考設定:xhigh · 閱讀核對 2026-10-02。不同推理設定需分開比較。
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
需要推理與長工具流程時的主力替代,先控制輸出預算。
- 適合先試
- 多檔案程式、工具工作與可核對的複雜推理。
- 何時升級
- 長時間未通過測試或工具回圈不收斂時,改試難題候選。
- 價格
- 輸入 $1.4 · 輸出 $4.4 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
API 與 Coding Plan 的價格及端點分開;本頁只列按量 API。
價格查核 2026-10-02。原廠按量 API;不是 Coding Plan 點數,不含快取儲存、工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
低價程式與工具子任務候選,與旗艦 GLM 分開驗收。
- 適合先試
- 小型修正、結構化輸出與有清楚檢查條件的工具子任務。
- 何時升級
- 跨檔案根因或多次重做時,升級 GLM 5.3/Sol/Sonnet。
- 價格
- 輸入 $0.15 · 輸出 $0.5 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
缺少本站樣本;不沿用旗艦分數或推定相同可靠性。
價格查核 2026-10-02。原廠按量 API;不含快取儲存、工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
長工程與長文件推理的難題替代候選。
- 適合先試
- 長程式流程、跨文件整理、多步研究分析。
- 何時升級
- 先提高主力資料品質,再決定是否需要旗艦長任務能力。
- 價格
- 尚未納入:原廠基本 input $3、output $15 / 百萬 token;K3 自動快取另收寫入費。本頁尚未把自動寫入/TTL 納入試算,因此不提供可能低估的完成成本。
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
長上下文不保證完整理解;自動快取寫入有額外費用,不能只看基本 input 單價。
查看來源與證據類型
評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
程式工具工作的新候選,先用有測試的小專案驗收。
- 適合先試
- 程式修改、視覺輔助前端與多步工程工具工作。
- 何時升級
- 持續修正失敗時,改試已驗收的主力或難題候選。
- 價格
- 尚未納入:原廠表格標示永久 50% 折扣,且按 512k 輸入分級。本頁暫不把折扣價當作一般標準價加入試算,價格細節請看原廠。
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
M3.1 Flash Preview 尚限 M Plan/MiniMax Code;不同模型不能合併。
查看來源與證據類型
評測參考設定:推理版;公開頁未標 effort · 閱讀核對 2026-10-02。不同推理設定需分開比較。
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。
Mistral 生態系的程式與 Agent 主力替代。
- 適合先試
- 程式修改、工具呼叫與文件問答。
- 何時升級
- 複雜根因仍找不到時,改用難題候選或拆成可驗收步驟。
- 價格
- 輸入 $1.5 · 輸出 $7.5 USD/百萬 token
- 可靠性狀態
- 本站尚未建立工作樣本,未測成功率與重試次數。
原廠已將 Devstral 2 標為退役並建議此模型;不使用舊 Devstral 分數推定新版表現。
價格查核 2026-10-02。原廠按量文字 API;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。
查看來源與證據類型
外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。