模型觀測站 / 型錄

模型資料與證據

依本站目前的編輯資料查看候選、用途、價格和來源。推薦理由是本站判斷;原廠資料與外部評測不代表本站獨立驗證。

內容核對:2026-10-02 · 17 個候選 · 35 個來源

顯示 17 個候選

Google

Gemini 3.5 Flash-Lite

gemini-3.5-flash-lite · 文字 API;需記錄實際 thinking 設定

初步推薦

先試在易驗收的文字與資料整理,控制批量工作預算。

適合先試
格式轉換、分類、簡單抽取與一般翻譯的初步候選。
何時升級
遇到多重限制、專業術語或需要交叉查證時,改用較強候選並人工驗收。
價格
輸入 $0.3 · 輸出 $2.5 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

用途建議:Markdown・整理・摘要(省錢候選) 翻譯・一般寫作(省錢候選)

原廠定位支持輕量處理與翻譯;本站尚無繁體中文盲測,也無首次成功率或重試紀錄。

價格查核 2026-10-02。原廠 Standard 付費文字 API;不含快取儲存、工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Anthropic

Claude Haiku 4.5

claude-haiku-4-5 · 一般文字先不啟用 extended thinking;程式評測設定另見來源

初步推薦

低成本的程式與日常文字候選,適合有明確檢查方式的小任務。

適合先試
Markdown 整理、小型程式修正、有測試或明確輸出格式的子任務。
何時升級
錯誤原因涉及多個檔案、修正反覆失敗或需求含糊時,升級主力候選。
價格
輸入 $1 · 輸出 $5 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

用途建議:Markdown・整理・摘要(日常主力) 程式開發・除錯(省錢候選) Agent 程式工作(省錢候選)

原廠 coding 評測使用特定 scaffold 與高推理預算;不能套用為一般設定的錯誤率或單次成本。沒有本站實測可靠性。

價格查核 2026-10-02。原廠標準全球 API;本站僅試算 200k 輸入以內;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Anthropic

Claude Sonnet 5.5

claude-sonnet-5-5 · Adaptive thinking;預設 high effort;框架與實際設定需記錄

初步推薦

先作為程式除錯與多步工作主力候選,再用自己的任務驗證值不值得。

適合先試
多檔案除錯、需求整理、較複雜的指令與工具工作。
何時升級
需要跨長文件整合、複雜推理或主力候選已無進展時,試難題候選。
價格
輸入 $2 · 輸出 $10 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

用途建議:翻譯・一般寫作(日常主力) 程式開發・除錯(日常主力) 論文分析・複雜推理(日常主力) Agent 程式工作(日常主力)

原廠能力定位不是本站實測;沒有同提示、同 effort 下的跨模型重試比較。繁體中文品質未另驗證。

價格查核 2026-10-02。原廠標準全球 API;本站僅試算 200k 輸入以內;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Anthropic

Claude Opus 5.5

claude-opus-5-5 · Adaptive thinking 常開;預設 medium effort;框架與實際設定需記錄

初步推薦

把較高單價留給難題候選,而不是每次格式整理都直接使用。

適合先試
困難除錯、長文件分析、需要多步整合與推理的候選工作。
何時升級
已是本頁的難題候選;若仍失敗,重新界定問題、補足資料或找專業協助。
價格
輸入 $4 · 輸出 $20 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

用途建議:程式開發・除錯(難題升級) 論文分析・複雜推理(難題升級) Agent 程式工作(難題升級)

較高價格不保證更少錯誤;本站沒有證據證明其每個成功任務更便宜,也不宣稱是全市場能力上限。

價格查核 2026-10-02。原廠標準全球 API;本站僅試算 200k 輸入以內;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

OpenAI

GPT-6 Luna

gpt-6-luna · 大量輕量工作;記錄實際推理設定

初步推薦

讓低單價處理可快速驗收的小任務,限制重試次數。

適合先試
格式轉換、分類、短文抽取與可檢查的批量工作。
何時升級
多檔案除錯或兩次修正仍無進展時,改用 Sol/Sonnet。
價格
輸入 $0.1 · 輸出 $0.5 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

本站未驗證首次成功率;ChatGPT/Codex 介面體驗不能直接當作標準 API 的錯誤率。

價格查核 2026-10-02。Standard 全球文字 API;本站限制輸入加計費輸出合計 200k 以內,不含快取寫入、工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

OpenAI

GPT-6.1 Sol

gpt-6.1-sol · 可調 reasoning effort;AA max 結果不代表所有設定

初步推薦

一般開發與工具工作的主力候選,不必每次都用最高推理。

適合先試
程式開發、需求拆解、可驗證的多步工具工作。
何時升級
卡在難解根因或跨領域推理時,再試 Astra/Opus。
價格
輸入 $2 · 輸出 $10 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

本站未驗證首次成功率;ChatGPT/Codex 介面體驗不能直接當作標準 API 的錯誤率。

價格查核 2026-10-02。Standard 全球文字 API;本站限制輸入加計費輸出合計 200k 以內,不含快取寫入、工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

OpenAI

GPT-6 Sol

gpt-6-sol · 可調 reasoning effort;AA max 結果不代表所有設定

初步推薦

保留給既有流程比較;新整合優先評估同價的 6.1 Sol。

適合先試
已驗收的既有程式與 Agent 工作流程。
何時升級
以同一任務比較 6.1 Sol,再決定是否遷移。
價格
輸入 $2 · 輸出 $10 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

本站未驗證首次成功率;ChatGPT/Codex 介面體驗不能直接當作標準 API 的錯誤率。

價格查核 2026-10-02。Standard 全球文字 API;本站限制輸入加計費輸出合計 200k 以內,不含快取寫入、工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

OpenAI

GPT-6 Astra

gpt-6-astra · 可調 reasoning effort;AA max 結果不代表所有設定

初步推薦

把高預算留給難解問題,先設定停止與驗收條件。

適合先試
困難除錯、跨長文件整合、複雜推理與研究。
何時升級
主力失敗且預期修正價值高時才選用;仍失敗就補足證據與問題定義。
價格
輸入 $10 · 輸出 $50 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

本站未驗證首次成功率;ChatGPT/Codex 介面體驗不能直接當作標準 API 的錯誤率。

價格查核 2026-10-02。Standard 全球文字 API;本站限制輸入加計費輸出合計 200k 以內,不含快取寫入、工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Anthropic

Claude Fable 5.1

claude-fable-5-1 · Adaptive thinking 常開;預設 high effort

初步推薦

Opus 已不夠時再提高預算,不把最高價當作日常預設。

適合先試
艱難研究、長時間 Agent 與主力已無進展的推理。
何時升級
先比較 Opus 在較高 effort 的表現;Fable 仍失敗就重新拆解任務。
價格
輸入 $10 · 輸出 $50 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

原廠建議多數工作先用 Opus;不同 effort 與框架不能當成相同品質。

價格查核 2026-10-02。原廠標準全球 API;本站僅試算 200k 輸入以內;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Google

Gemini 3.8 Flash

gemini-3.8-flash · Thinking 支援 low/medium/high;記錄實際設定

初步推薦

Google 生態系的程式與工具工作候選。

適合先試
結構化文件、開發工具、多步需求處理。
何時升級
複雜推理或反覆修正失敗時,與 Sol/Sonnet/Opus 比較。
價格
尚未納入:原廠有截至 2026-12-31 的限期價格。本頁標準價試算不混入促銷,暫不加入成本比較;請查看原廠當期價格。
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

原廠能力定位尚未經本站繁體中文或 Agent 樣本驗證。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

DeepSeek

DeepSeek V4.1 Flash

deepseek-flash · API 別名 deepseek-flash;預設 thinking,可關閉;記錄版本與日期

初步推薦

先用在可跑測試的程式與資料子任務,觀察實際 token 與重試。

適合先試
小型修正、結構化抽取、可核對的推理草稿。
何時升級
上下文依賴複雜或回圈重試時,升級主力候選。
價格
輸入 $0.3 · 輸出 $1.2 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

別名可能更新底層版本;尖峰與離峰單價不同,不宣稱固定成本最低。

價格查核 2026-10-02。原廠 cache miss 尖峰價:週一至五 UTC 01–04、06–10(中國公眾假期除外);離峰另價;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

xAI / SpaceXAI

Grok 4.7

grok-4.7 · 可調 reasoning;AA 頁為 xhigh

初步推薦

程式與工具工作的跨廠商主力替代。

適合先試
工具呼叫、程式修正與多步分析。
何時升級
推理反覆無進展時,改試難題候選並重新驗收。
價格
輸入 $2 · 輸出 $6 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

搜尋與其他工具費另計;不能以即時搜尋功能推定回答正確。

價格查核 2026-10-02。原廠標準文字 API;不含搜尋、工具、快取或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

評測參考設定:xhigh · 閱讀核對 2026-10-02。不同推理設定需分開比較。

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Z.AI

GLM 5.3

glm-5.3 · Thinking 常開;low/high/max,預設 max

初步推薦

需要推理與長工具流程時的主力替代,先控制輸出預算。

適合先試
多檔案程式、工具工作與可核對的複雜推理。
何時升級
長時間未通過測試或工具回圈不收斂時,改試難題候選。
價格
輸入 $1.4 · 輸出 $4.4 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

API 與 Coding Plan 的價格及端點分開;本頁只列按量 API。

價格查核 2026-10-02。原廠按量 API;不是 Coding Plan 點數,不含快取儲存、工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Z.AI

GLM 5.3 Flash

glm-5.3-flash · Thinking 常開;不要套用 GLM 5.3 的評測設定

初步推薦

低價程式與工具子任務候選,與旗艦 GLM 分開驗收。

適合先試
小型修正、結構化輸出與有清楚檢查條件的工具子任務。
何時升級
跨檔案根因或多次重做時,升級 GLM 5.3/Sol/Sonnet。
價格
輸入 $0.15 · 輸出 $0.5 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

缺少本站樣本;不沿用旗艦分數或推定相同可靠性。

價格查核 2026-10-02。原廠按量 API;不含快取儲存、工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Moonshot AI

Kimi K3

kimi-k3 · Thinking 常開;low/high/max,預設 max

初步推薦

長工程與長文件推理的難題替代候選。

適合先試
長程式流程、跨文件整理、多步研究分析。
何時升級
先提高主力資料品質,再決定是否需要旗艦長任務能力。
價格
尚未納入:原廠基本 input $3、output $15 / 百萬 token;K3 自動快取另收寫入費。本頁尚未把自動寫入/TTL 納入試算,因此不提供可能低估的完成成本。
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

長上下文不保證完整理解;自動快取寫入有額外費用,不能只看基本 input 單價。

查看來源與證據類型

評測參考設定:max · 閱讀核對 2026-10-02。不同推理設定需分開比較。

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

MiniMax

MiniMax M3

MiniMax-M3 · 原廠 Standard API;不混用 M3.1 Flash Preview 訂閱方案

初步推薦

程式工具工作的新候選,先用有測試的小專案驗收。

適合先試
程式修改、視覺輔助前端與多步工程工具工作。
何時升級
持續修正失敗時,改試已驗收的主力或難題候選。
價格
尚未納入:原廠表格標示永久 50% 折扣,且按 512k 輸入分級。本頁暫不把折扣價當作一般標準價加入試算,價格細節請看原廠。
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

M3.1 Flash Preview 尚限 M Plan/MiniMax Code;不同模型不能合併。

查看來源與證據類型

評測參考設定:推理版;公開頁未標 effort · 閱讀核對 2026-10-02。不同推理設定需分開比較。

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。

Mistral AI

Mistral Medium 3.5

mistral-medium-3-5 · 原廠 API;保留實際工具與推理設定

初步推薦

Mistral 生態系的程式與 Agent 主力替代。

適合先試
程式修改、工具呼叫與文件問答。
何時升級
複雜根因仍找不到時,改用難題候選或拆成可驗收步驟。
價格
輸入 $1.5 · 輸出 $7.5 USD/百萬 token
可靠性狀態
本站尚未建立工作樣本,未測成功率與重試次數。

原廠已將 Devstral 2 標為退役並建議此模型;不使用舊 Devstral 分數推定新版表現。

價格查核 2026-10-02。原廠按量文字 API;不含工具或稅金。日期代表最近查核時間,不一定是價格生效日。

查看來源與證據類型

外部 benchmark 只支持其測試範圍內的觀察,不能直接推算日常工作成功率。原廠結果屬廠商報告,本站尚未獨立驗證。