模型觀測站

便宜一次,
還是便宜完成?

先選工作,再看省錢候選、日常主力與難題升級。推薦是本站根據公開評測分析、原廠文件與價格所作的初步判斷,不代表本站任務成功率。

內容核對:2026-10-02 · 17 個候選 · 9 家廠商 · 5 種用途

涵蓋九家廠商的文字 API 候選。依公開評測分析、原廠文件與價格形成本站用途建議;不是全市場能力排名,可靠性尚待工作樣本驗證。

你要完成什麼工作?

每一列顯示用途建議和證據狀態。

Markdown・整理・摘要

容易人工檢查的小工作,先限制預算與修改範圍。

省錢候選

Gemini 3.5 Flash-Lite

輕量處理定位及較低單價,適合先試格式轉換;要檢查內容有無漏失。

輸入 $0.3 · 輸出 $2.5/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • GPT-6 Luna:低單價處理可驗收的格式任務;限制重試,不預設能可靠除錯。
  • DeepSeek V4.1 Flash:非推理模式可作格式整理候選;先檢查內容漏失與別名版本。
查看證據

日常主力

Claude Haiku 4.5

需要小段程式或結構化整理時的另一個候選;尚未證明比省錢候選更可靠。

輸入 $1 · 輸出 $5/百萬 token

初步推薦 · 實測可靠性待補

查看證據

難題升級

單純格式整理通常先改善提示與驗收;不預設需要高價模型。

翻譯・一般寫作

依術語、語氣與繁體中文需求驗收,不能用 coding 分數替代語言品質。

省錢候選

Gemini 3.5 Flash-Lite

原廠列出翻譯用途;只作一般文字起點,不代表專業翻譯已驗證。

輸入 $0.3 · 輸出 $2.5/百萬 token

初步推薦 · 實測可靠性待補

查看證據

日常主力

Claude Sonnet 5.5

多重指令與文件整理的初步候選;繁體中文風格仍要親自比較。

輸入 $2 · 輸出 $10/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • GPT-6.1 Sol:多限制文件的候選;繁體中文語氣與術語需人工比較。
  • Gemini 3.8 Flash:Google 工作流程的替代;限期價格另查,未納入試算。
查看證據

難題升級

缺少本站翻譯與寫作樣本,暫不給難題升級推薦。

程式開發・除錯

能跑測試的小修正先省錢;跨檔案和重複失敗再升級。

省錢候選

Claude Haiku 4.5

原廠提供 coding 評測及框架說明,適合先試邊界明確的小修正。

輸入 $1 · 輸出 $5/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • DeepSeek V4.1 Flash:較低標準尖峰單價,適合有測試的小修正;限制重試。
  • GLM 5.3 Flash:低價工具子任務替代;不要沿用旗艦 GLM 的評測結果。
查看證據

日常主力

Claude Sonnet 5.5

原廠定位及規格支持程式與工具工作,列作多檔案除錯的初步主力。

輸入 $2 · 輸出 $10/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • GPT-6.1 Sol:開發與工具定位加 AA 高推理分析,列作跨廠商主力。
  • GLM 5.3:推理與長程式流程替代,注意預設 max 的輸出。
  • Grok 4.7:程式與工具主力替代;搜尋費另計。
  • Mistral Medium 3.5:已用 Mistral 工具鏈時的替代,不沿用退役 Devstral 分數。
查看證據

難題升級

Claude Opus 5.5

困難問題才提高預算,仍需用測試判斷是否真的改善。

輸入 $4 · 輸出 $20/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • GPT-6 Astra:主力無進展且問題價值高時再使用;先設定 token 上限。
查看證據

論文分析・複雜推理

答案必須能回到原文或計算驗證,不能把流暢表達當作正確。

省錢候選

缺乏同條件研究樣本,不硬選省錢模型。

日常主力

Claude Sonnet 5.5

長文件與知識工作能力的初步候選;需要逐項核對原文。

輸入 $2 · 輸出 $10/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • GPT-6.1 Sol:研究拆解與可驗證推理的替代,逐項回查原文。
查看證據

難題升級

Claude Opus 5.5

多步整合與推理的初步升級候選;未證明有較低實際錯誤率。

輸入 $4 · 輸出 $20/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • GPT-6 Astra:跨領域難題的高預算候選,避免用在單純摘要。
  • Kimi K3:長文件與長推理替代;自動快取費用需另估。
  • Claude Fable 5.1:Opus 較高 effort 仍無進展時才考慮。
查看證據

Agent 程式工作

框架、工具權限、重試上限與驗收方式,一起決定結果。

省錢候選

Claude Haiku 4.5

可驗收的局部子任務候選;不將 coding 評測推定為通用 Agent 成功率。

輸入 $1 · 輸出 $5/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • DeepSeek V4.1 Flash:局部子任務與有停止條件的工具工作;不推定整個 Agent 成功率。
  • GLM 5.3 Flash:低價工具子任務替代,需要框架內測試。
查看證據

日常主力

Claude Sonnet 5.5

多步工具與程式工作的初步主力;必須保留執行框架紀錄。

輸入 $2 · 輸出 $10/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • GPT-6.1 Sol:程式工具流程的主力替代;保留框架、設定與驗收紀錄。
  • GLM 5.3:長工程與工具工作候選;max 與較低 effort 分開驗證。
  • Grok 4.7:工具工作替代;預算需含搜尋與每輪歷史。
  • MiniMax M3:新工程候選先在可回復、有測試的小專案試用;價格另查。
  • Gemini 3.8 Flash:Google 工具鏈的替代;不把原廠定位當成成功率。
  • Mistral Medium 3.5:Mistral API 工具鏈的替代;需要同框架驗收。
查看證據

難題升級

Claude Opus 5.5

主力卡住時試更高預算,避免讓錯誤重試無限延長。

輸入 $4 · 輸出 $20/百萬 token

初步推薦 · 實測可靠性待補

查看同級替代
  • GPT-6 Astra:高價換難題能力,必須設定停止條件。
  • Kimi K3:長程式流程替代;長上下文與快取費另估。
  • Claude Fable 5.1:Opus 已卡住的長任務才提高預算。
查看證據

模型索引

舊的模型書籤會在這裡找到對應型錄項目。