模型選型 / WORKFLOW GUIDE

把模型串起來,
讓工作真正完成。

選場景 → 選分工 → 看交付與驗收。

流程建議 · 2026-10-02 · 候選依據:用途選型;整套流程尚未實測。

一般工作先選簡單流程;卡住再升級。

SCENARIO / FEATURE

開發新功能

先把需求變成可驗收的切片,再決定如何分工。

先看這一句

小功能用一位主力。複雜功能才拆任務;交接、整合與重做也會花錢。

一般工作

單一主力:需求與驗收 → 一個可運行切片 → 測試與自審 → 人工確認。

複雜工作

規劃者:介面與風險 → 獨立 worker:有限範圍實作 → 整合者 → 獨立審查與實際驗收。

  1. 1

    定義需求與驗收

    規劃者 + 使用者

    交付
    需求、介面、正常與失敗案例。
    過關條件
    使用者能以具體案例判斷完成。
    輸入與交接細節

    輸入:既有程式入口、使用者情境、限制與預期變更。

    交付:一頁需求、非目標、介面契約、正常/失敗/邊界驗收案例。

    驗收:使用者可用具體案例判斷完成;先驗證最不確定的依賴與架構假設。

  2. 2

    先完成一個垂直切片

    主力實作者

    交付
    一個可運行切片與實際測試。
    過關條件
    從輸入到輸出實際可跑,再決定是否分工。
    輸入與交接細節

    輸入:核定需求、契約與最小驗收案例。

    交付:可運行的最小功能、變更摘要與實際測試結果。

    驗收:從輸入到輸出真的可跑,介面未靠假資料掩蓋;再決定是否需要平行實作。

  3. 3

    實作剩餘明確子任務

    受限範圍的 worker

    交付
    限定範圍的 patch、測試與未解問題。
    過關條件
    小模型只做可獨立驗收的任務。
    輸入與交接細節

    輸入:允許修改的檔案、固定契約、任務相關上下文及驗收指令。

    交付:獨立 patch、測試紀錄、未解問題;不自行改共用契約。

    驗收:只有可獨立驗收的任務才用小模型;不明確的根因交回主力,避免低價重做。

  4. 4

    整合、審查與交付

    整合者 + 審查者 + 使用者

    交付
    整合結果、回歸與回復方式。
    過關條件
    依原始規格跑測試,再由使用者驗收。
    輸入與交接細節

    輸入:最終 diff、原始需求、案例與所有 worker 的未解問題。

    交付:整合測試、回歸紀錄、review 問題與可回復交付。

    驗收:審查者依原始規格檢查,執行真實測試;模型說「通過」不能代替測試與人工驗收。

何時可平行

只平行做介面固定、檔案不重疊的任務;共用 schema 與整合由主力處理。

何時停止或升級

先限每項 2 次修正。持續失敗就查根因,或升級;別盲目增加 workers。

複製這個場景的工作交接單

填入你的目標、檔案與預算,再交給實際能讀取專案資料的助手。下列是範本,不會執行模型或工具。

SCENARIO / RESEARCH

研究所・文獻與實驗

以共享文獻庫和證據表,支撐閱讀、討論與研究決策。

先看這一句

共用文獻與證據,不重複塞全部 PDF。摘要用來找路,討論要能回原文。

一般工作

探索性研究:研究問題 → 小批文獻試讀 → 證據矩陣 → 與研究者討論 → 小型可重現實驗。

複雜工作

正式回顧/論文:固定搜尋與篩選規則 → 結構化提取與人工核對 → 證據對照與反例 → 實驗設計/複現 → 可追溯寫作。

  1. 1

    釐清研究問題與範圍

    研究者 + 規劃助手

    交付
    問題、定義與納入/排除規則。
    過關條件
    研究者先確認問題與回顧類型。
    輸入與交接細節

    輸入:題目、領域、已有知識、研究資源與指導方向。

    交付:問題、定義、搜尋詞、納入/排除規則、待回答子問題。

    驗收:區分探索性閱讀、範疇回顧與系統性回顧;研究者確認方法,不能直接套同一套標準。

  2. 2

    建立可回查的文獻庫

    搜尋工具 + 研究者

    交付
    文獻 ID、版本、全文位置與搜尋紀錄。
    過關條件
    查證書目;只有摘要就標明。
    輸入與交接細節

    輸入:固定搜尋式、資料庫、日期範圍與版本。

    交付:文獻 ID、書目/DOI、搜尋紀錄、全文位置、版本及排除理由。

    驗收:工具查證書目與全文;模型給的引用先標待確認。只有摘要可用的文獻不可假裝讀過全文。

  3. 3

    分篇提取並核對證據

    提取 worker + 研究者

    交付
    統一文獻卡與頁碼/圖表定位。
    過關條件
    核心文獻與重要數字逐項回原文核對。
    輸入與交接細節

    輸入:相關全文段落、圖表及補充資料,與統一提取欄位。

    交付:方法、資料/樣本、結果、比較條件、限制、頁碼/章節/表圖定位。

    驗收:低成本模型做欄位提取;核心文獻、含糊方法與重要數字逐項回原文核對。不清楚就留空/標未報告。

  4. 4

    人與 agents 共讀同一份證據

    導讀助手 + 研究者

    交付
    核心閱讀清單、術語與比較表。
    過關條件
    研究者能解釋方法、假設與限制。
    輸入與交接細節

    輸入:文獻索引、證據矩陣與核心全文片段。

    交付:研究者的閱讀清單、術語表、比較表與需要回讀的段落。

    驗收:研究者精讀影響研究決策的核心文獻;能解釋方法假設及限制,不能只記住摘要結論。

  5. 5

    以證據討論,保留反例

    綜合者 + 反方審查 + 研究者

    交付
    主張、反證、適用條件與決策。
    過關條件
    意見一致不算證據;保留反例與矛盾。
    輸入與交接細節

    輸入:單一討論問題、相關原文、相互衝突的證據與先前決策。

    交付:主張 → 支持/反證 → 適用條件 → 可驗證預測 → 決策紀錄。

    驗收:不同模型意見一致不等於證據充分;保留未解矛盾,必要時回讀全文,不用投票決定研究真偽。

  6. 6

    設計與執行可重現實驗

    研究者 + 方法審查 + 程式工具

    交付
    可重跑計畫、腳本與原始結果。
    過關條件
    先查洩漏與公平性,用程式產生結果。
    輸入與交接細節

    輸入:假設、比較基準、資料切分、指標與資源預算。

    交付:先寫實驗計畫、版本/seed/環境、腳本、原始結果及失敗紀錄。

    驗收:先排查資料洩漏、指標與比較公平性;用程式計算,將未執行的建議與已觀察結果分開。研究者確認方法。

  7. 7

    寫作與主張追溯

    撰稿助手 + 證據審查 + 研究者

    交付
    可追溯的草稿、引用與限制。
    過關條件
    每個主要主張都有文獻或實驗依據。
    輸入與交接細節

    輸入:已核對證據、實驗紀錄、論證大綱與術語表。

    交付:每個主要主張的來源定位、限制、圖表與已確認書目。

    驗收:引用回到真正支持主張的來源;二手引用標明,缺證據的句子刪除或標假設。研究者負責最終論證。

何時可平行

先用 3–5 篇校準欄位,再按篇提取。全員共用同一矩陣與術語。

何時停止或升級

一個問題先討論 2 輪。缺證據就回讀或搜尋,不讓 agents 無限辯論。

研究者與 agents,共用這 4 份紀錄

  • 研究 brief:問題、定義、範圍與卡點。
  • 文獻庫:ID、版本、全文;不能把摘要當全文。
  • 證據矩陣:方法、條件、結果、限制與原文定位。
  • 決策與實驗:反證、未解問題、腳本與原始結果。

每次討論:一個問題 → 相關原文 → 主張與反證 → 研究者決定 → 回寫紀錄。

研究者精讀核心文獻。每個 agent 按任務取回原文;聊天不會自動共享記憶。

大量文獻怎麼處理?

先用 3–5 篇校準欄位,再逐篇提取。核心文獻與重要數字逐項核對;圖表和補充資料另讀。檢索找不到片段時,調整搜尋或回讀全文。

長上下文不能保證完整使用內容。TACL 2024 研究提供失誤案例,不能直接推算今日模型錯誤率。

何時需要正式回顧方法?

探索性閱讀先小批試行;正式回顧需固定檢索、篩選與排除紀錄。PRISMA 2020 是系統性回顧報告指南;範疇回顧參考 PRISMA-ScR。依領域與老師要求選,不適用所有研究。

下載研究紀錄範本
複製這個場景的工作交接單

填入你的目標、檔案與預算,再交給實際能讀取專案資料的助手。下列是範本,不會執行模型或工具。

SCENARIO / DEBUG

除錯・事故調查

先重現與縮小範圍,避免讓多模型同時猜根因。

先看這一句

先重現,再用實驗區分假設。多個模型一起猜,不一定增加證據。

一般工作

單一主力:重現 → 最小診斷 → 小修正 → 回歸。

複雜工作

主力建立假設與證據;第二位審查者檢查盲點,複雜根因才升級。

  1. 1

    重現與收集

    工具 + 主力

    交付
    最小重現與錯誤時間線。
    過關條件
    可重現;未知資訊明確標出。
    輸入與交接細節

    輸入:錯誤、環境版本、最近變更與可重現步驟。

    交付:最小重現、實際與預期輸出、時間線。

    驗收:無法重現時先標未知,避免根因先入為主。

  2. 2

    區分假設

    根因分析者

    交付
    根因假設與可否證實驗。
    過關條件
    每次實驗能支持或排除假設。
    輸入與交接細節

    輸入:重現、log 與已排除假設。

    交付:排序假設與每個假設的可否證實驗。

    驗收:每次實驗至少能排除或支持一個假設;記錄與原先猜想不同的結果。

  3. 3

    修正並驗收

    實作者 + 審查者

    交付
    最小修正、測試與回復方式。
    過關條件
    原重現與相關回歸都實際通過。
    輸入與交接細節

    輸入:已確認根因與變更邊界。

    交付:最小修正、原重現通過、相關回歸與回復步驟。

    驗收:在原環境驗證,不把錯誤隱藏或重試當作根因已修正。

何時可平行

唯讀檢查可平行;實驗一次改一個因素。

何時停止或升級

兩次實驗沒有進展,就補重現或 logs,再考慮升級。

複製這個場景的工作交接單

填入你的目標、檔案與預算,再交給實際能讀取專案資料的助手。下列是範本,不會執行模型或工具。

SCENARIO / WRITING

翻譯・文章與文件

先固定事實與術語,再寫作與編輯。

先看這一句

先固定來源與術語,再寫作。流暢不代表正確;避免反覆重寫全文。

一般工作

格式與一般文字:小模型產稿 → 人工抽查與格式驗收。

複雜工作

主力整理論證與來源 → 分段起草 → 術語/事實審查 → 人工編輯。

  1. 1

    固定目的、來源與術語

    使用者 + 編輯助手

    交付
    大綱、事實清單與術語表。
    過關條件
    沒有來源的事實不靠模型補齊。
    輸入與交接細節

    輸入:讀者、目的、來源與語氣範例。

    交付:大綱、事實清單、術語表與不得改動的內容。

    驗收:缺來源的事實不能用寫作補齊;專業譯文需明確術語。

  2. 2

    起草與格式整理

    撰稿者

    交付
    初稿、引用與不確定譯法。
    過關條件
    格式用小模型;複雜語義交主力。
    輸入與交接細節

    輸入:核定大綱、術語表與原文。

    交付:初稿、引用定位與不確定譯法。

    驗收:簡單格式可用小模型;跨段論證與專業語義交給主力。

  3. 3

    對照與編輯

    獨立檢查 + 使用者

    交付
    對照問題與人工確認的最終稿。
    過關條件
    逐段對照;術語與繁中由讀者驗收。
    輸入與交接細節

    輸入:原文、初稿、事實清單與術語。

    交付:遺漏/添寫/術語/語氣問題及最終稿。

    驗收:事實回查來源,翻譯逐段對照;繁體中文與風格由讀者驗收。

何時可平行

按核定大綱分段,共用術語;最後一位編輯統一語氣。

何時停止或升級

先限兩輪修改。要求衝突時,回到讀者與目的。

複製這個場景的工作交接單

填入你的目標、檔案與預算,再交給實際能讀取專案資料的助手。下列是範本,不會執行模型或工具。

SCENARIO / DATA

資料分析・報表

模型負責提出分析與程式,數字由可重跑的工具產生。

先看這一句

模型寫分析與程式,工具算數。資料、指標與結果都要可追溯。

一般工作

主力生成分析腳本 → 工具計算 → 人工核對關鍵數字。

複雜工作

研究者定義問題 → 方法審查 → 可重現清理與分析 → 反例/敏感度檢查 → 報告。

  1. 1

    定義問題與資料

    使用者 + 主力

    交付
    指標、欄位與清理規則。
    過關條件
    確認資料能支持問題;不把相關當因果。
    輸入與交接細節

    輸入:業務或研究問題、資料字典、資料版本。

    交付:指標定義、缺值/重複/單位規則與可回答的問題。

    驗收:確認資料能支持推論;相關性不能直接當因果。

  2. 2

    以程式處理與計算

    工具 + 實作者

    交付
    腳本、品質檢查與實際結果。
    過關條件
    抽查總數、單位、缺值與中間結果。
    輸入與交接細節

    輸入:凍結資料、清理規則與指標。

    交付:可重跑腳本、版本、資料品質報告與中間結果。

    驗收:總數、抽樣列、單位與缺值影響可核對;不能只提供聊天內的數字。

  3. 3

    檢查解讀與交付

    方法審查 + 使用者

    交付
    圖表、敏感度與資料限制。
    過關條件
    結論由結果支持,報表可重跑。
    輸入與交接細節

    輸入:計算結果、腳本、假設與資料限制。

    交付:圖表、敏感度檢查、結論及無法回答的問題。

    驗收:解讀須由結果支持;能重跑產生同一份報表。

何時可平行

獨立圖表可拆;共用凍結資料與指標定義。

何時停止或升級

資料口徑不清就停;別為好看的結論改指標。

複製這個場景的工作交接單

填入你的目標、檔案與預算,再交給實際能讀取專案資料的助手。下列是範本,不會執行模型或工具。

SCENARIO / AUTOMATION

重複作業・工具 Agent

先用固定規則解決可預測流程,讓模型處理例外。

先看這一句

固定規則先用程式;模型處理非結構內容與例外。

一般工作

固定流程與格式檢查 → 小模型處理內容 → 人工確認例外。

複雜工作

主力規劃例外 → 受限工具執行 → 狀態驗證與審核關卡。

  1. 1

    把流程與例外寫清楚

    使用者 + 主力

    交付
    狀態流程、工具權限與審核點。
    過關條件
    外部修改前有授權與回復方式。
    輸入與交接細節

    輸入:樣本、觸發條件、允許動作、失敗與人工審核條件。

    交付:狀態流程、工具權限、重試規則及審核點。

    驗收:固定規則先不用模型;涉及外部修改前有明確授權與可回復方案。

  2. 2

    受限執行與狀態紀錄

    程式/小模型 worker

    交付
    工具回傳、工作 ID 與每次成本。
    過關條件
    重試前先檢查,避免重複副作用。
    輸入與交接細節

    輸入:單項任務、允許工具、前置狀態與停止條件。

    交付:結果、工具實際回傳、工作 ID 與每次嘗試成本。

    驗收:先檢查是否已完成再重試,避免重複副作用;小模型無法處理的例外交主力。

  3. 3

    核對結果與例外

    驗證工具 + 使用者

    交付
    成功/失敗/需人工處理的明確狀態。
    過關條件
    以實際狀態驗證;看不到就標待確認。
    輸入與交接細節

    輸入:預期狀態、工具回傳與工作紀錄。

    交付:成功/失敗/需人工處理,不含糊標成完成。

    驗收:以外部實際狀態驗證結果;模型無法看到的結果仍標待確認。

何時可平行

獨立項目可平行;共享外部狀態的動作需排序。

何時停止或升級

設工具、時間與 token 上限。狀態不明就停。

複製這個場景的工作交接單

填入你的目標、檔案與預算,再交給實際能讀取專案資料的助手。下列是範本,不會執行模型或工具。

先算整件工作,再比模型

平行與第二模型審查的限制

平行可能縮短等待,卻增加總 token;重傳整段對話會重複付費。第二位模型也可能犯相同錯誤,仍要用原文、測試或工具驗證。

方法來源與限制

流程為本站建議;來源支持方法,未驗證這套模型組合。模型依據見模型卡片。