跳轉至

LLM 資料與評測入門

這份文件是寫給誰看的?

寫給非 LLM 領域的同事。你不需要會訓練模型、不需要懂深度學習,只要能看懂表格、流程圖和一小段設定檔,就能理解一個大型語言模型(LLM)背後的資料評測是怎麼一回事。

我們刻意用生活化的比喻、真實的工具與指令,帶你走過三個主題:怎麼收集清洗預訓練資料怎麼準備微調資料、以及怎麼公平地打分數

先建立一個心智模型

訓練一個能對話的 LLM,可以想像成培養一位新進同事,大致經過三個階段:

flowchart LR
    A["📚 大量閱讀<br/>Pre-training<br/>(讀遍圖書館)"] --> B["🎓 帶徒弟<br/>SFT 微調<br/>(教他怎麼回話)"]
    B --> C["📝 考試打分<br/>Evaluation<br/>(驗收能力)"]
    style A fill:#e8eaf6,stroke:#3f51b5,color:#1a237e
    style B fill:#fff8e1,stroke:#ff8f00,color:#e65100
    style C fill:#e0f2f1,stroke:#00897b,color:#004d40
  •  第一階段:讀遍圖書館


    模型先「讀」海量文字(網頁、書籍、程式碼……),學會語言、常識與知識。這批資料叫 pre-training(預訓練)資料

    重點不是讀得多,而是讀得乾淨——垃圾進、垃圾出。

    前往第 1 章

  •  第二階段:帶徒弟


    光有知識還不會「好好回話」。我們用一批「問題 → 理想回答」的範例教它,這叫 SFT(監督式微調)資料

    這階段品質遠比數量重要:1,000 筆好資料,勝過 5 萬筆爛資料。

    前往第 2 章

  •  第三階段:考試打分


    模型練成後,得公平地驗收能力。最常用的是選擇題測驗(像考 TMMLU+)。

    我們用 Twinkle-Eval(APMIC × Twinkle AI 開發)示範,看它如何避開評測的常見陷阱。

    前往第 3 章

幾個一定會遇到的名詞

先有個模糊印象就好,詳細解釋都收在詞彙表

名詞 一句話理解
Token(詞元) 模型眼中的「一個字塊」。資料量、費用、長度都用 token 計算,不是用字數。
Corpus(語料) 一大堆拿來訓練的文字,就是「教材」。
Pre-training(預訓練) 讓模型讀海量文字、自己學語言與知識的階段。
SFT(監督式微調) 用「問題→回答」範例,教會模型怎麼當一個有用的助理。
Benchmark(評測基準) 一份標準考卷,讓不同模型在同一張卷子上比分數。
Twinkle-Eval 一套開源評測工具,本文用它示範怎麼考選擇題。

為什麼「資料」與「評測」值得非工程師理解?

一句話總結

模型的能力七分靠資料、三分靠訓練;而你怎麼知道模型好不好,完全靠評測。這兩件事都不是黑魔法,而是可以檢查、可以把關的工程流程——正是跨部門同事最該理解的部分。

  • 法遵與風險:預訓練資料裡有沒有個資、有沒有侵權、有沒有把考題偷偷混進教材(作弊)?這些都在資料清洗階段決定。
  • 成本:資料越髒,訓練越貴、效果越差。清洗做得好,等於省錢又提質。
  • 信任:老闆問「我們的模型到底行不行?」——答案來自評測數字。但數字會不會被灌水?第 3 章會告訴你怎麼看穿。

關於本文引用的工具

第 3 章使用的 Twinkle-EvalTwinkle AIAPMIC 共同開發,MIT 授權開源。文中的安裝指令、設定檔與參數皆取自其官方說明。