LLM 資料與評測入門¶
這份文件是寫給誰看的?
寫給非 LLM 領域的同事。你不需要會訓練模型、不需要懂深度學習,只要能看懂表格、流程圖和一小段設定檔,就能理解一個大型語言模型(LLM)背後的資料與評測是怎麼一回事。
我們刻意用生活化的比喻、真實的工具與指令,帶你走過三個主題:怎麼收集清洗預訓練資料、怎麼準備微調資料、以及怎麼公平地打分數。
先建立一個心智模型¶
訓練一個能對話的 LLM,可以想像成培養一位新進同事,大致經過三個階段:
flowchart LR
A["📚 大量閱讀<br/>Pre-training<br/>(讀遍圖書館)"] --> B["🎓 帶徒弟<br/>SFT 微調<br/>(教他怎麼回話)"]
B --> C["📝 考試打分<br/>Evaluation<br/>(驗收能力)"]
style A fill:#e8eaf6,stroke:#3f51b5,color:#1a237e
style B fill:#fff8e1,stroke:#ff8f00,color:#e65100
style C fill:#e0f2f1,stroke:#00897b,color:#004d40
-
第一階段:讀遍圖書館
模型先「讀」海量文字(網頁、書籍、程式碼……),學會語言、常識與知識。這批資料叫 pre-training(預訓練)資料。
重點不是讀得多,而是讀得乾淨——垃圾進、垃圾出。
-
第二階段:帶徒弟
光有知識還不會「好好回話」。我們用一批「問題 → 理想回答」的範例教它,這叫 SFT(監督式微調)資料。
這階段品質遠比數量重要:1,000 筆好資料,勝過 5 萬筆爛資料。
-
第三階段:考試打分
模型練成後,得公平地驗收能力。最常用的是選擇題測驗(像考 TMMLU+)。
我們用 Twinkle-Eval(APMIC × Twinkle AI 開發)示範,看它如何避開評測的常見陷阱。
幾個一定會遇到的名詞¶
先有個模糊印象就好,詳細解釋都收在詞彙表。
| 名詞 | 一句話理解 |
|---|---|
| Token(詞元) | 模型眼中的「一個字塊」。資料量、費用、長度都用 token 計算,不是用字數。 |
| Corpus(語料) | 一大堆拿來訓練的文字,就是「教材」。 |
| Pre-training(預訓練) | 讓模型讀海量文字、自己學語言與知識的階段。 |
| SFT(監督式微調) | 用「問題→回答」範例,教會模型怎麼當一個有用的助理。 |
| Benchmark(評測基準) | 一份標準考卷,讓不同模型在同一張卷子上比分數。 |
| Twinkle-Eval | 一套開源評測工具,本文用它示範怎麼考選擇題。 |
為什麼「資料」與「評測」值得非工程師理解?¶
一句話總結
模型的能力七分靠資料、三分靠訓練;而你怎麼知道模型好不好,完全靠評測。這兩件事都不是黑魔法,而是可以檢查、可以把關的工程流程——正是跨部門同事最該理解的部分。
- 法遵與風險:預訓練資料裡有沒有個資、有沒有侵權、有沒有把考題偷偷混進教材(作弊)?這些都在資料清洗階段決定。
- 成本:資料越髒,訓練越貴、效果越差。清洗做得好,等於省錢又提質。
- 信任:老闆問「我們的模型到底行不行?」——答案來自評測數字。但數字會不會被灌水?第 3 章會告訴你怎麼看穿。
關於本文引用的工具
第 3 章使用的 Twinkle-Eval 由 Twinkle AI 與 APMIC 共同開發,MIT 授權開源。文中的安裝指令、設定檔與參數皆取自其官方說明。