詞彙表¶
一份給非 LLM 領域同事的速查表。用最白話的方式解釋本文出現的名詞,需要細節時再回各章。
資料與訓練¶
Token(詞元)- 模型眼中的「一個字塊」。資料量、費用、輸入長度都以 token 計,不是以字數計。英文一個字可能拆成好幾個 token,中文常一字一個 token。
Corpus(語料)- 一大堆拿來訓練模型的文字,白話講就是「教材」。
Pre-training(預訓練)- 讓模型讀海量文字、自己學會語言與知識的第一階段。比喻:讀遍圖書館。
Base model(基礎模型)- 只做完 pre-training、還不太會「好好回話」的模型。像知識淵博但不懂應對的新人。
SFT(Supervised Fine-Tuning,監督式微調)- 用「問題→理想回答」的示範,教會模型當一個有用的助理。比喻:帶徒弟。
Fine-tuning(微調)- 在既有模型上,用較少量的資料再訓練,讓它更擅長某種行為或領域。SFT 是其中一種。
Instruct model(指令模型)- 做完 SFT(及後續對齊)後,會遵守指令、能對話的模型,就是你平常用的那種。
資料清洗¶
Boilerplate(樣板)- 網頁上的導覽列、廣告、頁尾等非正文雜訊,清洗時要去掉。
Language Identification(語言辨識)- 判斷一份文件是什麼語言,只保留目標語言。繁中還需額外分辨簡繁。
Heuristic(啟發式規則)- 一組「常識判斷規則」(如太短就丟、亂碼就丟),快速濾掉明顯垃圾。
Perplexity(困惑度)- 衡量一段文字對某模型而言「順不順」。困惑度高=讀起來很卡=可能是垃圾。
Classifier(分類器)- 一個學會分辨「好內容 vs 壞內容」的小模型,用來對資料打分篩選。
Deduplication(去重)- 刪掉重複與近似重複的內容,避免模型死背、浪費算力。
MinHash / LSH- 在數十億份文件中快速找出近似重複的技術:先把文件壓成指紋(MinHash),再讓相近指紋分到同桶快速比對(LSH)。
PII(Personally Identifiable Information,個人可識別資訊)- 電話、Email、身分證、信用卡等個資,清洗時要偵測並遮蔽。
Decontamination(去污染)- 把評測考題從訓練資料中剔除,避免模型「背答案」作弊、導致評測分數虛高。貫穿全文的關鍵概念。
SFT 相關¶
messages / ChatML 格式- SFT 資料的常見結構,用
role標記每句話由誰說。 system / user / assistant- 三種角色。
system=人設與規則;user=使用者發言;assistant=我們要模型學會的理想回答。 Self-Instruct / Evol-Instruct- 用強模型自己出題、自己作答來大量生成 SFT 資料的方法;Evol-Instruct 還會把題目越改越難。
Distillation(蒸餾)- 用一個更強的「老師模型」生成高品質回答,來訓練「學生模型」。注意授權條款。
LLM-as-Judge- 用一個強模型當「評審」,幫資料或回答自動打分,用於品質篩選或評測。
Embedding(向量嵌入)- 把一段文字轉成一串數字向量,讓電腦能計算「兩段文字有多像」,用於語意去重與多樣性分析。
LIMA(Less Is More for Alignment)- 一項著名研究,證明 1,000 筆高品質 SFT 資料勝過 5 萬筆平庸資料——SFT 重質不重量的代表。
Hallucination(幻覺)- 模型「一本正經地唬爛」,講出看似合理卻錯誤的內容。SFT 清洗時要濾掉這類回答。
評測相關¶
Benchmark(評測基準)- 一份標準考卷,讓不同模型在同一把尺上比分數。
MMLU / TMMLU+- 大規模多任務選擇題測驗。MMLU 是英文版;TMMLU+ 是繁體中文版,考數十個科目。
Formosa-bench- 台灣在地化的多科目評測資料集,Twinkle-Eval 內建支援。
Position Bias(位置偏好)- 模型偏愛選某個位置的選項(如老愛選 A)的毛病。對策:打亂選項順序。
Standard Deviation(標準差)- 衡量多次評測分數的「飄動程度」。標準差小=分數穩=可信。
Logit / Log Probability(對數機率)- 模型對每個候選 token 的信心分數。
logit評測法直接比各選項的機率,免抽取、最客觀。 Temperature(溫度)- 控制模型輸出的隨機性。設
0最穩定、最保守;越高越有創意也越隨機。評測時常設 0。 OpenAI-compatible API(OpenAI 相容 API)- 一種業界通用的模型呼叫介面規格。只要端點符合它,Twinkle-Eval 等工具就能直接呼叫。
vLLM / SGLang / Ollama- 常用的模型部署工具,能把模型架成一個 OpenAI 相容端點供評測呼叫。
Twinkle-Eval- 本文第 3 章使用的開源評測工具,由 Twinkle AI 與 APMIC 開發,擅長並行、隨機化、穩定度量測。
找不到想查的詞?
可以用右上角的 搜尋功能,直接搜中英文關鍵字。