跳轉至

詞彙表

一份給非 LLM 領域同事的速查表。用最白話的方式解釋本文出現的名詞,需要細節時再回各章。

資料與訓練

Token(詞元)
模型眼中的「一個字塊」。資料量、費用、輸入長度都以 token 計,不是以字數計。英文一個字可能拆成好幾個 token,中文常一字一個 token。
Corpus(語料)
一大堆拿來訓練模型的文字,白話講就是「教材」。
Pre-training(預訓練)
讓模型讀海量文字、自己學會語言與知識的第一階段。比喻:讀遍圖書館
Base model(基礎模型)
只做完 pre-training、還不太會「好好回話」的模型。像知識淵博但不懂應對的新人。
SFT(Supervised Fine-Tuning,監督式微調)
用「問題→理想回答」的示範,教會模型當一個有用的助理。比喻:帶徒弟
Fine-tuning(微調)
在既有模型上,用較少量的資料再訓練,讓它更擅長某種行為或領域。SFT 是其中一種。
Instruct model(指令模型)
做完 SFT(及後續對齊)後,會遵守指令、能對話的模型,就是你平常用的那種。

資料清洗

Boilerplate(樣板)
網頁上的導覽列、廣告、頁尾等非正文雜訊,清洗時要去掉。
Language Identification(語言辨識)
判斷一份文件是什麼語言,只保留目標語言。繁中還需額外分辨簡繁
Heuristic(啟發式規則)
一組「常識判斷規則」(如太短就丟、亂碼就丟),快速濾掉明顯垃圾。
Perplexity(困惑度)
衡量一段文字對某模型而言「順不順」。困惑度高=讀起來很卡=可能是垃圾。
Classifier(分類器)
一個學會分辨「好內容 vs 壞內容」的小模型,用來對資料打分篩選。
Deduplication(去重)
刪掉重複與近似重複的內容,避免模型死背、浪費算力。
MinHash / LSH
在數十億份文件中快速找出近似重複的技術:先把文件壓成指紋(MinHash),再讓相近指紋分到同桶快速比對(LSH)。
PII(Personally Identifiable Information,個人可識別資訊)
電話、Email、身分證、信用卡等個資,清洗時要偵測並遮蔽。
Decontamination(去污染)
評測考題從訓練資料中剔除,避免模型「背答案」作弊、導致評測分數虛高。貫穿全文的關鍵概念。

SFT 相關

messages / ChatML 格式
SFT 資料的常見結構,用 role 標記每句話由誰說。
system / user / assistant
三種角色。system=人設與規則;user=使用者發言;assistant我們要模型學會的理想回答
Self-Instruct / Evol-Instruct
用強模型自己出題、自己作答來大量生成 SFT 資料的方法;Evol-Instruct 還會把題目越改越難
Distillation(蒸餾)
用一個更強的「老師模型」生成高品質回答,來訓練「學生模型」。注意授權條款。
LLM-as-Judge
用一個強模型當「評審」,幫資料或回答自動打分,用於品質篩選或評測。
Embedding(向量嵌入)
把一段文字轉成一串數字向量,讓電腦能計算「兩段文字有多像」,用於語意去重與多樣性分析。
LIMA(Less Is More for Alignment)
一項著名研究,證明 1,000 筆高品質 SFT 資料勝過 5 萬筆平庸資料——SFT 重質不重量的代表。
Hallucination(幻覺)
模型「一本正經地唬爛」,講出看似合理卻錯誤的內容。SFT 清洗時要濾掉這類回答。

評測相關

Benchmark(評測基準)
一份標準考卷,讓不同模型在同一把尺上比分數。
MMLU / TMMLU+
大規模多任務選擇題測驗。MMLU 是英文版;TMMLU+ 是繁體中文版,考數十個科目。
Formosa-bench
台灣在地化的多科目評測資料集,Twinkle-Eval 內建支援。
Position Bias(位置偏好)
模型偏愛選某個位置的選項(如老愛選 A)的毛病。對策:打亂選項順序
Standard Deviation(標準差)
衡量多次評測分數的「飄動程度」。標準差小=分數穩=可信。
Logit / Log Probability(對數機率)
模型對每個候選 token 的信心分數。logit 評測法直接比各選項的機率,免抽取、最客觀
Temperature(溫度)
控制模型輸出的隨機性。設 0 最穩定、最保守;越高越有創意也越隨機。評測時常設 0。
OpenAI-compatible API(OpenAI 相容 API)
一種業界通用的模型呼叫介面規格。只要端點符合它,Twinkle-Eval 等工具就能直接呼叫。
vLLM / SGLang / Ollama
常用的模型部署工具,能把模型架成一個 OpenAI 相容端點供評測呼叫。
Twinkle-Eval
本文第 3 章使用的開源評測工具,由 Twinkle AIAPMIC 開發,擅長並行、隨機化、穩定度量測。

找不到想查的詞?

可以用右上角的 搜尋功能,直接搜中英文關鍵字。