← 学习成长

预计阅读:30 分钟 | 学习目标:理解 LLM 的工作原理、Token 机制、训练四阶段、幻觉的本质


一、LLM 到底在干什么:一个「下一个词预测器」

LLM 的工作方式极其简单:给定一段文本,预测下一个最可能出现的词(token)。

你输入「今天天气真」→ LLM 算概率:「好」(78%)、「热」(12%)……→ 输出「好」→ 追加到文本后 → 继续预测 → 直到完成整个句子。

这不是思考,是概率计算。 一切能力——翻译、推理、编程、总结——全是「猜」出来的,不是「想」出来的。


二、Token:AI 世界的最小单位

为什么重要:Token 是 AI 的计价单位。不理解 token,就不理解 AI 的成本——这是 AI BD 报价的基本功。


三、LLM 训练四阶段

阶段 1:预训练(Pre-training)— 博览群书

在互联网级别的文本上做「预测下一个词」的游戏。最烧钱的阶段,GPT-4 训练一次据说 $1 亿+。

学习类型:自监督学习——数据本身自带答案(遮住最后一个词→让模型预测→跟原文对照),不需要人类标注。

产出:基座模型——什么都知道,但不知道怎么跟人对话。

阶段 2:SFT(监督微调)— 学会对话

用人类标注的高质量「问题→标准答案」对,教模型对话格式。

学习类型:监督学习——人类写标准答案,模型模仿。

阶段 3:RLHF(强化学习)— 学会什么是对的回答

人类给多个回答排优劣(A>B>C>D),模型从排名中自己总结「什么叫好回答」。

学习类型:强化学习——不告诉标准答案,只告诉「这个比那个好」。

关键洞察:RLHF 教模型的不是「正确的答案」,而是「人类喜欢的答案」。两者不完全重合。

阶段 4(可选):深度思考训练 — 学会推理

2025 年 DeepSeek-R1 引领。纯强化学习,裁判是规则验证器(数学答案对不对、代码能不能跑),不是人类偏好。模型自发学会「先想再说」。


四、为什么 AI 会胡说八道:幻觉的本质

LLM 是概率机器,不会说「我不知道」——只会找概率最高的词。当信息不在训练数据里,它会输出「概率上合理但事实上错误」的答案。

Karpathy 的类比:LLM 是互联网的「有损压缩」。就像 JPEG 图片放大看有模糊和失真,LLM 把全人类的知识压缩进几百 GB 参数,解压时细节会失真。这些失真就是幻觉。

管理幻觉的四种手段:RAG(先查后答)、提示词约束(「不确定就说不知道」)、输出验证、人类在环。


五、Dense vs MoE:两种架构

Dense MoE
每次用多少参数 全部 只激活一部分(5-20%)
代表 Llama DeepSeek-V3, GPT-4, 豆包
推理速度 较慢
推理成本

MoE 是 DeepSeek 能把价格压到 GPT-5 1/20 的根本原因。


六、训练 vs 推理:AI 商业模式的基础

训练 = 建发电站(一次性投入几千万到几亿美元)。推理 = 卖电(按 token 收费,细水长流)。客户付的是推理费。


本文对应学习路线图第一层:LLM 核心原理。上一个学习目标:AI基础认知:计算机是如何学会思考的。下一个学习目标:AI核心技术栈全解析:Prompt、RAG、Agent与微调。

🤔 遇到不懂的术语?在这里查