LLM 概述
LLM ∈ 深度学习 ∈ 机器学习;强化学习是机器学习的一个方向,并常用于优化 LLM。
层级结构图(从大到小)
- 机器学习(Machine Learning)— 最大的集合
目标:让模型从数据中学习模式 包含:
监督学习(分类、回归)
无监督学习(聚类、降维)
强化学习(RL)
深度学习(DL)
传统 ML(SVM、随机森林、KNN…)
- 深度学习(Deep Learning)— 机器学习的一个子集
核心:多层神经网络。 擅长:大规模数据、复杂模式。
深度学习内部包含:
CNN(视觉)
RNN / LSTM(序列)
Transformer(LLM 的底层)
Diffusion model(AI 图像)
- 大语言模型(LLM)— 深度学习的一种具体形态
LLM 特点:
架构:Transformer
目标:预测下一个 token
训练方式:自监督(巨量文本)
代表:GPT、LLaMA、Qwen、Gemma、Claude
LLM 属于:
深度学习 ➝ Transformer 模型 ➝ 大规模语言模型 (LLM)
- 强化学习(RL)— 用于“训练策略”的一种机器学习方法
本质是:
状态(state)
动作(action)
奖励(reward)
目标:最大化长期奖励
RL 本身不是 LLM 的必须部分,但:
LLM 为什么用强化学习?
RLHF(人类反馈强化学习) 用人类反馈作为 reward,对 LLM 的行为“微调”,让模型更符合人类偏好
RLAIF(AI 反馈 RL)
RL for planning(ReAct、Agent)
强化学习作用:
让 LLM 从“能说”进化成“听得懂要求、知道怎么做、行为更稳”的模型。
一句话框架图
机器学习
├── 传统 ML
├── 强化学习(RL)
└── 深度学习(DL)
├── CNN / RNN / Transformer
└── LLM(GPT 等)
更直观点比喻
机器学习 = 整个技术宇宙
深度学习 = 其中的银河系(基于神经网络)
LLM = 银河系里的某颗明星(基于 Transformer 的语言模型)
强化学习 = 专门训练“行为策略”的方法,常用来给明星“校准价值观”