LLM 概述

LLM ∈ 深度学习 ∈ 机器学习;强化学习是机器学习的一个方向,并常用于优化 LLM。

层级结构图(从大到小)

  1. 机器学习(Machine Learning)— 最大的集合

目标:让模型从数据中学习模式 包含:

监督学习(分类、回归)

无监督学习(聚类、降维)

强化学习(RL)

深度学习(DL)

传统 ML(SVM、随机森林、KNN…)

  1. 深度学习(Deep Learning)— 机器学习的一个子集

核心:多层神经网络。 擅长:大规模数据、复杂模式。

深度学习内部包含:

CNN(视觉)

RNN / LSTM(序列)

Transformer(LLM 的底层)

Diffusion model(AI 图像)

  1. 大语言模型(LLM)— 深度学习的一种具体形态

LLM 特点:

架构:Transformer

目标:预测下一个 token

训练方式:自监督(巨量文本)

代表:GPT、LLaMA、Qwen、Gemma、Claude

LLM 属于:

深度学习 ➝ Transformer 模型 ➝ 大规模语言模型 (LLM)

  1. 强化学习(RL)— 用于“训练策略”的一种机器学习方法

本质是:

状态(state)

动作(action)

奖励(reward)

目标:最大化长期奖励

RL 本身不是 LLM 的必须部分,但:

LLM 为什么用强化学习?

RLHF(人类反馈强化学习) 用人类反馈作为 reward,对 LLM 的行为“微调”,让模型更符合人类偏好

RLAIF(AI 反馈 RL)

RL for planning(ReAct、Agent)

强化学习作用:

让 LLM 从“能说”进化成“听得懂要求、知道怎么做、行为更稳”的模型。

一句话框架图

机器学习
├── 传统 ML
├── 强化学习(RL)
└── 深度学习(DL)
      ├── CNN / RNN / Transformer
      └── LLM(GPT 等)

更直观点比喻

机器学习 = 整个技术宇宙

深度学习 = 其中的银河系(基于神经网络)

LLM = 银河系里的某颗明星(基于 Transformer 的语言模型)

强化学习 = 专门训练“行为策略”的方法,常用来给明星“校准价值观”