分基础概念、预训练技术、微调对齐、架构层、算力存储、推理优化、RAG 检索增强、Agent 智能体、安全对齐九大模块,附通俗释义,适合学习、汇报、笔试。
一、基础通用概念
LLM 大语言模型
基于 Transformer 架构,以文本为输入输出,具备理解、生成、推理、翻译能力的巨型神经网络。
多模态大模型 MLLM
同时处理文本、图像、音频、视频、3D 等多种数据模态的大模型(如 GPT-4V、Qwen-VL)。
基座模型 Base Model
仅经过海量无标注文本预训练、未做人类对齐微调的原始大模型,能力原始、输出不可控。
参数规模 Parameters
神经网络中可训练权重总量,单位 B(十亿)、T(万亿),参数越大理论知识储备越强。
Token 词元
文本最小处理单元,中文常为单字 / 词组,英文为子词;输入文本会先编码为 Token 序列。
上下文窗口 Context Window
模型单次输入能容纳的最大 Token 总量,窗口越大可处理超长文档、多轮长对话。
涌现能力 Emergent Ability
模型参数、训练数据达到临界规模后,突然出现小模型不具备的复杂能力(逻辑推理、工具调用、数学)。
幻觉 Hallucination
模型生成不存在、虚假、与事实矛盾的内容,是大模型核心缺陷。
Zero-shot / Few-shot / One-shot
Zero-shot:不给示例,直接让模型完成任务
One-shot:仅给 1 条任务示例
Few-shot:少量示例引导模型完成陌生任务
二、Transformer 底层架构核心术语
自注意力机制 Self-Attention
Transformer 核心,让文本中每个 Token 和序列内所有 Token 计算关联权重,捕捉上下文依赖。
多头注意力 Multi-Head Attention
将自注意力拆分为多组独立头,并行捕捉语法、语义、指代等不同维度文本关系。
Encoder 编码器 / Decoder 解码器
Encoder-only:仅编码器,擅长理解、分类、嵌入(BERT)
Decoder-only:仅解码器,擅长文本生成(GPT、Llama)
Encoder-Decoder:编解码结构,擅长翻译、摘要(T5)
位置编码 Positional Encoding
Transformer 无时序感知,通过给 Token 注入位置信息,区分词语先后顺序。
前馈神经网络 FFN
注意力层之后的两层全连接网络,用于对每个 Token 独立做特征变换、语义抽象。
层归一化 Layer Norm
稳定训练、缓解梯度消失,对每层输入特征标准化。
残差连接 Residual Connection
将层输入直接加到层输出,解决深层网络梯度消失,支持堆叠上百层 Transformer。
KV 缓存 KV Cache
推理优化技术,缓存历史 Token 的 Key、Value 注意力矩阵,生成新 Token 时无需重复计算历史序列,大幅提速。
三、预训练阶段核心技术
预训练 Pre-training
第一阶段基础训练:使用海量无标注互联网文本,让模型学习通用语言、世界知识。
自监督学习 Self-Supervised Learning
预训练主流范式,无需人工标注,从文本自身构造监督信号(如掩码预测、下一句预测)。
掩码语言模型 MLM
Encoder 模型预训练任务:随机掩盖文本中部分 Token,让模型预测被遮盖内容(BERT)。
因果语言建模 CLM
Decoder 模型预训练任务:给定前文,预测下一个 Token,单向自注意力,适配文本生成(GPT 系列)。
训练语料 Corpus
预训练使用的海量文本数据集,包含书籍、网页、论文、代码、对话等;语料质量直接决定模型基础能力。
数据清洗 Data Filtering
预训练前置步骤:过滤低质、重复、色情、暴力、错误数据,提升训练效率与模型效果。
混合精度训练 FP16/FP32/BF16
用半精度浮点存储权重,降低显存占用、加速训练,BF16 更适配大模型,数值稳定性更强。
梯度累积 Gradient Accumulation
显存不足时,多次小批次计算梯度再统一更新,等效扩大训练批次。
分布式训练
数据并行 Data Parallel:多卡 / 多机分别训练不同数据,权重同步
模型并行 Model Parallel:超大模型拆分到多张显卡,单卡无法完整加载权重
流水线并行 Pipeline Parallel:Transformer 分层拆分,流水线式计算
权重衰减 Weight Decay
正则化手段,训练时约束权重大小,防止模型过拟合。
四、微调与人类对齐技术(SFT/RLHF 系列)
微调 Fine-tuning
在预训练基座基础上,使用小体量专业标注数据二次训练,适配下游任务。
有监督微调 SFT Supervised Fine-Tuning
对齐第一步:使用人工高质量问答、对话样本微调基座,让模型学会遵循人类指令。
RLHF 基于人类反馈的强化学习
工业界主流对齐三阶段方案:SFT → 奖励模型训练 → 强化学习优化
奖励模型 RM Reward Model
RLHF 第二步模型:输入同一问题多条模型回答,输出人类偏好打分,区分优质 / 劣质回答。
PPO 近端策略优化
RLHF 核心强化学习算法,基于奖励模型分数更新大模型,提升回答贴合人类偏好程度。
DPO 直接偏好优化
RLHF 轻量化替代方案,无需单独训练奖励模型,直接用成对偏好样本微调,训练成本更低、效果接近 PPO。
KTO 知识偏好优化
改进型对齐算法,引入无关负样本,解决模型凭空生成、拒绝回答问题的场景。
LoRA 低秩自适应微调
轻量微调技术:冻结基座全部原始权重,仅训练少量低秩矩阵,显存占用极低,微调成本大幅下降。
Prefix Tuning / Prompt Tuning
冻结大模型,仅微调输入前缀 / 虚拟 Prompt 参数,超小参数量适配单任务。
指令微调 Instruction Tuning
通用微调范式:海量多样化指令数据集训练,让基座具备通用指令遵循能力,通用对话模型必备。
五、推理部署与优化术语
推理 Inference
模型训练完成后,输入用户提示词,生成文本输出的过程。
提示工程 Prompt Engineering
通过设计提示词格式、示例、约束条件,不用微调即可大幅提升模型输出质量。
System Prompt 系统提示词
全局预设指令,定义模型身份、规则、输出格式,每次对话前置注入上下文。
批量推理 Batch Inference
同时处理多条用户请求,充分利用显卡算力,提升服务吞吐量。
量化 Quantization
压缩优化,将权重高精度浮点转为低精度整数:
INT8:8 比特量化,精度损失小
INT4/INT2:4/2 比特极致压缩,显存占用大幅降低
GPTQ / AWQ / GGUF
主流量化算法:
GPTQ:工业通用后量化
AWQ:激活感知量化,低量化精度下效果更好
GGUF:llama.cpp 专用量化格式,适配 CPU 本地部署
vLLM / TensorRT-LLM / llama.cpp
主流推理加速框架:
vLLM:基于 PagedAttention,高吞吐 GPU 推理
TensorRT-LLM:英伟达官方极致推理加速
llama.cpp:纯 CPU / 轻量 GPU 本地开源推理
PagedAttention 分页注意力
vLLM 核心优化,模拟操作系统内存分页管理 KV 缓存,解决多轮对话显存碎片,提升并发量。
模型蒸馏 Model Distillation
用大基座教师模型输出数据,训练小型学生模型,小模型复刻大模型能力,降低部署成本。
动态批处理 Dynamic Batching
服务端自动聚合长短不一的用户请求,最大化显卡算力利用率。
六、RAG 检索增强生成技术
RAG Retrieval-Augmented Generation 检索增强生成
解决模型幻觉、知识过时方案:先检索外部知识库真实资料,再将检索内容送入模型生成回答。
向量嵌入 Embedding
将文本、文档转换为低维数值向量,语义相近文本向量距离更近,用于语义检索。
向量数据库 Vector DB
专门存储、快速检索文本向量的数据库(Chroma、FAISS、Milvus、Pinecone)。
分块 Chunking
将长文档切割为固定长度文本片段,单独生成向量检索,避免超长文本语义稀释。
重排序 Rerank
粗检索获取多条文档后,用轻量排序模型二次打分筛选最相关文档,提升 RAG 准确性。
上下文压缩 Context Compression
过滤检索文档内无关冗余内容,只保留和用户问题相关片段,节省上下文窗口。
混合检索 Hybrid Search
关键词检索(BM25)+ 向量语义检索结合,兼顾精准关键词匹配与模糊语义匹配。
七、Agent 智能体与工具调用
AI Agent 智能体
具备自主规划、工具调用、迭代反思能力的智能体,可自主完成复杂多步骤任务。
工具调用 Tool Calling / Function Call
模型识别用户需求,自主调用外部工具接口(搜索、计算器、数据库、代码解释器)获取实时信息。
思维链 CoT Chain-of-Thought
提示技术,引导模型分步拆解复杂推理问题,输出中间思考过程,大幅提升数学、逻辑题准确率。
ToT 思维树 Tree of Thoughts
CoT 升级,模型并行生成多条推理分支,评估每条路径优劣,选择最优推理路线。
ReAct 推理 + 行动框架
Agent 标准范式:Reason 推理思考 → Action 调用工具,循环迭代直至任务完成。
Self-Reflection 自我反思
Agent 完成一轮任务后,复盘回答错误、工具调用缺陷,自主修正优化下一轮输出。
规划器 Planner
Agent 核心组件,将复杂大任务拆解为有序子任务清单,分步执行。
MCP 多智能体协作
多个分工不同 Agent 协同完成超复杂业务流程。
八、多模态专属术语
视觉编码器 Vision Encoder
多模态模型组件,将图片像素编码为和文本 Token 维度匹配的视觉特征向量。
跨模态对齐 Cross-Modal Alignment
训练阶段对齐图像、文本特征空间,实现图文匹配、看图问答。
图文预训练 CLIP
经典多模态基座,对比学习训练图像 - 文本匹配能力,绝大多数视觉大模型基础。
VQA 视觉问答
多模态下游任务:输入图片 + 问题,模型基于图像内容给出文字回答。
Audio Encoder 音频编码器
音频大模型组件,将语音波形转为文本对齐特征,实现语音识别、语音对话。
九、安全、对齐、评估类术语
内容安全对齐 Safety Alignment
约束模型拒绝生成暴力、色情、诈骗、违法、偏见有害内容。
红队测试 Red Teaming
安全评测手段,专业人员构造各类诱导提示词,攻击模型寻找安全漏洞、越狱漏洞。
越狱 Prompt Jailbreak
恶意构造提示词绕过模型安全限制,诱导模型输出违规有害内容。
偏见 Bias
模型训练数据携带的性别、地域、种族刻板印象,导致输出带有不公平主观偏见。
可控性 Controllability
模型输出风格、长度、格式、立场可被用户指令精准约束的能力。
困惑度 Perplexity PPL
模型基础能力评估指标,数值越低代表模型对文本预测越精准、语言流畅度越高。
BLEU / ROUGE / MMLU / GSM8K
主流评测数据集 / 指标:
BLEU/ROUGE:翻译、摘要文本匹配指标
MMLU:多学科综合知识测评
GSM8K:小学数学逻辑推理测评
事实性评测 Factuality Evaluation
专门衡量模型输出内容与真实世界事实匹配程度,量化幻觉发生率。