易君召
易君召
发布于 2026-07-29 / 2 阅读
0
0

大模型核心技术术语完整整理

#AI

基础概念、预训练技术、微调对齐、架构层、算力存储、推理优化、RAG 检索增强、Agent 智能体、安全对齐九大模块,附通俗释义,适合学习、汇报、笔试。

一、基础通用概念

  1. LLM 大语言模型

    基于 Transformer 架构,以文本为输入输出,具备理解、生成、推理、翻译能力的巨型神经网络。

  2. 多模态大模型 MLLM

    同时处理文本、图像、音频、视频、3D 等多种数据模态的大模型(如 GPT-4V、Qwen-VL)。

  3. 基座模型 Base Model

    仅经过海量无标注文本预训练、未做人类对齐微调的原始大模型,能力原始、输出不可控。

  4. 参数规模 Parameters

    神经网络中可训练权重总量,单位 B(十亿)、T(万亿),参数越大理论知识储备越强。

  5. Token 词元

    文本最小处理单元,中文常为单字 / 词组,英文为子词;输入文本会先编码为 Token 序列。

  6. 上下文窗口 Context Window

    模型单次输入能容纳的最大 Token 总量,窗口越大可处理超长文档、多轮长对话。

  7. 涌现能力 Emergent Ability

    模型参数、训练数据达到临界规模后,突然出现小模型不具备的复杂能力(逻辑推理、工具调用、数学)。

  8. 幻觉 Hallucination

    模型生成不存在、虚假、与事实矛盾的内容,是大模型核心缺陷。

  9. Zero-shot / Few-shot / One-shot

    • Zero-shot:不给示例,直接让模型完成任务

    • One-shot:仅给 1 条任务示例

    • Few-shot:少量示例引导模型完成陌生任务

二、Transformer 底层架构核心术语

  1. 自注意力机制 Self-Attention

    Transformer 核心,让文本中每个 Token 和序列内所有 Token 计算关联权重,捕捉上下文依赖。

  2. 多头注意力 Multi-Head Attention

    将自注意力拆分为多组独立头,并行捕捉语法、语义、指代等不同维度文本关系。

  3. Encoder 编码器 / Decoder 解码器

    • Encoder-only:仅编码器,擅长理解、分类、嵌入(BERT)

    • Decoder-only:仅解码器,擅长文本生成(GPT、Llama)

    • Encoder-Decoder:编解码结构,擅长翻译、摘要(T5)

  4. 位置编码 Positional Encoding

    Transformer 无时序感知,通过给 Token 注入位置信息,区分词语先后顺序。

  5. 前馈神经网络 FFN

    注意力层之后的两层全连接网络,用于对每个 Token 独立做特征变换、语义抽象。

  6. 层归一化 Layer Norm

    稳定训练、缓解梯度消失,对每层输入特征标准化。

  7. 残差连接 Residual Connection

    将层输入直接加到层输出,解决深层网络梯度消失,支持堆叠上百层 Transformer。

  8. KV 缓存 KV Cache

    推理优化技术,缓存历史 Token 的 Key、Value 注意力矩阵,生成新 Token 时无需重复计算历史序列,大幅提速。

三、预训练阶段核心技术

  1. 预训练 Pre-training

    第一阶段基础训练:使用海量无标注互联网文本,让模型学习通用语言、世界知识。

  2. 自监督学习 Self-Supervised Learning

    预训练主流范式,无需人工标注,从文本自身构造监督信号(如掩码预测、下一句预测)。

  3. 掩码语言模型 MLM

    Encoder 模型预训练任务:随机掩盖文本中部分 Token,让模型预测被遮盖内容(BERT)。

  4. 因果语言建模 CLM

    Decoder 模型预训练任务:给定前文,预测下一个 Token,单向自注意力,适配文本生成(GPT 系列)。

  5. 训练语料 Corpus

    预训练使用的海量文本数据集,包含书籍、网页、论文、代码、对话等;语料质量直接决定模型基础能力。

  6. 数据清洗 Data Filtering

    预训练前置步骤:过滤低质、重复、色情、暴力、错误数据,提升训练效率与模型效果。

  7. 混合精度训练 FP16/FP32/BF16

    用半精度浮点存储权重,降低显存占用、加速训练,BF16 更适配大模型,数值稳定性更强。

  8. 梯度累积 Gradient Accumulation

    显存不足时,多次小批次计算梯度再统一更新,等效扩大训练批次。

  9. 分布式训练

    • 数据并行 Data Parallel:多卡 / 多机分别训练不同数据,权重同步

    • 模型并行 Model Parallel:超大模型拆分到多张显卡,单卡无法完整加载权重

    • 流水线并行 Pipeline Parallel:Transformer 分层拆分,流水线式计算

  10. 权重衰减 Weight Decay

    正则化手段,训练时约束权重大小,防止模型过拟合。

四、微调与人类对齐技术(SFT/RLHF 系列)

  1. 微调 Fine-tuning

    在预训练基座基础上,使用小体量专业标注数据二次训练,适配下游任务。

  2. 有监督微调 SFT Supervised Fine-Tuning

    对齐第一步:使用人工高质量问答、对话样本微调基座,让模型学会遵循人类指令。

  3. RLHF 基于人类反馈的强化学习

    工业界主流对齐三阶段方案:SFT → 奖励模型训练 → 强化学习优化

  4. 奖励模型 RM Reward Model

    RLHF 第二步模型:输入同一问题多条模型回答,输出人类偏好打分,区分优质 / 劣质回答。

  5. PPO 近端策略优化

    RLHF 核心强化学习算法,基于奖励模型分数更新大模型,提升回答贴合人类偏好程度。

  6. DPO 直接偏好优化

    RLHF 轻量化替代方案,无需单独训练奖励模型,直接用成对偏好样本微调,训练成本更低、效果接近 PPO。

  7. KTO 知识偏好优化

    改进型对齐算法,引入无关负样本,解决模型凭空生成、拒绝回答问题的场景。

  8. LoRA 低秩自适应微调

    轻量微调技术:冻结基座全部原始权重,仅训练少量低秩矩阵,显存占用极低,微调成本大幅下降。

  9. Prefix Tuning / Prompt Tuning

    冻结大模型,仅微调输入前缀 / 虚拟 Prompt 参数,超小参数量适配单任务。

  10. 指令微调 Instruction Tuning

    通用微调范式:海量多样化指令数据集训练,让基座具备通用指令遵循能力,通用对话模型必备。

五、推理部署与优化术语

  1. 推理 Inference

    模型训练完成后,输入用户提示词,生成文本输出的过程。

  2. 提示工程 Prompt Engineering

    通过设计提示词格式、示例、约束条件,不用微调即可大幅提升模型输出质量。

  3. System Prompt 系统提示词

    全局预设指令,定义模型身份、规则、输出格式,每次对话前置注入上下文。

  4. 批量推理 Batch Inference

    同时处理多条用户请求,充分利用显卡算力,提升服务吞吐量。

  5. 量化 Quantization

    压缩优化,将权重高精度浮点转为低精度整数:

    • INT8:8 比特量化,精度损失小

    • INT4/INT2:4/2 比特极致压缩,显存占用大幅降低

  6. GPTQ / AWQ / GGUF

    主流量化算法:

    • GPTQ:工业通用后量化

    • AWQ:激活感知量化,低量化精度下效果更好

    • GGUF:llama.cpp 专用量化格式,适配 CPU 本地部署

  7. vLLM / TensorRT-LLM / llama.cpp

    主流推理加速框架:

    • vLLM:基于 PagedAttention,高吞吐 GPU 推理

    • TensorRT-LLM:英伟达官方极致推理加速

    • llama.cpp:纯 CPU / 轻量 GPU 本地开源推理

  8. PagedAttention 分页注意力

    vLLM 核心优化,模拟操作系统内存分页管理 KV 缓存,解决多轮对话显存碎片,提升并发量。

  9. 模型蒸馏 Model Distillation

    用大基座教师模型输出数据,训练小型学生模型,小模型复刻大模型能力,降低部署成本。

  10. 动态批处理 Dynamic Batching

    服务端自动聚合长短不一的用户请求,最大化显卡算力利用率。

六、RAG 检索增强生成技术

  1. RAG Retrieval-Augmented Generation 检索增强生成

    解决模型幻觉、知识过时方案:先检索外部知识库真实资料,再将检索内容送入模型生成回答。

  2. 向量嵌入 Embedding

    将文本、文档转换为低维数值向量,语义相近文本向量距离更近,用于语义检索。

  3. 向量数据库 Vector DB

    专门存储、快速检索文本向量的数据库(Chroma、FAISS、Milvus、Pinecone)。

  4. 分块 Chunking

    将长文档切割为固定长度文本片段,单独生成向量检索,避免超长文本语义稀释。

  5. 重排序 Rerank

    粗检索获取多条文档后,用轻量排序模型二次打分筛选最相关文档,提升 RAG 准确性。

  6. 上下文压缩 Context Compression

    过滤检索文档内无关冗余内容,只保留和用户问题相关片段,节省上下文窗口。

  7. 混合检索 Hybrid Search

    关键词检索(BM25)+ 向量语义检索结合,兼顾精准关键词匹配与模糊语义匹配。

七、Agent 智能体与工具调用

  1. AI Agent 智能体

    具备自主规划、工具调用、迭代反思能力的智能体,可自主完成复杂多步骤任务。

  2. 工具调用 Tool Calling / Function Call

    模型识别用户需求,自主调用外部工具接口(搜索、计算器、数据库、代码解释器)获取实时信息。

  3. 思维链 CoT Chain-of-Thought

    提示技术,引导模型分步拆解复杂推理问题,输出中间思考过程,大幅提升数学、逻辑题准确率。

  4. ToT 思维树 Tree of Thoughts

    CoT 升级,模型并行生成多条推理分支,评估每条路径优劣,选择最优推理路线。

  5. ReAct 推理 + 行动框架

    Agent 标准范式:Reason 推理思考 → Action 调用工具,循环迭代直至任务完成。

  6. Self-Reflection 自我反思

    Agent 完成一轮任务后,复盘回答错误、工具调用缺陷,自主修正优化下一轮输出。

  7. 规划器 Planner

    Agent 核心组件,将复杂大任务拆解为有序子任务清单,分步执行。

  8. MCP 多智能体协作

    多个分工不同 Agent 协同完成超复杂业务流程。

八、多模态专属术语

  1. 视觉编码器 Vision Encoder

    多模态模型组件,将图片像素编码为和文本 Token 维度匹配的视觉特征向量。

  2. 跨模态对齐 Cross-Modal Alignment

    训练阶段对齐图像、文本特征空间,实现图文匹配、看图问答。

  3. 图文预训练 CLIP

    经典多模态基座,对比学习训练图像 - 文本匹配能力,绝大多数视觉大模型基础。

  4. VQA 视觉问答

    多模态下游任务:输入图片 + 问题,模型基于图像内容给出文字回答。

  5. Audio Encoder 音频编码器

    音频大模型组件,将语音波形转为文本对齐特征,实现语音识别、语音对话。

九、安全、对齐、评估类术语

  1. 内容安全对齐 Safety Alignment

    约束模型拒绝生成暴力、色情、诈骗、违法、偏见有害内容。

  2. 红队测试 Red Teaming

    安全评测手段,专业人员构造各类诱导提示词,攻击模型寻找安全漏洞、越狱漏洞。

  3. 越狱 Prompt Jailbreak

    恶意构造提示词绕过模型安全限制,诱导模型输出违规有害内容。

  4. 偏见 Bias

    模型训练数据携带的性别、地域、种族刻板印象,导致输出带有不公平主观偏见。

  5. 可控性 Controllability

    模型输出风格、长度、格式、立场可被用户指令精准约束的能力。

  6. 困惑度 Perplexity PPL

    模型基础能力评估指标,数值越低代表模型对文本预测越精准、语言流畅度越高。

  7. BLEU / ROUGE / MMLU / GSM8K

    主流评测数据集 / 指标:

    • BLEU/ROUGE:翻译、摘要文本匹配指标

    • MMLU:多学科综合知识测评

    • GSM8K:小学数学逻辑推理测评

  8. 事实性评测 Factuality Evaluation

    专门衡量模型输出内容与真实世界事实匹配程度,量化幻觉发生率。


评论