大模型:参数量几十亿~万亿级别(如 GPT‑4、DeepSeek‑V3、Qwen‑72B)
小模型:参数量几亿~十几亿级别(如 Qwen‑1.8B/4B、Llama‑3‑8B、Phi‑3)
1. 参数量与规模
大模型:数十亿~上万亿参数,海量权重,模型文件几十 GB~几百 GB
小模型:几百万~十几亿参数,模型文件几百 MB~几 GB
2. 硬件运行要求
大模型
推理:需要高端 GPU(多张 A100/H100),显存需求高;本地很难跑,大多云端 API 调用
微调:需要多卡集群,算力成本昂贵
小模型
推理:普通消费级显卡、甚至 CPU、嵌入式设备(手机、边缘盒子)就可本地部署
微调:单张消费显卡即可做 LoRA 微调,成本很低
3. 能力表现
大模型
✅ 强:复杂推理、多步骤逻辑、通识知识、创作、复杂代码、跨领域泛化、长文本理解
❌ 缺点:推理速度慢、token 成本高、幻觉依然存在、隐私差(云端调用)
小模型
✅ 强:速度快、延迟低、成本极低,垂直领域做微调后,专项任务效果可以接近大模型;适合私有化、边缘部署
❌ 缺点:通用通识、复杂多步推理、创造性任务弱;容易逻辑断裂,知识面有限;不微调时泛化差
重点:小模型不是 “缩小版大模型”,不经过领域微调,直接拿来通用问答会很差;但垂直场景微调后性价比极高。
4. 上下文窗口
大模型:通常支持 128K、256K 甚至百万 token 超长上下文,读整本书、整份项目文档
小模型:原生上下文普遍 4K‑32K,超长文档处理能力弱
5. 使用场景
大模型适合
通用问答、复杂方案撰写、深度推理、复杂代码生成、多轮复杂对话、通用 RAG
研发头脑风暴、综合性分析
小模型适合
本地私有化部署、边缘设备;企业内部专项任务:分类、抽取、简单摘要、指令执行、内网 RAG
高并发业务(对延迟敏感)、端侧 AI、嵌入式、机器人、IoT;大量批量推理,要控制成本
6. 幻觉与对齐
大模型:对齐充分,输出更稳定,但依然有幻觉;知识广,错误分散
小模型:基础对齐弱,容易胡说八道;必须做 SFT/RLHF 微调,否则指令跟随差;知识覆盖面有限
7. 成本对比
简单总结
追求通用、强推理、广知识面 → 选大模型(云端)
追求本地部署、低延迟、高并发、垂直业务 → 选小模型,配合领域微调
现在行业主流架构:大模型做复杂决策,小模型做前置预处理、抽取、分类,大小模型协同