按底层深度学习框架、分布式训练框架、推理部署框架、微调框架、LLM 应用 / Agent 框架分成 5 大类,方便选型。
一、底层深度学习基础框架(模型原生开发)
用来从零搭建神经网络、预训练模型基座
PyTorch:当前大模型最主流,动态图,HuggingFace 生态完全基于它,支持 FSDP 分布式,LLaMA、Qwen、Mistral 等模型大多用 PyTorch 开发
TensorFlow / Keras:静态图,工业传统项目多,大模型领域现在使用率低于 PyTorch
JAX + Flax:Google,TPU 优化极强,函数式自动微分;Gemini、PaLM 系列使用,GPU 生态弱一点
MindSpore:华为,昇腾芯片原生适配,国产大模型常用
PaddlePaddle(飞桨):百度,国产深度学习框架,文心大模型基座
二、分布式训练框架(大模型预训练 / 全参数训练)
在 PyTorch/JAX 之上,解决超大模型多卡 / 多机显存不足、3D 并行
DeepSpeed(微软):ZeRO 分片技术,万亿参数训练标杆,支持数据 / 模型 / 流水线并行,同时带推理优化 DeepSpeed-MII
Colossal-AI:国产,高性能并行,易用性强,支持多种并行策略,兼顾训练 + 推理
Megatron-LM(NVIDIA):英伟达,经典大模型 3D 并行框架,适合超大规模预训练
FSDP(PyTorch 原生):Fully Sharded Data Parallel,PyTorch 官方分片,现在很多新项目替代 DeepSpeed
三、推理部署框架(模型上线、服务化、本地跑模型)
模型训练完成后,加速推理、提供 API 服务、本地私有化部署
vLLM:PagedAttention 核心,连续批处理,高并发吞吐极强,OpenAI 兼容 API,线上服务首选,支持 AWQ/GPTQ 量化
TensorRT-LLM(NVIDIA):英伟达 GPU 专用,编译优化引擎,极致单卡推理性能,适合生产环境 GPU 集群
llama.cpp:纯 C/C++,无 GPU 也能跑,GGUF 量化格式,CPU / 笔记本本地跑模型首选,跨平台
Ollama:封装 llama.cpp,一键本地拉模型、启动 API,本地原型调试最简单,适合个人 / 小场景CSDN博...
Xinference:国产开源推理服务框架,统一模型管理,支持多种推理后端,内置 WebUI
LightLLM:国产,支持多机多卡,高性能,长上下文优化
FastLLM:国产轻量推理框架,兼顾 GPU/CPU 部署
Text Generation Inference(TGI):HuggingFace 官方推理服务框架
四、高效微调框架(LoRA、QLoRA、参数高效微调)
不做全参数训练,低成本微调大模型
PEFT(HuggingFace):官方库,LoRA/QLoRA/P-Tuning 等,和 Transformers 无缝集成
LLaMA-Factory:一站式微调平台,WebUI,支持上百种模型(Qwen、LLaMA、ChatGLM),LoRA / 全参数微调,非常流行
Axolotl:YAML 配置驱动,社区常用,适合批量实验微调
Unsloth:专门加速 LoRA 微调,显存占用大幅降低,训练速度提升明显
Swift(阿里达摩院):国产框架,通义千问等模型友好,支持多模态 LLM 微调
五、LLM 应用 & Agent 开发框架(RAG、智能体、应用层)
不是跑模型权重,而是基于大模型 API / 本地模型搭建业务应用
LangChain:最流行 LLM 应用框架,Prompt 模板、Chain、RAG、工具调用;LangGraph 用来做循环 Agent 工作流稀土掘金
AutoGen(微软):多智能体 Agent 框架,多个角色 Agent 对话协作,支持人工介入,适合复杂任务自动化
LlamaIndex:聚焦 RAG,文档索引、检索增强,知识库应用首选
Semantic Kernel(微软):企业级 Agent 编排,多模型、插件化,适合.NET/ 企业业务系统
快速选型参考
从零预训练大模型:PyTorch + DeepSpeed / Megatron-LM
做 LoRA 微调实验:LLaMA-Factory、PEFT、Unsloth
GPU 线上高并发服务:vLLM、TensorRT-LLM
个人电脑本地跑模型:Ollama、llama.cpp
知识库 RAG 应用:LlamaIndex + LangChain
多 Agent 复杂任务:AutoGen、LangGraph
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢