易君召
发布于 2026-09-13 / 作者:易君召 / 5 阅读
0

AI 大模型框架分类清单

#AI

底层深度学习框架、分布式训练框架、推理部署框架、微调框架、LLM 应用 / Agent 框架分成 5 大类,方便选型。

一、底层深度学习基础框架(模型原生开发)

用来从零搭建神经网络、预训练模型基座

  1. PyTorch:当前大模型最主流,动态图,HuggingFace 生态完全基于它,支持 FSDP 分布式,LLaMA、Qwen、Mistral 等模型大多用 PyTorch 开发

  2. TensorFlow / Keras:静态图,工业传统项目多,大模型领域现在使用率低于 PyTorch

  3. JAX + Flax:Google,TPU 优化极强,函数式自动微分;Gemini、PaLM 系列使用,GPU 生态弱一点

  4. MindSpore:华为,昇腾芯片原生适配,国产大模型常用

  5. PaddlePaddle(飞桨):百度,国产深度学习框架,文心大模型基座

二、分布式训练框架(大模型预训练 / 全参数训练)

在 PyTorch/JAX 之上,解决超大模型多卡 / 多机显存不足、3D 并行

  1. DeepSpeed(微软):ZeRO 分片技术,万亿参数训练标杆,支持数据 / 模型 / 流水线并行,同时带推理优化 DeepSpeed-MII

  2. Colossal-AI:国产,高性能并行,易用性强,支持多种并行策略,兼顾训练 + 推理

  3. Megatron-LM(NVIDIA):英伟达,经典大模型 3D 并行框架,适合超大规模预训练

  4. FSDP(PyTorch 原生):Fully Sharded Data Parallel,PyTorch 官方分片,现在很多新项目替代 DeepSpeed

三、推理部署框架(模型上线、服务化、本地跑模型)

模型训练完成后,加速推理、提供 API 服务、本地私有化部署

  1. vLLM:PagedAttention 核心,连续批处理,高并发吞吐极强,OpenAI 兼容 API,线上服务首选,支持 AWQ/GPTQ 量化

  2. TensorRT-LLM(NVIDIA):英伟达 GPU 专用,编译优化引擎,极致单卡推理性能,适合生产环境 GPU 集群

  3. llama.cpp:纯 C/C++,无 GPU 也能跑,GGUF 量化格式,CPU / 笔记本本地跑模型首选,跨平台

  4. Ollama:封装 llama.cpp,一键本地拉模型、启动 API,本地原型调试最简单,适合个人 / 小场景CSDN博...

  5. Xinference:国产开源推理服务框架,统一模型管理,支持多种推理后端,内置 WebUI

  6. LightLLM:国产,支持多机多卡,高性能,长上下文优化

  7. FastLLM:国产轻量推理框架,兼顾 GPU/CPU 部署

  8. Text Generation Inference(TGI):HuggingFace 官方推理服务框架

四、高效微调框架(LoRA、QLoRA、参数高效微调)

不做全参数训练,低成本微调大模型

  1. PEFT(HuggingFace):官方库,LoRA/QLoRA/P-Tuning 等,和 Transformers 无缝集成

  2. LLaMA-Factory:一站式微调平台,WebUI,支持上百种模型(Qwen、LLaMA、ChatGLM),LoRA / 全参数微调,非常流行

  3. Axolotl:YAML 配置驱动,社区常用,适合批量实验微调

  4. Unsloth:专门加速 LoRA 微调,显存占用大幅降低,训练速度提升明显

  5. Swift(阿里达摩院):国产框架,通义千问等模型友好,支持多模态 LLM 微调

五、LLM 应用 & Agent 开发框架(RAG、智能体、应用层)

不是跑模型权重,而是基于大模型 API / 本地模型搭建业务应用

  1. LangChain:最流行 LLM 应用框架,Prompt 模板、Chain、RAG、工具调用;LangGraph 用来做循环 Agent 工作流稀土掘金

  2. AutoGen(微软):多智能体 Agent 框架,多个角色 Agent 对话协作,支持人工介入,适合复杂任务自动化

  3. LlamaIndex:聚焦 RAG,文档索引、检索增强,知识库应用首选

  4. Semantic Kernel(微软):企业级 Agent 编排,多模型、插件化,适合.NET/ 企业业务系统

快速选型参考

  • 从零预训练大模型:PyTorch + DeepSpeed / Megatron-LM

  • 做 LoRA 微调实验:LLaMA-Factory、PEFT、Unsloth

  • GPU 线上高并发服务:vLLM、TensorRT-LLM

  • 个人电脑本地跑模型:Ollama、llama.cpp

  • 知识库 RAG 应用:LlamaIndex + LangChain

  • 多 Agent 复杂任务:AutoGen、LangGraph


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-llm-framework-categories-list

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/