按系统自带轻量工具、进阶实时监控、资源可视化大盘、日志 / 进程 / 网络专项、容器云原生监控分类整理,覆盖运维日常排查、长期监控告警全场景。
一、系统内置轻量工具(无需安装,开箱即用)
适合临时快速排查负载、CPU、内存、磁盘、网络。
1. 综合负载
uptime
查看开机时长、1/5/15 分钟系统平均负载,最简单负载查看命令。
bash
uptimetop
Linux 老牌进程监控,实时展示 CPU、内存、进程占用,交互操作(k 杀进程、M 内存排序、P CPU 排序)。
htop(增强版 top,需 yum/apt 安装)
彩色界面、鼠标支持、树形进程、一键 kill,运维首选交互式工具。
bash
# CentOS/RHEL yum install htop # Ubuntu/Debian apt install htop
2. CPU 专项
mpstat:多核 CPU 细分监控,看每个核心使用率、空闲、iowait
bash
mpstat -P ALL 1 # 每秒输出所有CPU状态vmstat:综合 CPU、内存、IO、交换分区、中断上下文切换,性能瓶颈定位神器
bash
vmstat 1
3. 内存 / 交换分区
free:查看物理内存、buff/cache、swap 使用量
bash
free -h # 人类可读单位GB/MBslabtop:内核缓存内存占用排查
4. 磁盘 IO / 文件系统
iostat:磁盘 IO 核心工具,读写速度、IO 等待、% iowait、设备负载
bash
iostat -x 1 # 详细扩展信息,每秒刷新df:磁盘分区使用率
bash
df -hdu:目录占用磁盘大小,排查大文件
bash
du -sh /*iotop:按进程维度看磁盘读写,定位哪个进程疯狂写盘
5. 网络监控
netstat:端口、连接、路由(逐步被 ss 替代)
ss:netstat 升级版,更快,查看 TCP/UDP 连接、端口监听
bash
ss -ntlp # 查看监听TCP进程端口ifstat / sar -n DEV:网卡出入流量统计
tcpdump:抓包分析网络数据包,故障排障必备
6. 定时采样统计 sar(系统性能日志)
系统自带周期性采集工具,可记录 CPU、内存、磁盘、网络历史数据,事后复盘性能问题唯一内置工具
bash
sar -u 10 # 每10秒采集CPU
sar -r # 内存
sar -d # 磁盘IO
sar -n DEV # 网卡流量
二、轻量化第三方实时监控(单服务器交互式)
适合单台机器深度排查,界面友好,占用资源低
glances
全能一体化监控工具,单命令输出 CPU / 内存 / 磁盘 / 网络 / 进程 / 传感器 / 容器,支持 Web 页面访问,极简部署
bash
pip install glances glances -w # 启动web监控页面,浏览器访问IP:61208nload:单网卡流量可视化,直观看上下行带宽
iftop:按 IP 维度监控流量,查看服务器和哪些机器大量传输数据
ncdu:磁盘目录占用可视化,比 du 好用,快速清理大文件
三、企业级长期监控大盘(多服务器集群、告警、可视化)
适合线上生产环境,统一管理几十 / 上百台服务器,持久化存储指标、图表展示、邮件 / 钉钉 / 短信告警
1. Zabbix(传统运维老牌)
优势:成熟稳定、全功能监控(系统、数据库、中间件、硬件、日志)、内置告警、模板丰富、支持 agent 代理大规模集群
适用:传统物理机、虚拟机机房,中小大型企业通用
2. Prometheus + Grafana(云原生行业标准)
当前互联网、容器 K8s 环境主流监控方案
Prometheus:时序数据库,采集服务器 / 容器 / 中间件指标
Grafana:可视化看板,自定义精美监控图表
配套:node-exporter(Linux 服务器指标采集器)、Alertmanager(告警推送钉钉 / 企业微信)
优势:轻量、容器友好、生态丰富、自定义灵活,云原生首选
3. Nagios
老牌轻量监控,侧重状态告警(端口存活、磁盘满、负载过高),图形能力较弱,适合简单告警场景
4. Telegraf + InfluxDB + Grafana(TIG 栈)
轻量时序监控栈,Telegraf 采集器插件极多(系统、MySQL、Redis、Nginx),部署简单,对低配服务器友好
四、容器 / 云原生专用监控(Docker/K8s)
cAdvisor:谷歌开源,采集容器 CPU、内存、磁盘、网络指标,常配合 Prometheus 使用
kube-state-metrics:K8s 集群资源监控
docker stats:原生 Docker 容器实时资源查看
五、日志监控(配套指标监控,定位业务故障)
监控工具只能看资源,日志定位代码 / 业务异常:
ELK Stack(Elasticsearch+Logstash+Kibana):经典日志收集检索可视化
EFK(Filebeat+Elasticsearch+Kibana):轻量化 ELK,Filebeat 轻量采集器
Loki + Grafana:轻量云原生日志方案,和 Prometheus 生态打通,资源占用极低
六、专项监控工具
数据库监控
mysqltuner:MySQL 性能调优
pg_top:PostgreSQL 进程监控
硬件监控
sensors:CPU、主板温度风扇转速
smartctl:硬盘健康状态检测
中间件监控
redis-cli info:Redis 指标
jstat/jmap/jstack:Java JVM 内存、线程、GC 监控
工具选型建议
临时排查单台服务器:htop、iostat、vmstat、iftop、glances
事后复盘历史性能:sar
几十台以内传统机房:Zabbix
容器 / K8s / 互联网业务:Prometheus+Grafana
轻量低配机器快速可视化:TIG 栈、glances web
日志集中排查:ELK/EFK/Loki