Skip to content

性能与大规模部署

容量参考、性能瓶颈与大规模(数百台以上)部署的架构建议。

相关文档: 部署模式 | 监控 | 网络诊断


容量参考

配置建议客户端数
单核 / 512 MB数百台
双核 / 1 GB数千台
四核 / 2 GB数千台

上表为常规管理规模参考(DHCP 租约 / 在线主机)——DHCP 是轻量协议,CPU/内存通常不是瓶颈。

真正的容量上限是「同时引导」,而非管理台数:多台客户端同时下载引导文件/ISO 时,瞬时负载远高于日常,受以下因素限制:

  • 网络带宽 — 千兆网口(≈112MB/s)决定同时下载的吞吐上限
  • 磁盘 IO — 并发读引导文件/ISO 时机械盘先撑不住,SSD 显著改善
  • 引导方式 — TFTP 串行传输;HTTP/iPXE 快一个量级,优先走 HTTP
  • Netboot 缓存 — 开启后引导文件落盘,重复引导不再外网下载

因此不建议以硬件配置直接推算可支持台数;大规模装机时按批引导(20–50 台/批),比换更强硬件更有效。

性能瓶颈与优化

环节瓶颈特征优化手段
DHCP大量并发 Discover/Request足够 CPU 核数;合理缩短租期避免地址池耗尽
TFTP引导文件串行传输引导文件保持在本地磁盘(避免网络盘);小文件优先
HTTP并发下载引导文件/ISOPxeLab 支持 HTTP 引导(iPXE),比 TFTP 快一个量级,优先走 HTTP
NFSISO 挂载与网络安装读盘大并发装机时考虑 SSD 存储;NFS 只读挂载
Netboot 缓存重复引导重复下载开启本地缓存,引导文件落盘,重复引导不再外网下载

大规模部署架构

                    ┌───────────────┐
                    │  iSCSI/文件存储 │(NFS/ISO 集中存放)
                    └───────┬───────┘

        ┌───────────────────┼───────────────────┐
        │ 业务网 VLAN       │                   │
┌───────┴───────┐   ┌───────┴───────┐   ┌───────┴───────┐
│  PxeLab A     │   │  PxeLab B     │   │  PxeLab C     │
│  (DHCP proxy) │   │  (DHCP proxy) │   │  (DHCP proxy) │
└───────┬───────┘   └───────┬───────┘   └───────┬───────┘
        │                   │                   │
    客户端 1-333        客户端 334-666       客户端 667-1000

要点:

  • 按 VLAN 拆分:每个客户端网段一台 PxeLab(proxy 模式叠加在现有 DHCP 上),引导负载水平分摊
  • 存储集中:ISO 与引导文件集中放在一处(NFS/文件存储),各 PxeLab 挂载同一份
  • 管理网隔离:管理口与业务口分离,PxeLab 管理流量不走业务网
  • 监控:接入指标快照(/api/v1/metrics,JSON 格式),关注租约数、引导流量、NFS 连接数;配合仪表盘实时观察
  • 日志:配置日志轮转(大小/天数/备份数),避免长期运行日志膨胀

批量装机场景建议

  • 同一时间只对一批机器(如 20-50 台)发起引导,避免瞬时洪峰
  • 装机流量走 HTTP/iPXE(比 TFTP 快),引导文件与镜像放本地或 SSD
  • 安装任务跟踪进度,用主机管理的 MAC 登记 + Profile 绑定实现「开机即装对应系统」
  • 定期用网络诊断(Ping/Traceroute)排查二层问题

常见问题

Q: 一台 PxeLab 最多带多少台机器? 管理规模(租约/在线主机)可达数千台(见容量参考表)。同时引导时按批错峰(20–50 台/批);超过单机管理规模或需更高并发,按 VLAN 拆分多台部署。

Q: 批量引导时很慢怎么办? 优先确认客户端走的是 HTTP 而非 TFTP(iPXE 默认 HTTP);检查 Netboot 缓存是否开启;大并发时错峰引导。

Q: 如何确认瓶颈在哪? 仪表盘看各服务流量与事件;指标快照(/api/v1/metrics)定位 DHCP/TFTP/NFS 的峰值;网络诊断验证链路质量。

PxeLab - 一体化 PXE 网络引导服务器