主题
Venus(KubeVirt)GPU / IB 直通集群网络拓扑
结论:这是一张生产现场的 GPU/IB 直通集群逻辑拓扑图(2026-09-03 依据现场描述整理)。集群规模为 1 × master-1 + 9 × computing 计算节点,其上运行 Venus(K8s 管理平台)并以 KubeVirt 部署 Windows VM;每计算节点 8× GPU 整卡直通 + IB 卡开 SR-IOV 后把 VF 直通给 VM,每个 VM 分配 1× GPU + 1× IB VF。图按三个网段组织:管理/集群段
172.16.11.0/24、工作站段172.16.12.0/24、IB 存储/数据段192.168.12.0/24。
说明:本图按现场描述绘制的逻辑/物理拓扑示意,非端口级图纸;蓝/橙横线为行汇聚总线。图中已确认项:核心交换机与 IB 交换机均为单台。
适用范围与环境
- 集群:master-1(172.16.11.11,麒麟 V10 ARM64,K8s 控制面 / Venus 管理平台入口)+ 9 台 computing 计算节点(Ubuntu x86)
- 虚拟化:Venus 管理平台运行于 K8s,以 KubeVirt 部署虚拟机
- 每台计算节点硬件:2× IB 网卡 + 2× 万兆网卡(bond 模式)+ 8× GPU
- 交换机:核心华为 CE6881-48S6CQ(单台,Vlanif1 = 172.16.11.1/24);IB 交换机 NVIDIA 200G HDR(单台)
- 存储:4 台存储阵列,双控制器,VM 经 IB VF 访问共享存储(NFS over IPoIB)
网络分段
| 网段 | 用途 | 接入设备 |
|---|---|---|
172.16.11.0/24 | 管理 / 集群 / 存储万兆口(服务器与存储口 1–36) | 计算节点万兆 bond、存储阵列双万兆 bond、master-1 |
172.16.12.0/24 | 工作站接入(CE6881 工作站口 37–47) | 工作站 ×10(每台双万兆网卡,现场启用 1 口) |
192.168.12.0/24 | IB 存储 / 数据网(200G HDR) | 计算节点 IB bond + VM IB VF、存储阵列 IB 口 |
节点与 IP 规划
- master-1 = 172.16.11.11:K8s 控制面 / Venus 管理平台入口(麒麟 V10 ARM64)
- computing-9 = 172.16.11.13:由原 master-3 改作计算节点,故其地址小于 computing-1 的 .14
- computing-1 ~ computing-8 = 172.16.11.14 – .21
- IB 地址规则:计算节点 IB
192.168.12.13 – .21与万兆172.16.11.13 – .21末位一一对应 - 存储阵列:IB 数据口
192.168.12.41 – .44;双万兆(bond)管理口172.16.11.41 – .44(两网同为 .41–.44)
直通模型
- 每计算节点:8× GPU 整卡 PCIe 直通 + IB 卡 SR-IOV 后把 VF 直通给 VM(IB SR-IOV VF 与宿主机 IB bond 共用同一 IB 交换网)
- 每个 Venus VM:分配 1× GPU + 1× IB VF,经 IB VF 访问存储(NFS over IPoIB)
事实来源与不确定性
- 用户提供(2026-09-03 现场描述):节点数量与命名、IP 规划、端口归属、直通模型、交换机数量
- 合理推断:工作站双万兆启用 1 口(另 1 口冗余备用);计算节点与存储阵列双万兆为 bond 高可用
- 端口号(1–36 / 37–47)为交换机端口规划,与华为 CE6881 现场方案一致,见 CE6881 VLAN 隔离
相关文档
- 华为 CE6881 VLAN 隔离(核心交换机端口规划)
- K8s 时间同步故障:apparmor 拦截 chronyd(同一集群 master-1 / computing 节点时统)