跳转到内容

Venus(KubeVirt)GPU / IB 直通集群网络拓扑

结论:这是一张生产现场的 GPU/IB 直通集群逻辑拓扑图(2026-09-03 依据现场描述整理)。集群规模为 1 × master-1 + 9 × computing 计算节点,其上运行 Venus(K8s 管理平台)并以 KubeVirt 部署 Windows VM;每计算节点 8× GPU 整卡直通 + IB 卡开 SR-IOV 后把 VF 直通给 VM,每个 VM 分配 1× GPU + 1× IB VF。图按三个网段组织:管理/集群段 172.16.11.0/24、工作站段 172.16.12.0/24、IB 存储/数据段 192.168.12.0/24

Venus GPU/IB 直通集群网络拓扑(竖版)

说明:本图按现场描述绘制的逻辑/物理拓扑示意,非端口级图纸;蓝/橙横线为行汇聚总线。图中已确认项:核心交换机与 IB 交换机均为单台

适用范围与环境

  • 集群:master-1(172.16.11.11,麒麟 V10 ARM64,K8s 控制面 / Venus 管理平台入口)+ 9 台 computing 计算节点(Ubuntu x86)
  • 虚拟化:Venus 管理平台运行于 K8s,以 KubeVirt 部署虚拟机
  • 每台计算节点硬件:2× IB 网卡 + 2× 万兆网卡(bond 模式)+ 8× GPU
  • 交换机:核心华为 CE6881-48S6CQ(单台,Vlanif1 = 172.16.11.1/24);IB 交换机 NVIDIA 200G HDR(单台)
  • 存储:4 台存储阵列,双控制器,VM 经 IB VF 访问共享存储(NFS over IPoIB)

网络分段

网段用途接入设备
172.16.11.0/24管理 / 集群 / 存储万兆口(服务器与存储口 1–36)计算节点万兆 bond、存储阵列双万兆 bond、master-1
172.16.12.0/24工作站接入(CE6881 工作站口 37–47)工作站 ×10(每台双万兆网卡,现场启用 1 口)
192.168.12.0/24IB 存储 / 数据网(200G HDR)计算节点 IB bond + VM IB VF、存储阵列 IB 口

节点与 IP 规划

  • master-1 = 172.16.11.11:K8s 控制面 / Venus 管理平台入口(麒麟 V10 ARM64)
  • computing-9 = 172.16.11.13:由原 master-3 改作计算节点,故其地址小于 computing-1 的 .14
  • computing-1 ~ computing-8 = 172.16.11.14 – .21
  • IB 地址规则:计算节点 IB 192.168.12.13 – .21 与万兆 172.16.11.13 – .21 末位一一对应
  • 存储阵列:IB 数据口 192.168.12.41 – .44;双万兆(bond)管理口 172.16.11.41 – .44(两网同为 .41–.44)

直通模型

  • 每计算节点:8× GPU 整卡 PCIe 直通 + IB 卡 SR-IOV 后把 VF 直通给 VM(IB SR-IOV VF 与宿主机 IB bond 共用同一 IB 交换网)
  • 每个 Venus VM:分配 1× GPU + 1× IB VF,经 IB VF 访问存储(NFS over IPoIB)

事实来源与不确定性

  • 用户提供(2026-09-03 现场描述):节点数量与命名、IP 规划、端口归属、直通模型、交换机数量
  • 合理推断:工作站双万兆启用 1 口(另 1 口冗余备用);计算节点与存储阵列双万兆为 bond 高可用
  • 端口号(1–36 / 37–47)为交换机端口规划,与华为 CE6881 现场方案一致,见 CE6881 VLAN 隔离

相关文档

基于 MIT 许可发布