前端交换矩阵组件
此解决方案中的前端交换矩阵包括用于交换、自动化、计算和应用负载平衡的硬件和软件组件,以及验证 AI 推理流量所需的基准测试组件。
下表介绍了经过验证的解决方案中包含的组件。
表 6:前端交换矩阵组件
| 经过验证的组件 | 在解决方案中的作用 | 描述 |
|---|---|---|
|
HPE 瞻博网络 QFX5130-32CD HPE 瞻博网络 QFX5140-24CD8O HPE 瞻博网络 QFX5240-64OD |
前端叶节点 | 为计算设备和客户端应用提供前端连接。 |
|
HPE 瞻博网络 QFX5220-32CD HPE 瞻博网络 QFX5230-64CD HPE 瞻博网络 QFX5240-64OD |
前端主干节点 | 为三级 Clos 前端交换矩阵提供主干层,从而在叶节点和主干节点之间实现冗余高速连接。 |
| HPE Juniper Apstra Data Center Director | 基于意图的自动化 | 用于简化交换矩阵部署并提供操作一致性。 |
| AMD Instinct MI300X GPU 服务器 | 运行模型服务框架的推理计算节点。 | 使用两套 AMD MI300X 系统,每套配备八个 AMD Instinct MI300X GPU。这些系统运行 SGLang 并托管 GPU 支持的模型服务端点。 |
| ConnectX-7 NIC | AMD MI300X 系统上的前端 NIC | 提供从 MI300X 推理服务器到基于 QFX 的前端交换矩阵的 400G 前端连接。 |
| Lambda 扩缩器 | 客户端、基准测试和负载平衡主机。 | 使用两个洁牙机系统。这些系统包括双 RTX 5000 Ada GPU 和 ConnectX-6 前端 NIC。 |
| Lambda-scaler-01 | Envoy 负载均衡器主机。 | 在容器内运行 Envoy,并在运行 SGLang 的 MI300X 系统之间分配查询流量。 |
| Lambda-Scaler-02 | GenAI-Perf 基准测试主机。 | 在容器内运行 NVIDIA GenAI-Perf,以生成大量推理流量并收集推理性能指标。 |
| Envoy 代理 | SGLang 推理端点前面的可选负载均衡器。 | 用于跨多个 AMD MI300X 推理服务器进行横向扩展请求分配。 |
| SGLang | 在 AMD Instinct MI300X GPU 服务器上运行的推理服务框架。 |
在 MI300X 系统上加载并运行经过验证的 LLM。它通过 GPU 支持的工作进程处理推理请求,以生成响应。 在 JVD 测试环境中,每个 GPU 支持的工作程序都在一个 AMD Instinct MI300X GPU 上运行一个本地模型实例。 |
| SGLang 路由器 | 请求在 AMD Instinct MI300X GPU 服务器上运行的路由组件。 | 直接或通过 Envoy 接收来自 GenAI-Perf 的推理请求,并将其分发到 MI300X 服务器上的本地 SGLang 工作进程。路由器侦听基准测试使用的服务端口,并将工作器分布保持在推理服务器的本地位置。 |
| NVIDIA GenAI-Perf | 推理负载生成和基准测试收集工具。 | NVIDIA GenAI-Perf 在经过验证的实验室环境中用作基准负载生成器。 |
用于这些组件的配置文件可在 瞻博网络 JVD GitHub 存储库中找到: https://github.com/Juniper/jvd/tree/main/data_center/aidc/aiml-inference-frontend