Help us improve your experience.

Let us know what you think.

Do you have time for a two-minute survey?

 
 

前端交换矩阵组件

此解决方案中的前端交换矩阵包括用于交换、自动化、计算和应用负载平衡的硬件和软件组件,以及验证 AI 推理流量所需的基准测试组件。

下表介绍了经过验证的解决方案中包含的组件。

表 6:前端交换矩阵组件

经过验证的组件 在解决方案中的作用 描述

HPE 瞻博网络 QFX5130-32CD

HPE 瞻博网络 QFX5140-24CD8O

HPE 瞻博网络 QFX5240-64OD

前端叶节点 为计算设备和客户端应用提供前端连接。

HPE 瞻博网络 QFX5220-32CD

HPE 瞻博网络 QFX5230-64CD

HPE 瞻博网络 QFX5240-64OD

前端主干节点 为三级 Clos 前端交换矩阵提供主干层,从而在叶节点和主干节点之间实现冗余高速连接。
HPE Juniper Apstra Data Center Director 基于意图的自动化 用于简化交换矩阵部署并提供操作一致性。
AMD Instinct MI300X GPU 服务器 运行模型服务框架的推理计算节点。 使用两套 AMD MI300X 系统,每套配备八个 AMD Instinct MI300X GPU。这些系统运行 SGLang 并托管 GPU 支持的模型服务端点。
ConnectX-7 NIC AMD MI300X 系统上的前端 NIC 提供从 MI300X 推理服务器到基于 QFX 的前端交换矩阵的 400G 前端连接。
Lambda 扩缩器 客户端、基准测试和负载平衡主机。 使用两个洁牙机系统。这些系统包括双 RTX 5000 Ada GPU 和 ConnectX-6 前端 NIC。
Lambda-scaler-01 Envoy 负载均衡器主机。 在容器内运行 Envoy,并在运行 SGLang 的 MI300X 系统之间分配查询流量。
Lambda-Scaler-02 GenAI-Perf 基准测试主机。 在容器内运行 NVIDIA GenAI-Perf,以生成大量推理流量并收集推理性能指标。
Envoy 代理 SGLang 推理端点前面的可选负载均衡器。 用于跨多个 AMD MI300X 推理服务器进行横向扩展请求分配。
SGLang 在 AMD Instinct MI300X GPU 服务器上运行的推理服务框架。

在 MI300X 系统上加载并运行经过验证的 LLM。它通过 GPU 支持的工作进程处理推理请求,以生成响应。

在 JVD 测试环境中,每个 GPU 支持的工作程序都在一个 AMD Instinct MI300X GPU 上运行一个本地模型实例。

SGLang 路由器 请求在 AMD Instinct MI300X GPU 服务器上运行的路由组件。 直接或通过 Envoy 接收来自 GenAI-Perf 的推理请求,并将其分发到 MI300X 服务器上的本地 SGLang 工作进程。路由器侦听基准测试使用的服务端口,并将工作器分布保持在推理服务器的本地位置。
NVIDIA GenAI-Perf 推理负载生成和基准测试收集工具。 NVIDIA GenAI-Perf 在经过验证的实验室环境中用作基准负载生成器。

用于这些组件的配置文件可在 瞻博网络 JVD GitHub 存储库中找到: https://github.com/Juniper/jvd/tree/main/data_center/aidc/aiml-inference-frontend