单节点推理
GenAI-Perf 将推理请求直接发送到特定 MI300X 推理服务器上运行的 SGLang 端点。在引入外部负载平衡之前,此模式可用于验证单服务器推理行为、建立基线以及确认单个推理端点的性能特征。
在图 4 所示的示例中,GenAI-Perf 使用 IP 地址 10.10.1.34 在 Lambda Scaler 2 上运行。对于直接测试,GenAI-Perf 使用目标端口 30000 直接向运行在 MI300-01 上的 SGLang 路由器发送推理请求。此直接路径显示的目的地址为 10.10.5.25。
此流量路径绕过 Envoy,直接以 MI300X 推理服务器为目标。其结果是更简单的流量模式,可用于隔离单个服务器、单个模型服务实例以及基准主机和推理端点之间的前端交换矩阵路径的性能。
表 7:单节点推理摘要
| 字段 | 示例/用途 |
|---|---|
| 原文 | GenAI-Perf 客户端主机 |
| 源地址示例 | 10.10.1.34 |
| 最终目标 | MI300X 推理服务器 |
| 目标地址示例 | 10.10.5.25 |
| 目标端口 | 30000 用于 SGLang 路由器服务端口 |
| 流量行为 | GenAI-Perf 将请求直接发送到一台推理服务器。 |
| 目的 | 单服务器基准和独立推理端点验证。 |