预测概览
本页介绍预测分析功能如何使用机器学习模型来预测未来的行为和离群值,从而通知管理员网络中的潜在问题。
预测概述(测试版)
预测性分析使用机器学习 (ML) 技术来预测资源利用模式或设备故障中可能存在的异常值。此功能可帮助管理员主动解决问题并防止可能的中断。
Apstra 边缘设备通过 Apstra 上配置的探测接收有关网络设备的数据。边缘设备将此数据发送到 DC Assurance,ML 模型在其中执行以下任务:
-
聚合从网络接收的数据点
-
使用这些数据点训练 ML 模型,并学习正常行为以创建基线
-
根据历史数据使用经过训练的机器学习模型,预测未来数据点
-
当未来数据点超过配置的阈值时,识别预测数据中的偏差。
预测性分析功能可识别以下指标中的异常值:
-
系统运行状况
-
光纤接口运行状况
系统运行状况
预测性分析功能可识别系统 CPU 利用率和系统内存利用率指标中的异常值。它使用 Apstra 上的流接收器探测器收集的数据来学习和预测系统运行状况指标,并识别违规。此功能使您能够主动识别网络基础架构中的问题,并在其影响网络流量之前予以解决。
您可以对 Edge 设备运行预检,并验证流接收器配置是否正确。有关更多信息,请参阅 飞行前检查 。
预测性分析使用以下机器学习算法来预测系统运行状况异常值:
| 功能 |
机器学习算法 |
描述 |
|---|---|---|
| 预测 |
光梯度增强机 (LGBM) |
一种基于决策树的集成方法,可组合多个弱模型以生成单个强预测。梯度提升按顺序构建模型,每个模型都关注前一个模型所犯的错误。 |
预测性分析使用机器学习算法来分析从网络接收到的数据,以预测网络行为。启用此功能后,它需要一定数量的数据点来根据预期行为训练其模型并识别异常值。随着更多可用于分析的数据,预测的准确性和置信水平会随着时间的推移而提高。
光纤接口运行状况
-
光接口运行状况预测分析是一项技术预览功能。有关技术预览的更多信息,请参阅《Data Center Director 用户指南》中的 Juniper Apstra 技术预览。
-
光接口运行状况预测分析要求您的 Data Center Director 实例运行的是 6.1 或更高版本。
-
只有运行以下 Junos OS 演化版的设备才能基于 BER、FEC 和 CRC 指标预测光纤接口运行状况:23.4X100D31、25.2X100D10 和 25.4R1。
光缆在长距离内提供更低的延迟和更高的能效,这对于在大规模集群中保持性能至关重要。光纤接口是将光缆连接到设备以进行数据传输的端口。光接口由多个充当独立数据传输通道的光通道组成。每个通道承载总数据流的一部分,聚合多个通道以实现更高的整体带宽。
及早发现光纤接口或通道中的潜在问题,使网络管理员能够提前采取纠正措施,从而防止链路中断,确保网络的持续可靠性。
预测性分析功能可识别网络中光纤接口和通道中的异常值。它使用来自 Data Center Director 的以下数据来预测光学运行状况指标,并识别与预期行为的偏差:
-
光收发器探针收集的数字光学监控 (DOM) 指标数据。
-
由 DC Hub 的 DC 探针分析包中添加的自定义探针收集的误码率 (BER)、前向纠错 (FEC) 和循环冗余校验 (CRC) 指标数据。
预测性分析使用以下机器学习算法来预测光接口运行状况异常值:
| 功能 | 机器学习算法 | 描述 |
|---|---|---|
| 预测 |
多变量双向长短期记忆 (BiLSTM) |
双向 LSTM 是一种向前和向后处理输入序列的方法,使模型能够捕获输入序列的过去和未来上下文。多变量 BiLSTM 同时处理和分析包含多个相关参数的数据。 |
预测分析功能使用 DOM、BER、FEC 和 CRC 指标数据来预测光学指标趋势,并标记表明链路降级的异常值。
表 3 列出了 DOM 指标和指示光链路性能下降的迹象。
表 4 列出了 BER、FEC 和 CRC 指标以及指示光链路性能下降的迹象。
| DOM 指标 |
描述 |
链路性能下降的指标 |
|---|---|---|
| 接收光学功率(Rx 功率) |
接收光功率 |
值递减 |
| 发射光功率(Tx 功率) |
输出光学功率 |
减少不稳定值 |
| 激光偏置电流 |
激光偏置电源设置电流的大小 |
值递增或不稳定 |
| 电压 |
物理端口的电压 |
值波动或超出范围 |
| 温度 |
物理端口的温度 |
值递增或峰值不稳定 |
| BER、FEC 和 CRC 指标 |
描述 |
链路性能下降的指标 |
|---|---|---|
| FEC 校正码字速率 |
FEC 每秒纠正的错误数 |
增值 |
| FEC 未校正码字速率 |
每秒 FEC 未纠正的错误数 |
增值 |
| FEC 前 BER |
应用 FEC 机制之前的 BER |
增值 |
| Rx CRC 错误率 |
收到的 CRC 错误的总增长率 |
增值 |
| Tx CRC 错误率 |
传输 CRC 错误的总增长率 |
增值 |
| FEC 直方图 |
每个 FEC 直方图箱中的码字百分比 |
增加高误差箱中的值 |
光链路运行状况预测分析使用统计方法来检测预测数据中的离群值。它根据两个因素标记异常值:
-
按趋势分析的离群点检测
如果 RX 功率的预测值显示下降趋势,偏置电流和温度连续指定天数显示上升趋势,则将引发异常值。
-
基于阈值的离群点检测
如果光学运行状况参数的预测值在指定持续时间内超过配置的高告警或中等告警阈值,则会引发异常值。
注意:从探针接收 DOM 指标的阈值,并根据光收发器的供应商和部件号进行配置。用户无法修改阈值。
查看预测影响
要查看网络中的预测异常值,请导航至 Assurance > Predictions。使用站点下拉列表选择特定站点。您还可以单击“系统运行状况”或“光学异常值”卡以查看所选类型的异常值。
“ 预测” 选项卡显示按问题可能发生的预期时间和置信水平映射的异常值气泡图。每个气泡代表网络中某设备上预测的一个异常值。气泡的大小表示受该特定异常值影响的服务数量。气泡的颜色表示根据预测值是否超过系统定义的阈值确定的预测异常值的严重性级别。如果预测值超过中等阈值,则会引发具有主要严重性级别的异常值。如果预测值超过告警阈值,则会引发具有严重严重级别的异常值。置信水平以百分比显示预测的可靠性。选择任何气泡以查看预测异常值的摘要。单击气泡可查看包含有关所选离群值的信息的摘要卡。
网络拓扑中的单个节点可能有多个预测的异常值,显示为重叠的气泡。网络拓扑中的不同节点也可能具有多个预测的异常值,这些异常值具有相似的置信度或严重性级别,显示为重叠的气泡。汇总卡显示与所选气泡重叠的异常值总数。单击气泡或摘要卡片以循环浏览所有重叠的异常值。
您还可以选择 Predictions 部分右上角的列表图标,以查看列表中的预测异常值,如 图 4 所示。列表视图在表中显示预测的异常值,以及受影响设备的详细信息、异常值的置信度和严重性级别,以及事件可能发生的预测时间。
预测分析功能预测 24 小时内可能出现的系统运行状况异常值和 15 天内可能出现的光纤接口运行状况异常值。
使用“预测”部分右上角的下拉选项按问题可能发生的预期时间或特定参数进行筛选。您还可以使用 过滤器 选项,根据服务或客户端是否受到影响、异常值的严重性级别或网络中特定设备上预测的异常值来显示预测的异常值。
右窗格显示所选站点中受影响的客户端和服务的数量。您可以单击客户端和服务按钮,查看和搜索受影响客户端的完整列表。
如果未显示预测性异常值,可能是由于以下原因:
-
网络设备和光链路均按预期运行。
-
预测分析功能是新配置的,目前还没有足够的数据来进行可靠的预测。
-
流接收器和光学收发器探针未将数据从边缘设备发送到 DC Assurance。在这种情况下,请验证探针配置是否正确,以及 Apstra 上的这些探针是否启用了流式传输。
如果未显示预测异常值的受影响客户端和服务列表,可能是因为:
-
网络中没有流量流经受影响的设备。
-
DC Assurance 未从边缘设备接收流量信息。在这种情况下,请对 Edge 设备运行预检,并验证流服务器配置是否正确。有关更多信息,请参阅 飞行前检查 。
要查看有关异常值的详细信息,
从气泡图中选择一个气泡,或从“预测”列表中选择一个异常值。
单击摘要卡中的查看 详细信息 ,或选择预测部分右上角的查看 详细信息 图标。
此时将打开 “设备详细信息” 页面,其中包含所选设备的详细指标。
查看设备详细信息和服务拓扑
在 设备详细信息 页面上,将显示受监控参数的图表,其中包含所选设备的预测值以及每个参数的预测波段。预测范围表示基于预测方法的置信水平,未来观测值可能落入的值范围。预测波段越窄,表示预测的精度和可信度越高。较宽的预测波段表示预测的不确定性和可变性。
页面顶部将显示一条警报,其中包含所选资源的所有预测异常值以及每个异常值的预期出现时间。
从右上角的下拉选项中选择离群值类别,以根据您的要求修改显示的图形。
-
对于系统运行状况,该图表显示所选设备的历史、当前和预测的 CPU 和内存使用情况数据。
-
对于光纤接口运行状况,从下拉列表中选择光纤接口,页面将显示图表,其中包含所选设备的所有光纤接口运行状况参数的历史值、当前值和预测值。
您还可以从下拉选项中选择要聚合和显示在图表中的数据的时间间隔。
-
对于系统运行状况,您可以让以 15 分钟或 1 小时的间隔聚合图形显示数据。
-
对于光纤接口运行状况,您可以让图形以 1 小时、12 小时或 1 天的间隔显示聚合的数据。
如果在预测数据点中检测到异常值,则会在图表上以紫色突出显示。将鼠标悬停在离群值上可查看详细信息,例如离群值的类型、严重性、异常值的预测开始和结束时间等。
如果所选设备上的预测异常值预计会对服务和客户端产生影响,则启用 服务拓扑 选项。单击 服务拓扑 ,查看网络拓扑和流量,以及受影响的服务和客户端。
预测的好处
预测性分析功能具有以下优势:
-
向管理员提供有关可能故障的预警。
-
有助于了解预测异常值的影响。
-
使管理员能够主动预防潜在的中断。