BIOS工程师标准作业书 之 PCIE 问题如何处理

2024-08-31 15:20

本文主要是介绍BIOS工程师标准作业书 之 PCIE 问题如何处理,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

bios 工程师作为最基层的岗位,做事情一定要按部就班,肯定不能随意发挥。PCI 作为服务器中最主要的总线,也是最容易出bug 的地方。所以我整理了这篇文章。

当前x86系统PCIe架构中面临的挑战以及问题

系统设计中使用了不同供应商的硬件模块,不同的硬件模块都有各自的错误处理和报错机制。

在这么复杂的系统中,如何快速定位故障的模块,并使系统重新健康的上线工作

如何在复杂的系统中,找到问题的根因(root cause), 尤其是超时类的问题?

我们收集了日常工作中所遇到的问题。

PCIe 架构中所面临的问题:

PCIE 设备找不到

PCIE 设备没有跑在所期望的Link speed/ Link width

系统运行过程中,Pcie 设备产生了错误,要怎么处理

在做热插拔的时候,设备发生问题要怎么处理,有可能找不到,有可能

今天主题

服务器的PCIE 拓扑架构

先介绍一下背景知识:

root port:

就是我们说的根节点,pcie 的根节点,它能连接pcie的其他设备, 并且让其他设备在os 下能正常工作。

switch: 相当于usb hub, 就是作扩展作用的。比如32 进72 出。

retimer: 如果直接连,经过的链路太长,信号品质会下降,所以我们需要retimer. 

从软件的角度,我们是如何发现这些pcie设备的:

我们用lspci 观察一下,上面pcie 这条链路上的设备。从根节点开始,一个switch 一个nvme 一个oam

1: root port, bus number 60, device 1 function 0.

2 pcie switch 

3 gpu  卡 bus 号 63

4 smart nic device bus 号 64

5 nvme bus 号65

PCIE 问题的分类

林林总总的问题比较多,首先是和链路相关的部分,设备换不到, 降带宽,降速度。 RAS 错误。 对于错误类别,分为可纠正,不可纠正,热插拔的问题,

PCIE 设备找不到问题的诊断流程

在讲诊断流程之前,我们需要知道PCI 设备的初始化路线。

从主板上电开始,到pci reset , 进入LSTMM , LSTTM 经过两次到L0 状态,第一次我们要跑在gen1的状态, 然后通过recovery , 调整到gen3/4/5 状态。这个就是整个硬件的初始化,后面就是pci 枚举, 分配bus号,把真实的功能跑起来。

只要在上面,任意一个地方有问题,就会找不到

我们重点讲一下状态机。

绿色的L0 就是正常工作的状态。

detect phase: 发出一个检测脉冲, 就是在这个时候,查两端有没有设备,如果没有设备,就不会往下走。

bios 初始化过程:

检测RP 的link status 寄存器,确认LINK SPEED /WIDH 都是有效的值(ltssm 是在L0)

初始化RP设备的bus number 寄存器来构建pci topo /pcie tree

有递归算法找出整个pcie topo 上所有的pcie 设备

收集pcie 设备对资源的要求  内存和IO  (大部分设备不需要IO).

决定最终的bus 号,并组每个pcie 设备分配所需要的资源

枚举示意图:

PCIE Advanced Error Reporting (AER ) 机制

这篇关于BIOS工程师标准作业书 之 PCIE 问题如何处理的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1124276

相关文章

IDEA和GIT关于文件中LF和CRLF问题及解决

《IDEA和GIT关于文件中LF和CRLF问题及解决》文章总结:因IDEA默认使用CRLF换行符导致Shell脚本在Linux运行报错,需在编辑器和Git中统一为LF,通过调整Git的core.aut... 目录问题描述问题思考解决过程总结问题描述项目软件安装shell脚本上git仓库管理,但拉取后,上l

解决docker目录内存不足扩容处理方案

《解决docker目录内存不足扩容处理方案》文章介绍了Docker存储目录迁移方法:因系统盘空间不足,需将Docker数据迁移到更大磁盘(如/home/docker),通过修改daemon.json配... 目录1、查看服务器所有磁盘的使用情况2、查看docker镜像和容器存储目录的空间大小3、停止dock

idea npm install很慢问题及解决(nodejs)

《ideanpminstall很慢问题及解决(nodejs)》npm安装速度慢可通过配置国内镜像源(如淘宝)、清理缓存及切换工具解决,建议设置全局镜像(npmconfigsetregistryht... 目录idea npm install很慢(nodejs)配置国内镜像源清理缓存总结idea npm in

pycharm跑python项目易出错的问题总结

《pycharm跑python项目易出错的问题总结》:本文主要介绍pycharm跑python项目易出错问题的相关资料,当你在PyCharm中运行Python程序时遇到报错,可以按照以下步骤进行排... 1. 一定不要在pycharm终端里面创建环境安装别人的项目子模块等,有可能出现的问题就是你不报错都安装

idea突然报错Malformed \uxxxx encoding问题及解决

《idea突然报错Malformeduxxxxencoding问题及解决》Maven项目在切换Git分支时报错,提示project元素为描述符根元素,解决方法:删除Maven仓库中的resolv... 目www.chinasem.cn录问题解决方式总结问题idea 上的 maven China编程项目突然报错,是

Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题

《Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题》在爬虫工程里,“HTTPS”是绕不开的话题,HTTPS为传输加密提供保护,同时也给爬虫带来证书校验、... 目录一、核心问题与优先级检查(先问三件事)二、基础示例:requests 与证书处理三、高并发选型:

5 种使用Python自动化处理PDF的实用方法介绍

《5种使用Python自动化处理PDF的实用方法介绍》自动化处理PDF文件已成为减少重复工作、提升工作效率的重要手段,本文将介绍五种实用方法,从内置工具到专业库,帮助你在Python中实现PDF任务... 目录使用内置库(os、subprocess)调用外部工具使用 PyPDF2 进行基本 PDF 操作使用

前端导出Excel文件出现乱码或文件损坏问题的解决办法

《前端导出Excel文件出现乱码或文件损坏问题的解决办法》在现代网页应用程序中,前端有时需要与后端进行数据交互,包括下载文件,:本文主要介绍前端导出Excel文件出现乱码或文件损坏问题的解决办法,... 目录1. 检查后端返回的数据格式2. 前端正确处理二进制数据方案 1:直接下载(推荐)方案 2:手动构造

分析 Java Stream 的 peek使用实践与副作用处理方案

《分析JavaStream的peek使用实践与副作用处理方案》StreamAPI的peek操作是中间操作,用于观察元素但不终止流,其副作用风险包括线程安全、顺序混乱及性能问题,合理使用场景有限... 目录一、peek 操作的本质:有状态的中间操作二、副作用的定义与风险场景1. 并行流下的线程安全问题2. 顺

Python绘制TSP、VRP问题求解结果图全过程

《Python绘制TSP、VRP问题求解结果图全过程》本文介绍用Python绘制TSP和VRP问题的静态与动态结果图,静态图展示路径,动态图通过matplotlib.animation模块实现动画效果... 目录一、静态图二、动态图总结【代码】python绘制TSP、VRP问题求解结果图(包含静态图与动态图