Varidata 新聞資訊
知識庫 | 問答 | 最新技術 | IDC 行業新聞
Varidata 官方博客

排查NVLink速度降級的硬體問題

發布日期:2026-08-09
在GPU伺服器主機板上重新安裝NVLink橋接器

您透過系統遙測工具偵測到高密度節點中的物理NVLink速度降級。靜默的硬體故障使您的GPU節點保持活動狀態,但這些隱藏錯誤會悄然削弱分散式模型訓練效能。當鏈路降級迫使互連降至PCIe Gen4速度而非原生頻寬時,通訊瓶頸會拖慢大型參數GPU模型的訓練。單個GPU互連故障會在重負載下降低整個叢集的效率。您的首要維運目標是快速隔離物理硬體缺陷,必須恢復完整的互連吞吐量,並驗證伺服器中每個GPU插槽的物理訊號完整性。

透過軟體診斷NVLink速度降級

在診斷GPU叢集中的NVLink速度降級時,軟體工具可提供對物理互連健康狀況的即時可見性。您可以在硬體故障中斷訓練運行之前識別頻寬瓶頸。早期軟體偵測可防止隱藏錯誤削弱整體節點效能。系統監控工具可隔離複雜互連拓撲中的物理訊號丟失。

使用nvidia-smi偵測拓撲故障

您必須使用標準系統管理工具驗證物理鏈路連接。執行nvidia-smi topo -m將顯示系統中完整的GPU到GPU拓撲矩陣。矩陣指令可揭示每張已安裝加速器之間的直接互連路徑。功能正常的鏈路會顯示NV12或類似標籤,以確認高速互連路徑。損壞或未偵測到的鏈路則顯示PHBPIXSYS代碼。這些異常的矩陣輸出意味著流量將透過PCIe根複合體路由,而非直接高速路徑。

物理訊號完整性問題會觸發自動降級至PCIe Gen4速度(64 GB/s)。這種降級會在NCCL AllReduce操作期間產生巨大的通訊開銷。您可以使用特定的查詢工具來驗證當前活動速度。

檢查類型

指令示例

預期輸出(功能完全正常)

預期輸出(降級/非功能)

NVLink狀態與速度

nvidia-smi nvlink -s

輸出列出活動速度,如25.781250GB/s

輸出顯示所有鏈路均為非活動狀態。

GPU拓撲矩陣

nvidia-smi topo -m

矩陣儲存格顯示NV前綴,如NV4

矩陣儲存格顯示SYSPHB

錯誤的對齊路由會阻止系統各rank充分利用頻寬。當rank錯位時,NCCL AllReduce等基準測試會顯示出嚴重的效能下降。次優的rank映射會導致互連流量經過較慢的節點間連接,而非本地高速匯流排。硬體故障會將訓練任務的基準頻寬限制在預期的50–60%。

使用DCGM追蹤訊號錯誤率

遙測工具透過即時捕獲鏈路錯誤指標來隔離硬體降級。您可以執行dcgmi nvlink --errors -g [GPU_ID]來檢查目標GPU單元上的錯誤計數器。系統會記錄CRC資料錯誤、接收流控制數字錯誤、重放事件和恢復事件。物理污染或物理損壞會導致錯誤率依序經歷這些不同階段而不斷升高。

  • CRC FLIT Error:計數接收流控制數字CRC錯誤。

  • CRC Data Error:追蹤接收資料CRC錯誤。

  • Replay Error:測量由丟包引起的發送重放事件。

  • Recovery Error:記錄鏈路重新訓練期間的發送恢復事件。

未解決的互連故障會傳播到相鄰硬體。研究表明,在42%的觀察案例中,NVLink錯誤會傳播到連接的GPU設備。活躍的互連錯誤有54%的機率導致作業失敗。重複的錯誤事件表明物理鏈路狀況惡化,從而破壞訓練管道的穩定性。

DCGM_FR_VOLATILE_DBE_DETECTED:報告一個或多個揮發性雙位錯誤(DBE)(自上次GPU復位以來不可恢復的記憶體錯誤)。

DCGM監控特定閾值以標記嚴重的NVLink速度降級。指標DCGM_FR_NVLINK_CRC_ERROR_THRESHOLD在錯誤超過每秒100個CRC錯誤時觸發警報。關鍵事件需要立即關注,因為清除嚴重錯誤需要對受影響的GPU插槽進行完全復位。在深度學習操作期間,完全復位會造成超過2小時的節點停機。您必須及早修復這些軟體警報,將每個GPU恢復到完整能力,以保持最佳系統效能。

在物理層排查GPU叢集問題

當軟體遙測指示物理層故障時,您必須直接轉向物理硬體干預。透過在專用的防靜電工作台上維修個別加速器節點來隔離物理訊號丟失。冷備用維護規程可在物理硬體處理期間保護敏感的電子路徑。您必須完全關閉整個節點並斷開主動電源,然後再打開機箱以安全地執行GPU叢集排查。

重新安裝NVLink橋接器和SXM模組

不穩定的物理連接通常源於導熱墊鬆動、板卡彎曲、安裝扭矩不均勻或運行期間的機械振動。您必須遵循嚴格的斷電流程,重置所有啟用NVLink的硬體上的物理連接,而不會使敏感走線短路。

  1. 完全關閉AI伺服器節點,釋放殘餘電量,並斷開所有主輸入電源線。

  2. 卸下伺服器頂蓋,露出主機板組件和NVLink橋接單元。

  3. 小心地垂直向上提起兩側手柄,拔下NVLink橋接器。

  4. 擰鬆SXM基板固定器,以接觸每張已安裝GPU單元的主插槽介面。

  5. 小心地從插槽中提起每個GPU模組,使用乾燥壓縮空氣清除插槽導銷上的異物,然後將硬體牢固地安裝到位。

  6. 垂直用力重新安裝NVLink橋接器,以確保GPU到GPU的物理互連路徑。

恢復物理對齊可修復基本的接觸問題。但是,對電氣和光學配合表面的物理檢查仍然至關重要。

清潔光學和銅質互連觸點

髒污觸點、氧化和引腳錯位會降低高速通訊通道的物理訊號完整性。在重新組裝任何GPU系統組件之前,您必須在放大條件下徹底檢查所有硬體配合表面。

檢查目標

推薦工具/材料

目的/備註

NVLink背板/連接器上的彎針

手電筒、放大鏡、尖頭工具(如探針)、內視鏡

用於視覺識別,並在可能的情況下輕輕校直彎針。內視鏡可檢查深插槽。

銅質連接器上的污染物

無絨擦拭布、異丙醇(IPA)

用於清潔連接器表面的灰塵或顆粒,確保良好的電氣接觸並防止鏈路故障。

彎曲的插針會中斷資料傳輸線,而表面碎屑會降低整體訓練效能。您還必須仔細檢查每台GPU伺服器上的光學收發器介面。

  1. 首先使用光纖顯微鏡檢查連接器。如果乾淨,立即進行配合;不要清潔。

  2. 使用無絨擦拭布或卡式清潔器單次乾擦。避免往復運動。

  3. 再次檢查。僅當仍有污染物時再進行濕清潔。

  4. 濕清潔:使用光纖級溶劑(非普通IPA)單次擦拭,然後立即使用無絨擦拭布單次乾擦。切勿連續進行兩次濕擦。

  5. 進行最終檢查。如果通過,則連接器可以進行配合。

為什麼普通IPA不適用:普通異丙醇(IPA)具有吸濕性,蒸發緩慢,並且經常留下比原始污染物更難去除的殘留物。對於輕微污染,應使用光纖級清潔液或完全跳過濕清潔。

正確的清潔可恢復整個叢集互連結構中原始的光傳輸通道。在將GPU主機重新投入生產管道之前,您可確保連接的GPU插槽矩陣具有最大穩定性。

解決導致NVLink頻寬降低的熱學原因

修復局部NVSwitch冷卻故障

機箱內的極端高溫會導致靜默的硬體降速。NVSwitch晶片上的局部冷卻故障會迅速破壞高速互連的穩定性。當內部散熱器移位或風扇故障時,目標設備會經歷快速的熱膨脹。這種熱量會觸發保護性韌體降低鏈路吞吐量,從而在整個GPU伺服器節點上導致嚴重的NVLink速度降級。

您可以透過檢查GPU系統事件日誌來識別這些硬體過熱狀態。特定的熱警告代碼指示冷卻不足何時迫使交換機進入較低工作狀態。

錯誤代碼

事件名稱

描述及對效能的影響

10004

Host_thermal_event_start

指示系統冷卻不足。此事件可迫使受影響的NVSwitch鏈路進入較低功耗的單通道模式,從而降低NVLink吞吐量和整體頻寬。

10005

Host_thermal_event_end

確認系統因潛在的冷卻問題而經歷了熱事件,該事件曾影響鏈路效能。

當事件10004出現時,您必須立即檢查導熱介面材料。更換乾涸的導熱膏可恢復基板上的直接熱擴散。確保平衡的氣流可穩定結構溫度並防止鏈路降入單通道模式。

管理熱節流和動態功率限制

熱節流是指GPU(或CPU)在達到預定義溫度限制時,自動降低時脈頻率和電壓以防止過熱。

您必須即時追蹤每個GPU加速器的溫度,以防止鏈路瓶頸。過高的熱量會強制處理器降頻,從而停滯整個結構中的通訊。在每個GPU上執行診斷查詢可揭示每個受影響處理器的確切降速狀態。

nvidia-smi指令

主要目的

與查詢的直接相關性

nvidia-smi -q -d TEMPERATURE,PERFORMANCE

顯示預設的熱降速/關機閾值,並報告當前熱節流狀態。

直接監控熱節流狀態並顯示預設閾值,這是任何調整的基礎。

結合gpu-burnnvidia-smi使用

對GPU單元進行壓力測試並監控是否發生熱節流。

提供一種方法,透過實驗驗證當前熱閾值在負載下是否會觸發。

您可以使用sudo nvidia-smi -pl [功率限制值(瓦特)]來限制功率消耗。降低GPU功耗可直接減少熱量產生。這種功率調整可保持穩定的溫度,並在繁重工作負載下保護每個GPU插槽的總NVLink頻寬。在開始生產運行之前,使用GPU工作負載對系統進行壓力測試,以驗證您的熱修復措施。

驗證NVLink頻寬恢復

使用NCCL測試對互連進行壓力測試

您必須執行標準化基準測試套件,以驗證整個結構中的物理硬體修復。從官方nccl-tests倉庫編譯二進位檔案,使您能夠跨所有系統插槽執行all_reduce_perf工具。您可以使用mpirun標誌啟動可擴展的壓力測試,以評估高資料負載下的通訊效率。

mpirun --bind-to none -mca btl tcp,self -mca coll_hcoll_enable 0 -mca btl_tcp_if_include enp27s0np0 -x PATH -x LD_LIBRARY_PATH ${NCCL_TESTS_HOME}/build/all_reduce_perf -b 3G -e 24G -f 2 -g 8

設定特定的指令參數可將資料傳輸推至最大容量。起始緩衝區-b 3G和結束緩衝區-e 24G標誌用於測試不同有效負載大小下的網路擴展能力。-g 8標誌指定在單台主機的8個GPU設備上進行測試。您可以配置環境變數,如NCCL_MIN_CTASNCCL_MAX_CTAS,以在效能測試期間強制特定的通道分配。將NCCL_NVLS_ENABLE設定為2可在現代系統上啟用硬體卸載。成功測試可確認NVLink 3.0平台達到每個GPU插槽600 GB/s的雙向吞吐量,而NVLink 4.0配置則實現每個GPU單元900 GB/s的總雙向頻寬。

執行修復後的硬體檢查清單

在將GPU伺服器主機重新投入生產管道之前,您需要執行系統的驗證序列。

  1. 執行nvidia-smi查看GPU對等連接矩陣,並確認每個GPU模組上的活動鏈路狀態。

  2. 執行nvidia-smi topo -m檢查GPU拓撲表,並確認直接結構路徑。

  3. 執行nvidia-smi nvlink --status檢查每個物理GPU插槽上的各鏈路速度並驗證活動狀態。

  4. 執行CUDA deviceQuery範例程式,以驗證軟體層能識別完全恢復的硬體堆疊。

系統化檢查可確保叢集中每個已安裝加速器的長期穩定性。驗證物理鏈路狀態可防止在繁重訓練工作負載期間出現速度下降。在執行大型模型訓練作業之前,您需確認每個GPU到GPU互連路徑的完整物理健康狀態。完成這些驗證步驟可保證最佳的NVLink頻寬,並使節點恢復生產運行能力。

您透過遵循嚴格的工作流程來解決NVLink速度降級問題。首先,執行nvidia-smi topo -m以識別損壞的路徑。接下來,關閉系統以重新安裝模組並清潔銅質觸點。主動監控誤碼率可防止大型AI叢集節點中出現靜默瓶頸。系統管理員追蹤諸如DCGM_FI_DEV_NVLINK_BANDWIDTH_TOTAL等指標以儘早捕獲故障。您還須留意XID 145和XID 149等硬體警報。最後,使用NCCL工具執行壓力測試。在將GPU節點重新投入生產之前,這些測試可驗證完整的NVLink頻寬恢復情況。

常見問題解答

如何識別GPU伺服器上降級的NVLink連接?

在GPU主機上執行nvidia-smi topo -m。矩陣會顯示PIXSYS代碼,而非活動的NV路由。此狀態表明鏈路故障,迫使您的GPU流量走慢速PCIe路徑。您必須測試每個GPU插槽以定位損壞的路徑。

為什麼物理GPU互連降級會觸發PCIe回退?

物理訊號完整性問題會觸發自動鏈路重試。持續的錯誤會迫使系統將互連速度降至PCIe Gen4頻寬(64 GB/s)。這種硬體回退可防止GPU完全崩潰,但嚴重限制每個已連接GPU節點之間的通訊效能。

哪些DCGM指標預示即將發生的GPU硬體故障?

您應監控dcgmi nvlink --errors中不斷上升的CRC資料錯誤和恢復事件。每秒超過100個CRC錯誤會立即觸發系統警報。在GPU模組或GPU基板插槽完全鏈路中斷之前,高錯誤率即指示物理連接器損壞。

熱節流如何影響整體GPU叢集吞吐量?

高工作溫度會強制保護性系統韌體降低GPU時脈頻率。熱應力會導致NVSwitch晶片進入低功耗模式。這種熱降速會降低每個已安裝GPU設備的資料傳輸速度,從而在整個GPU節點組件中形成巨大的效能瓶頸。

硬體修復後,哪個基準測試可確認GPU頻寬完全恢復?

您可以跨所有目標rank執行NCCL all_reduce_perf測試。該基準測試會推動有效負載傳輸經過每個GPU插槽。達到預期速度(例如現代系統上的900 GB/s)可確認GPU結構已完全修復,之後您可將GPU伺服器重新投入生產。

您的免費試用從這裡開始!
聯繫我們的團隊申請實體主機服務!
註冊成為會員,尊享專屬禮遇!
您的免費試用從這裡開始!
聯繫我們的團隊申請實體主機服務!
註冊成為會員,尊享專屬禮遇!
Telegram Teams