ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AMD Instinct MI350 系列硬件性能计数器详解(ROCm / CDNA4 gfx950)

AMD Instinct MI350 系列硬件性能计数器详解(ROCm / CDNA4 gfx950) AMD Instinct MI350 系列硬件性能计数器详解ROCm / CDNA4 gfx950【免费下载链接】legacy-rocm-buildAMD ROCm™ Software - GitHub Home项目地址: https://gitcode.com/GitHub_Trending/ro/legacy-rocm-build本文是 ROCm 文档仓库legacy-rocm-build中docs/reference/gpu-arch/mi350-performance-counters.rst的完整解读与实践指南。它以 AMD Instinct MI350 / MI355 系列 GPU 的硬件性能计数器Hardware Performance Counters与派生指标Derived Metrics为核心逐一说明命令处理器CPC、着色器管线插值器SPI、计算单元SQ、纹理寻址TA、纹理数据TD、纹理缓存TCP/TCC等 IP 块的计数器语义并给出通过 ROCprofiler-SDK 与 ROCm Compute Profiler 进行性能剖析的落地方法。读完本文你将能够看懂 ROCprofiler 输出中每个计数器的真实含义判断计数器标注的per-simd / emulated / nondeterministic / windowed等采集特性并据此定位 wave 调度、LDS 带宽、指令吞吐与缓存停顿等性能瓶颈。背景与定位MI350 系列与 ROCm 性能剖析AMD Instinct MI350 系列 GPU 基于 AMD CDNA4 架构构建。根据 docs/reference/gpu-arch/mi350.rst 的说明该系列对应 gfx950 目标其硬件性能计数器正是面向 MI350 / MI355 GPU 的剖析工具ROCprofiler-SDK、ROCm Compute Profiler的数据基础。在 docs/reference/gpu-specs.rst 的 GPU 规格表中MI355X 与 MI350X 均被列为 CDNA4 / gfx950 平台具备 288 GiB VRAM、256 个计算单元CU每个 XCD 32 个、64 的 wavefront 大小以及 160 KiB LDS、256 MiB L3、每 XCD 4 MiB 的 L2 等特征。理解这些底层规格有助于正确解读下文各类计数器的量级与含义。本仓库在 docs/components/profilers-and-debuggers.rst 中列出了与计数器相关的完整工具链ROCm Compute Profilerrocprofiler-compute面向机器学习和 HPC 负载的 Kernel 级性能剖析工具ROCprofiler-SDKrocprofiler-sdk用于开发剖析与追踪 GPU 计算应用分析工具的工具包rocprofv3等命令行工具即构建于其上ROCm Systems Profilerrocprofiler-systems面向 CPU 或 CPUGPU 应用的综合剖析与追踪工具。这些工具在采集硬件事件时会直接命中本清单中的计数器名因此理解清单是正确使用工具的第一步。计数器组织按 IP 块分类的总览MI350 系列性能计数器按 IP知识产权块组织共分七个大类对应 GPU 内部从命令调度、wave 发射、指令执行到缓存/内存访问的完整数据通路IP 块全称关注点CPCCommand Processor Packet Processor命令处理器分组处理器dispatch 分配、多 XCC 模式下的 ADC 遍历、同步计数器请求SPIShader Pipe Interpolators着色器管线插值器各 PIPE 的 wave/事件/线程组计数与队列占用率SQCompute Unit计算单元指令计数、FLOPS、LDS 指令与带宽、FIFO 停摆TATexture Addressing unit纹理寻址单元LDS 返回的 buffer/flat 读 wavefrontTDTexture Data unit纹理数据单元写确认与向 SP 发送数据的流量TCPTexture Cache per Pipe每管线纹理缓存UTCL1 翻译停顿、与 TA/TCC 交互的延迟与停顿TCCTexture Cache per Channel每通道纹理缓存L2 扇区级读写/原子请求、DRAM/GMI/IO 流量分解以下各节逐一列出每个 IP 块的全部硬件计数器及其官方定义。使用工具ROCprofiler-SDK 与 ROCm Compute Profiler清单中的所有计数器均可通过 ROCprofiler-SDK 与 ROCm Compute Profiler 采集。典型工作流如下使用 ROCm Compute Profiler 对 Kernel 进行剖析获取按计数器展开的性能报告对需要细粒度追踪的场景基于 ROCprofiler-SDK 开发或使用rocprofv3采集硬件事件将原始计数器换算为派生指标如用延迟类计数器除以对应的请求/读状态计数得到平均延迟用于定位瓶颈。注意部分计数器带有特殊采集语义per-simd、emulated、nondeterministic、windowed 等这些标注直接决定结果的可重复性与统计口径解读时务必先看下文的定义注释。命令处理器分组处理器CPC计数器CPC 负责 GPU 命令流的分组处理、dispatch 分配与多 XCD 模式下的任务遍历。该块共 17 个计数器重点刻画 ADCActive Dispatch Crawler遍历、同步 FIFO 占用与同步计数器请求通路硬件计数器定义CPC_ALWAYS_COUNT始终计数always count。CPC_ADC_VALID_CHUNK_NOT_AVAIL在多 XCC 模式下dispatch 遍历进行中时 ADC 有效块valid chunk不可用。CPC_ADC_DISPATCH_ALLOC_DONEADC dispatch 分配完成。CPC_ADC_VALID_CHUNK_END多 XCC 模式下 ADC 爬行器crawler的有效块结束。CPC_SYNC_FIFO_FULL_LEVELSYNC FIFO 满的最后周期数。CPC_SYNC_FIFO_FULLSYNC FIFO 满的次数。CPC_GD_BUSYADC 忙碌。CPC_TG_SENDADC 线程组发送。CPC_WALK_NEXT_CHUNK多 XCC 模式下 ADC 前进到下一个有效块。CPC_STALLED_BY_SE0_SPIADC CSDATA 被 SE0SPI 停顿。CPC_STALLED_BY_SE1_SPIADC CSDATA 被 SE1SPI 停顿。CPC_STALLED_BY_SE2_SPIADC CSDATA 被 SE2SPI 停顿。CPC_STALLED_BY_SE3_SPIADC CSDATA 被 SE3SPI 停顿。CPC_LTE_ALLCPC 同步计数器 LteAll。仅 Master XCD 管理 LteAll。CPC_SYNC_WRREQ_FIFO_BUSYCPC 同步计数器请求 FIFO 非空。CPC_CANE_BUSYCPC CANE 总线忙碌表明存在进行中的inflight同步计数器请求。CPC_CANE_STALLCPC 同步计数器发送被 CANE 停顿。实战要点CPC_ADC_*系列与多 XCC 模式强相关在 MI355X/MI350X 这类多 XCD 平台上dispatch 遍历行为会直接影响启动开销CPC_SYNC_*、CPC_CANE_*则反映同步计数器请求的拥塞情况可辅助判断同步操作是否存在硬件侧瓶颈。着色器管线插值器SPI计数器SPI 负责 wave 的发射与调度。MI350 系列在此块提供 4 条 PIPEPIPE0–PIPE3的逐 PIPE 统计、逐 PIPE 逐队列Queue0–Queue7的占用率统计以及 VGPR 写总线与 wave 计数统计共 63 个计数器。PIPE0–PIPE3 基本统计每条 PIPE 6 个以 PIPE0 为例PIPE1/2/3 语义相同仅 PIPE 序号不同硬件计数器定义SPI_CS0_WINDOW_VALID由 PIPE0 perfcounter_start 事件使能的时钟计数。SPI_CS0_BUSYPIPE0SPI 或 SH存在未完成outstandingwave 的时钟数。SPI_CS0_NUM_THREADGROUPSPIPE0 发射的线程组thread group数量。SPI_CS0_CRAWLER_STALLPIPE0 事件或 wave 顺序 FIFO 满的时钟数。SPI_CS0_EVENT_WAVEPIPE0 事件与 wave 的数量。SPI_CS0_WAVEPIPE0 wave 的数量。对应地PIPE1 使用SPI_CS1_WINDOW_VALID、SPI_CS1_BUSY、SPI_CS1_NUM_THREADGROUPS、SPI_CS1_CRAWLER_STALL、SPI_CS1_EVENT_WAVE、SPI_CS1_WAVEPIPE2 使用SPI_CS2_*PIPE3 使用SPI_CS3_*定义完全相同。逐 PIPE 逐队列占用率每条 PIPE 8 个硬件计数器定义SPI_CSQ_P0_Q0_OCCUPANCYPIPE0 Queue0 的占用率信息之和。SPI_CSQ_P0_Q1_OCCUPANCYPIPE0 Queue1 的占用率信息之和。SPI_CSQ_P0_Q2_OCCUPANCYPIPE0 Queue2 的占用率信息之和。SPI_CSQ_P0_Q3_OCCUPANCYPIPE0 Queue3 的占用率信息之和。SPI_CSQ_P0_Q4_OCCUPANCYPIPE0 Queue4 的占用率信息之和。SPI_CSQ_P0_Q5_OCCUPANCYPIPE0 Queue5 的占用率信息之和。SPI_CSQ_P0_Q6_OCCUPANCYPIPE0 Queue6 的占用率信息之和。SPI_CSQ_P0_Q7_OCCUPANCYPIPE0 Queue7 的占用率信息之和。同理SPI_CSQ_P1_Q0_OCCUPANCY至SPI_CSQ_P1_Q7_OCCUPANCY对应 PIPE1 的 Queue0–7SPI_CSQ_P2_Q0_OCCUPANCY至SPI_CSQ_P2_Q7_OCCUPANCY对应 PIPE2 的 Queue0–7SPI_CSQ_P3_Q0_OCCUPANCY至SPI_CSQ_P3_Q7_OCCUPANCY对应 PIPE3 的 Queue0–7定义均为对应队列的占用率信息之和。逐 PIPE 聚合占用率与写总线统计硬件计数器定义SPI_CSQ_P0_OCCUPANCYPIPE0 所有队列的占用率信息之和。SPI_CSQ_P1_OCCUPANCYPIPE1 所有队列的占用率信息之和。SPI_CSQ_P2_OCCUPANCYPIPE2 所有队列的占用率信息之和。SPI_CSQ_P3_OCCUPANCYPIPE3 所有队列的占用率信息之和。SPI_VWC0_VDATA_VALID_WRVGPR 总线 0 写 VGPR 的时钟数。SPI_VWC1_VDATA_VALID_WRVGPR 总线 1 写 VGPR 的时钟数。SPI_CSC_WAVE_CNT_BUSY管线中存在任意 wave 的周期数。实战要点SPI_CSx_BUSY与SPI_CSx_WAVE用于评估各 PIPE 的负载均衡SPI_CSx_NUM_THREADGROUPS结合线程组尺寸可推算发射总量SPI_CSC_WAVE_CNT_BUSY则给出整条管线的活跃占比是衡量调度压力的直接指标。计算单元SQ计数器SQ 是执行指令的物理计算单元。该块计数器覆盖指令吞吐MFMA、VALU、LDS、IOPS、FLOPS 统计、FIFO 停摆与缓存 miss 重复计数共 23 个计数器是评估 Kernel 计算效率的核心数据源。硬件计数器定义SQ_INSTS_VALU_MFMA_F6F4VALU V_MFMA_*_F6F4 指令数量。SQ_INSTS_VALU_MFMA_MOPS_F6F4VALU 矩阵执行的数学运算add 或 mul数量除以 512假设 F6 或 F4 数据类型为完整 EXEC 掩码。SQ_ACTIVE_INST_VALU2双 VALU 指令发射的 quad-cycle 数per-simd非确定性。SQ_INSTS_LDS_LOAD发射的 LDS 加载指令数per-simd模拟。SQ_INSTS_LDS_STORE发射的 LDS 存储指令数per-simd模拟。SQ_INSTS_LDS_ATOMIC发射的 LDS 原子指令数per-simd模拟。SQ_INSTS_LDS_LOAD_BANDWIDTH加载的总 64 字节数(instrSize * CountOnes(EXEC))/64per-simd模拟。SQ_INSTS_LDS_STORE_BANDWIDTH写入的总 64 字节数(instrSize * CountOnes(EXEC))/64per-simd模拟。SQ_INSTS_LDS_ATOMIC_BANDWIDTH原子操作的总 64 字节数(instrSize * CountOnes(EXEC))/64per-simd模拟。SQ_INSTS_VALU_FLOPS_FP16按指令统计 float 16 的 FLOPS不含 MFMA/SMFMA。SQ_INSTS_VALU_FLOPS_FP32按指令统计 float 32 的 FLOPS不含 MFMA/SMFMA。SQ_INSTS_VALU_FLOPS_FP64按指令统计 float 64 的 FLOPS不含 MFMA/SMFMA。SQ_INSTS_VALU_FLOPS_FP16_TRANS按指令统计 float 16 转置运算的 FLOPS不含 MFMA/SMFMA。SQ_INSTS_VALU_FLOPS_FP32_TRANS按指令统计 float 32 转置运算的 FLOPS不含 MFMA/SMFMA。SQ_INSTS_VALU_FLOPS_FP64_TRANS按指令统计 float 64 转置运算的 FLOPS不含 MFMA/SMFMA。SQ_INSTS_VALU_IOPS按指令统计整数、无符号或位数据的 OPSper-simd模拟。SQ_LDS_DATA_FIFO_FULLLDS 数据 FIFO 满的周期数非确定性非窗口化。SQ_LDS_CMD_FIFO_FULLLDS 命令 FIFO 满的周期数非确定性非窗口化。SQ_VMEM_TA_ADDR_FIFO_FULL纹理请求因 TA 地址 FIFO 满而停顿的周期数非确定性非窗口化。SQ_VMEM_TA_CMD_FIFO_FULL纹理请求因 TA 命令 FIFO 满而停顿的周期数非确定性非窗口化。SQ_VMEM_WR_TA_DATA_FIFO_FULL纹理写因 TA 数据 FIFO 满而停顿的周期数非确定性非窗口化。SQC_ICACHE_MISSES_DUPLICATE重复 miss 数访问非驻留且 miss 正在等待 CL 的行per-SQ、per-Bank非确定性。SQC_DCACHE_MISSES_DUPLICATE重复 miss 数访问非驻留且 miss 正在等待 CL 的行per-SQ、per-Bank非确定性。实战要点SQ_INSTS_VALU_FLOPS_*与SQ_INSTS_VALU_MFMA_*结合可拆解计算负载中的 MFMA 与常规 VALU 占比SQ_INSTS_LDS_*_BANDWIDTH以 64 字节为单位给出 LDS 实际搬运量用于评估共享内存带宽利用所有标注 per-simd 的计数器均为每个 SIMD 的统计跨 SIMD 汇总时需要自行累加且模拟emulated计数器在特定指令组合下存在统计口径误差。纹理寻址TA单元计数器TA 负责纹理寻址与 LDS 返回路径的地址处理。该块提供 2 个计数器聚焦 LDS 返回路径的读 wavefront 处理量。硬件计数器定义TA_BUFFER_READ_LDS_WAVEFRONTSTA 处理的 LDS 返回的 buffer 读 wavefront 数量。TA_FLAT_READ_LDS_WAVEFRONTSTA 处理的 LDS 返回的 flat 操作码读数量。纹理数据TD单元计数器TD 负责纹理数据通路。该块提供 2 个计数器反映写确认流量与向 SP着色器处理器的数据发送量。硬件计数器定义TD_WRITE_ACKT_WAVEFRONT发送给 SQ 而非 SP 的写确认数量。TD_TD_SP_TRAFFIC该 TD 向 SP 发送数据的次数。每管线纹理缓存TCP计数器TCP 是每个管线实例的纹理缓存负责与 TA、L2TCC以及 UTCL1统一翻译缓存 L1交互。该块共 24 个计数器其中 UTCL1 相关计数器集中刻画地址翻译停顿是判断翻译/页表等待类瓶颈的关键。硬件计数器定义TCP_TCP_TA_ADDR_STALL_CYCLESTCP 停顿 TA 地址接口。TCP_TCP_TA_DATA_STALL_CYCLESTCP 停顿 TA 数据接口。现在为窗口化windowed。TCP_LFIFO_STALL_CYCLES内存延迟 FIFO 满导致的停顿。TCP_RFIFO_STALL_CYCLES内存请求 FIFO 满导致的停顿。TCP_TCR_RDRET_STALL写入缓存被 TCR 的读返回停顿。TCP_PENDING_STALL_CYCLES因数据在 L2 中未决pending导致的停顿。TCP_UTCL1_SERIALIZATION_STALL因通过 UTCL1 串行化翻译请求造成的停顿总数。TCP_UTCL1_THRASHING_STALL任一 probe 中颠簸thrashing特性造成的停顿。当停顿信号在 probe0 与 probe1 之间重叠时精度受限MECO 开启时颠簸死锁会更严重部分 probe0 事件在 MECO 开启时可能漏计。该计数器仅提供颠簸的大致估计。TCP_UTCL1_TRANSLATION_MISS_UNDER_MISS翻译 miss_under_miss。TCP_UTCL1_STALL_INFLIGHT_MAX因 inflight 计数器饱和导致的 UTCL1 停顿总数。TCP_UTCL1_STALL_LRU_INFLIGHT因 LRU 缓存行存在 inflight 流量导致的 UTCL1 停顿总数。TCP_UTCL1_STALL_MULTI_MISS因仲裁后的多 miss 导致的 UTCL1 停顿总数。TCP_UTCL1_LFIFO_FULLUTCL1 与 UTCL2 的总延迟掩盖了 FIFO 满的周期。TCP_UTCL1_STALL_LFIFO_NOT_RES因 UTCL2 延迟导致的 UTCL1 停顿总数掩盖了 FIFO 输出非驻留周期。TCP_UTCL1_STALL_UTCL2_REQ_OUT_OF_CREDITS因 UTCL2_req 信用不足导致的 UTCL1 停顿总数。TCP_CLIENT_UTCL1_INFLIGHT每周期客户到 UTCL1 的 inflight 请求数之和。TCP_TAGRAM0_REQ从该 TCP 到所有 TCC 映射到 TagRAM 0 的 L2 请求总数。TCP_TAGRAM1_REQ从该 TCP 到所有 TCC 映射到 TagRAM 1 的 L2 请求总数。TCP_TAGRAM2_REQ从该 TCP 到所有 TCC 映射到 TagRAM 2 的 L2 请求总数。TCP_TAGRAM3_REQ从该 TCP 到所有 TCC 映射到 TagRAM 3 的 L2 请求总数。TCP_TCP_LATENCYTCP 的 wave 总延迟wave 进入的第一个时钟到 wave 离开的第一个时钟。除以 TA_TCP_STATE_READ 可得平均 wave 延迟。TCP_TCC_READ_REQ_LATENCY读与带回传原子操作的 TCP 到 TCC 请求总延迟。非窗口化。TCP_TCC_WRITE_REQ_LATENCY写与无回传原子操作的 TCP 到 TCC 请求总延迟。非窗口化。TCP_TCC_WRITE_REQ_HOLE_LATENCY写与原子操作的 TCP 请求到 TCC hole 的总延迟。非窗口化。实战要点当 Kernel 出现明显的访存停顿memory-bound时优先看TCP_UTCL1_*系列区分停顿来源——是翻译串行化SERIALIZATION、颠簸THRASHING、inflight 饱和、LRU 行冲突、多 miss 仲裁还是 UTCL2 信用不足TCP_TAGRAM0–3_REQ可用于检查 L2 请求在四个 TagRAM 间的均衡性辅助判断缓存哈希分布的负载是否均匀。每通道纹理缓存TCC计数器TCC 是 L2 缓存按通道组织的实例负责与 DRAMMC、GMI、IO 等内存域交互。该块共 21 个计数器以 32B 扇区为基本单位刻画读写/原子请求量并可按 DRAM / GMI / IO 流量来源分解。硬件计数器定义TCC_READ_SECTORS读请求中的 32B 数据扇区总数。TCC_WRITE_SECTORS写请求中的 32B 数据扇区总数。TCC_ATOMIC_SECTORS原子请求中的 32B 数据扇区总数。TCC_BYPASS_REQ旁路bypass请求数。在 tag 块处测量。TCC_LATENCY_FIFO_FULL延迟 FIFO 满的周期数。TCC_SRC_FIFO_FULL在 IB 块处测得 SRC FIFO 被认为满的周期数。TCC_EA0_RDREQ_64B64 字节 TCC/EA 读请求数。TCC_EA0_RDREQ_128B128 字节 TCC/EA 读请求数。TCC_IB_REQ通过 IB 的请求数。测量图形客户到该 TCC 的原始请求数。TCC_IB_STALLIB 输出被停顿的周期数。TCC_EA0_WRREQ_WRITE_DRAM目标为 DRAMMC的 TCC/EA 写请求数32 字节或 64 字节。TCC_EA0_WRREQ_ATOMIC_DRAM目标为 DRAMMC的 TCC/EA 原子请求数32 字节或 64 字节。TCC_EA0_RDREQ_DRAM_32B因 DRAM 流量产生的 32 字节 TCC/EA 读请求数。1 个 64 字节请求计为 21 个 128 字节请求计为 4。TCC_EA0_RDREQ_GMI_32B因 GMI 流量产生的 32 字节 TCC/EA 读请求数。1 个 64 字节请求计为 21 个 128 字节请求计为 4。TCC_EA0_RDREQ_IO_32B因 IO 流量产生的 32 字节 TCC/EA 读请求数。1 个 64 字节请求计为 21 个 128 字节请求计为 4。TCC_EA0_WRREQ_WRITE_DRAM_32B因 DRAM 流量产生的 32 字节 TCC/EA 写请求数。1 个 64 字节请求计为 2。TCC_EA0_WRREQ_ATOMIC_DRAM_32B因 DRAM 流量产生的 32 字节 TCC/EA 原子请求数。1 个 64 字节请求计为 2。TCC_EA0_WRREQ_WRITE_GMI_32B因 GMI 流量产生的 32 字节 TCC/EA 写请求数。1 个 64 字节请求计为 2。TCC_EA0_WRREQ_ATOMIC_GMI_32B因 GMI 流量产生的 32 字节 TCC/EA 原子请求数。1 个 64 字节请求计为 2。TCC_EA0_WRREQ_WRITE_IO_32B因 IO 流量产生的 32 字节 TCC/EA 写请求数。1 个 64 字节请求计为 2。TCC_EA0_WRREQ_ATOMIC_IO_32B因 IO 流量产生的 32 字节 TCC/EA 原子请求数。1 个 64 字节请求计为 2。实战要点TCC_READ/WRITE/ATOMIC_SECTORS以扇区为单位给出真实访存量可直接换算带宽TCC_EA0_*_32B系列按 DRAM/GMI/IO 三类内存域分解流量在多 GPUGMI 互连与 IO 密集型场景中可据此判断访存流量究竟流向本地 DRAM 还是经过 GMI 跨 GPU 传输从而评估数据局部性。实战解读从原始计数器到派生指标1. 平均 wave 延迟的计算文档明确指出TCP_TCP_LATENCY表示 wave 从进入 TCP 到离开 TCP 的总延迟将其除以TA_TCP_STATE_READ即可得到平均 wave 延迟。这是把累计延迟转换为单次平均延迟的标准派生口径。2. 扇区与请求换算规则TCC 的 32B 系列计数器遵循统一换算规则1 个 64 字节请求计为 2 个 32B 单位1 个 128 字节请求计为 4 个 32B 单位仅读方向。计算访存带宽时应优先使用TCC_READ_SECTORS/TCC_WRITE_SECTORS/TCC_ATOMIC_SECTORS这类直接以 32B 为单位的计数器避免重复换算。3. 采集语义标注的阅读方法per-simd计数单位为单个 SIMD报告中需要按 SIMD 数量累加以得到整个 CU 或全 GPU 的统计emulated模拟由硬件基于指令流模拟推导如 LDS 指令数、FLOPS、IOPS、带宽类计数器在复杂指令组合下可能存在口径误差nondeterministic非确定性如SQ_ACTIVE_INST_VALU2、各 FIFO FULL 计数器多次运行结果可能不完全一致适合观察趋势而非精确断言windowed / unwindowed窗口化/非窗口化windowed 计数器受 perfcounter_start 事件窗口约束如SPI_CSx_WINDOW_VALID、TCP_TCP_TA_DATA_STALL_CYCLESunwindowed 计数器则统计全时段如TCP_TCC_*_REQ_LATENCYmulti-xcc / Master XCD如CPC_ADC_*与CPC_LTE_ALL在多 XCD多 XCC 模式下行为与单 XCD 不同CPC_LTE_ALL仅由 Master XCD 维护。4. 典型瓶颈定位路径计算受限观察SQ_INSTS_VALU_FLOPS_*、SQ_INSTS_VALU_MFMA_*与SPI_CSx_BUSY评估指令吞吐与管线占用共享内存受限观察SQ_INSTS_LDS_*与SQ_INSTS_LDS_*_BANDWIDTH若 LDS FIFO FULL 计数高说明 LDS 端口拥塞翻译/页表受限观察TCP_UTCL1_*系列区分翻译停顿来源访存/带宽受限观察TCC_*_SECTORS与TCC_EA0_*_32B分解 DRAM/GMI/IO 流量结合TCP_TCC_*_REQ_LATENCY评估 L2 请求延迟。延伸阅读与仓库索引计数器权威清单docs/reference/gpu-arch/mi350-performance-counters.rstMI350 系列微架构入口docs/reference/gpu-arch/mi350.rstGPU 架构文档总览含 CDNA3/CDNA2/CDNA/RDNA 系列的计数器对照docs/reference/gpu-arch/index.mdMI300/MI200 系列计数器清单可与本清单横向对照其中包含 CPF 等本清单未覆盖的块docs/reference/gpu-arch/mi300-mi200-performance-counters.rstMI355X / MI350XCDNA4 gfx950规格表docs/reference/gpu-specs.rstROCm 剖析与调试工具链总览docs/components/profilers-and-debuggers.rstROCm 发行说明中的 MI350X / MI355X 支持信息docs/about/release-notes.md【免费下载链接】legacy-rocm-buildAMD ROCm™ Software - GitHub Home项目地址: https://gitcode.com/GitHub_Trending/ro/legacy-rocm-build创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表