Update csv headers, and SystemExit codes

Signed-off-by: JoseSantosAMD <Jose.Santos@amd.com>


[ROCm/rocprofiler-compute commit: 717a21cf84]
Este commit está contenido en:
JoseSantosAMD
2024-02-02 20:04:11 -06:00
cometido por Karl W. Schulz
padre 595ca9141a
commit 8ecc6dff7f
Se han modificado 2842 ficheros con 5653 adiciones y 3927 borrados
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,SQ_WAVES,SQ_IFETCH,SQ_IFETCH_LEVEL,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,SQ_WAVES,SQ_IFETCH,SQ_IFETCH_LEVEL,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,919533,919538,33554432,256,0,0,8,32,6464,0x0,0x7f539a404180,510905,510905,524288,6291456,791255,101484656,12076299622617100,12076299868527949,12076299868855467,12076299868966179
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,919533,919538,32768,256,0,0,24,24,12480,0x0,0x7f539a435100,29103,29103,512,8192,11024,1421636,12076299883226411,12076299883536030,12076299883542910,12076299883550754
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,919533,919538,4194304,256,0,0,24,24,12928,0x7f54a6102900,0x7f539a435140,214348,214348,65536,917504,141051,18053272,12076299883612759,12076299883846109,12076299883977148,12076299883980823
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj GRBM_COUNT GRBM_GUI_ACTIVE SQ_WAVES SQ_IFETCH SQ_IFETCH_LEVEL SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 919533 919538 33554432 256 0 0 8 32 6464 0x0 0x7f539a404180 510905 510905 524288 6291456 791255 101484656 12076299622617100 12076299868527949 12076299868855467 12076299868966179
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 919533 919538 32768 256 0 0 24 24 12480 0x0 0x7f539a435100 29103 29103 512 8192 11024 1421636 12076299883226411 12076299883536030 12076299883542910 12076299883550754
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 919533 919538 4194304 256 0 0 24 24 12928 0x7f54a6102900 0x7f539a435140 214348 214348 65536 917504 141051 18053272 12076299883612759 12076299883846109 12076299883977148 12076299883980823
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_LDS,SQ_INST_LEVEL_LDS,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_LDS,SQ_INST_LEVEL_LDS,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,921341,921346,33554432,256,0,0,8,32,6464,0x0,0x7f75c7a04180,0,0,0,12076325872059438,12076326117604157,12076326117928636,12076326118038409
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,921341,921346,32768,256,0,0,24,24,12480,0x0,0x7f75c7a35100,0,0,0,12076326132896351,12076326133202573,12076326133209293,12076326133221776
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,921341,921346,4194304,256,0,0,24,24,12928,0x7f76f7c91900,0x7f75c7a35140,0,0,0,12076326133274564,12076326133491052,12076326133626091,12076326133629754
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_LDS SQ_INST_LEVEL_LDS SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 921341 921346 33554432 256 0 0 8 32 6464 0x0 0x7f75c7a04180 0 0 0 12076325872059438 12076326117604157 12076326117928636 12076326118038409
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 921341 921346 32768 256 0 0 24 24 12480 0x0 0x7f75c7a35100 0 0 0 12076326132896351 12076326133202573 12076326133209293 12076326133221776
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 921341 921346 4194304 256 0 0 24 24 12928 0x7f76f7c91900 0x7f75c7a35140 0 0 0 12076326133274564 12076326133491052 12076326133626091 12076326133629754
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_SMEM,SQ_INST_LEVEL_SMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_SMEM,SQ_INST_LEVEL_SMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,920962,920967,33554432,256,0,0,8,32,6464,0x0,0x7f7263004180,4194304,3135444,401545944,12076323351077524,12076323592299708,12076323592623867,12076323592733000
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,920962,920967,32768,256,0,0,24,24,12480,0x0,0x7f7263035100,512,24896,3171600,12076323607390380,12076323607684997,12076323607691557,12076323607697111
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,920962,920967,4194304,256,0,0,24,24,12928,0x7f7393007900,0x7f7263035140,65536,199274,25512368,12076323607762212,12076323607972035,12076323608104675,12076323608108936
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_SMEM SQ_INST_LEVEL_SMEM SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 920962 920967 33554432 256 0 0 8 32 6464 0x0 0x7f7263004180 4194304 3135444 401545944 12076323351077524 12076323592299708 12076323592623867 12076323592733000
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 920962 920967 32768 256 0 0 24 24 12480 0x0 0x7f7263035100 512 24896 3171600 12076323607390380 12076323607684997 12076323607691557 12076323607697111
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 920962 920967 4194304 256 0 0 24 24 12928 0x7f7393007900 0x7f7263035140 65536 199274 25512368 12076323607762212 12076323607972035 12076323608104675 12076323608108936
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_VMEM,SQ_INST_LEVEL_VMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_VMEM,SQ_INST_LEVEL_VMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,921153,921158,33554432,256,0,0,8,32,6464,0x0,0x7fbf7ac04180,1048576,11001658,1408052856,12076324607361092,12076324851578856,12076324851903654,12076324852039846
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,921153,921158,32768,256,0,0,24,24,12480,0x0,0x7fbf7ac35100,4096,113289,14479660,12076324866554932,12076324866851777,12076324866858017,12076324866863235
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,921153,921158,4194304,256,0,0,24,24,12928,0x7fc0aab91900,0x7fbf7ac35140,524288,12401318,1587311276,12076324866927514,12076324867148415,12076324867279615,12076324867283767
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_VMEM SQ_INST_LEVEL_VMEM SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 921153 921158 33554432 256 0 0 8 32 6464 0x0 0x7fbf7ac04180 1048576 11001658 1408052856 12076324607361092 12076324851578856 12076324851903654 12076324852039846
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 921153 921158 32768 256 0 0 24 24 12480 0x0 0x7fbf7ac35100 4096 113289 14479660 12076324866554932 12076324866851777 12076324866858017 12076324866863235
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 921153 921158 4194304 256 0 0 24 24 12928 0x7fc0aab91900 0x7fbf7ac35140 524288 12401318 1587311276 12076324866927514 12076324867148415 12076324867279615 12076324867283767
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,CPC_ME1_BUSY_FOR_PACKET_DECODE,SQ_CYCLES,SQ_WAVES,SQ_WAVE_CYCLES,SQ_BUSY_CYCLES,SQ_LEVEL_WAVES,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,CPC_ME1_BUSY_FOR_PACKET_DECODE,SQ_CYCLES,SQ_WAVES,SQ_WAVE_CYCLES,SQ_BUSY_CYCLES,SQ_LEVEL_WAVES,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,921529,921534,33554432,256,0,0,8,32,6464,0x0,0x7f6f26204180,502695,502695,17046,4021568,524288,372600279,3816924,0,1505167052,12076327135265660,12076327381325743,12076327381649102,12076327381757735
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,921529,921534,32768,256,0,0,24,24,12480,0x0,0x7f6f26235100,27819,27819,20311,222560,512,1122712,74488,0,4504968,12076327396356075,12076327396679513,12076327396685593,12076327396695125
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,921529,921534,4194304,256,0,0,24,24,12928,0x7f7031f1d900,0x7f6f26235140,219204,219204,20615,1753640,65536,131444628,1582707,0,527592892,12076327396760457,12076327397000951,12076327397134071,12076327397138189
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj GRBM_COUNT GRBM_GUI_ACTIVE CPC_ME1_BUSY_FOR_PACKET_DECODE SQ_CYCLES SQ_WAVES SQ_WAVE_CYCLES SQ_BUSY_CYCLES SQ_LEVEL_WAVES SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 921529 921534 33554432 256 0 0 8 32 6464 0x0 0x7f6f26204180 502695 502695 17046 4021568 524288 372600279 3816924 0 1505167052 12076327135265660 12076327381325743 12076327381649102 12076327381757735
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 921529 921534 32768 256 0 0 24 24 12480 0x0 0x7f6f26235100 27819 27819 20311 222560 512 1122712 74488 0 4504968 12076327396356075 12076327396679513 12076327396685593 12076327396695125
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 921529 921534 4194304 256 0 0 24 24 12928 0x7f7031f1d900 0x7f6f26235140 219204 219204 20615 1753640 65536 131444628 1582707 0 527592892 12076327396760457 12076327397000951 12076327397134071 12076327397138189
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id
Dispatch_ID,Kernel_Name,GPU_ID
0,__amd_rocclr_fillBuffer.kd,0
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID
2 0 __amd_rocclr_fillBuffer.kd 0
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0
Las diferiencias del archivo han sido suprimidas porque una o mas lineas son muy largas
@@ -1,4 +1,4 @@
KernelName,Count,Sum(ns),Mean(ns),Median(ns),Pct
Kernel_Name,Count,Sum(ns),Mean(ns),Median(ns),Pct
"void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 512u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd]",1,6055312.0,6055312.0,6055312.0,9.17581889130573
"void benchmark_func<int, 256, 8u, 512u>(int, int*) [clone .kd]",1,4527004.0,4527004.0,4527004.0,6.859922135179261
"void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 256u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd]",1,3055336.0,3055336.0,3055336.0,4.629853884999894
1 KernelName Kernel_Name Count Sum(ns) Mean(ns) Median(ns) Pct
2 void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 512u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd] 1 6055312.0 6055312.0 6055312.0 9.17581889130573
3 void benchmark_func<int, 256, 8u, 512u>(int, int*) [clone .kd] 1 4527004.0 4527004.0 4527004.0 6.859922135179261
4 void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 256u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd] 1 3055336.0 3055336.0 3055336.0 4.629853884999894
@@ -1,7 +1,7 @@
Metric,Count,Unit
VALU - Vector,,Instr per wave
VMEM,,Instr per wave
LDS,0.0,Instr per wave
LDS_Per_Workgroup,0.0,Instr per wave
VALU - MFMA,,Instr per wave
SALU,46.862275449101794,Instr per wave
SMEM,1.8083832335329342,Instr per wave
1 Metric Count Unit
2 VALU - Vector Instr per wave
3 VMEM Instr per wave
4 LDS LDS_Per_Workgroup 0.0 Instr per wave
5 VALU - MFMA Instr per wave
6 SALU 46.862275449101794 Instr per wave
7 SMEM 1.8083832335329342 Instr per wave
@@ -23,4 +23,4 @@ gfx908
mi100
48
1228.8
SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
1 Info
23 mi100
24 48
25 1228.8
26 SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
@@ -1,12 +1,12 @@
Metric,Avg,Min,Max,Unit
Wave Cycles,33761.37244470105,2805.687400817871,547941.7736816406,Cycles/wave
LDS Instrs,0.0,0.0,0.0,Instr per wave
LDS_Per_Workgroup Instrs,0.0,0.0,0.0,Instr per wave
Bandwidth,0.0,0.0,0.0,Bytes per wave
Bank Conficts/Access,,,,Conflicts/access
Index Accesses,0.0,0.0,0.0,Cycles per wave
Dispatch_ID Accesses,0.0,0.0,0.0,Cycles per wave
Atomic Cycles,0.0,0.0,0.0,Cycles per wave
Bank Conflict,0.0,0.0,0.0,Cycles per wave
Addr Conflict,0.0,0.0,0.0,Cycles per wave
Unaligned Stall,0.0,0.0,0.0,Cycles per wave
Mem Violations,0.0,0.0,0.0, per wave
LDS Latency,,,,Cycles
LDS_Per_Workgroup Latency,,,,Cycles
1 Metric Avg Min Max Unit
2 Wave Cycles 33761.37244470105 2805.687400817871 547941.7736816406 Cycles/wave
3 LDS Instrs LDS_Per_Workgroup Instrs 0.0 0.0 0.0 Instr per wave
4 Bandwidth 0.0 0.0 0.0 Bytes per wave
5 Bank Conficts/Access Conflicts/access
6 Index Accesses Dispatch_ID Accesses 0.0 0.0 0.0 Cycles per wave
7 Atomic Cycles 0.0 0.0 0.0 Cycles per wave
8 Bank Conflict 0.0 0.0 0.0 Cycles per wave
9 Addr Conflict 0.0 0.0 0.0 Cycles per wave
10 Unaligned Stall 0.0 0.0 0.0 Cycles per wave
11 Mem Violations 0.0 0.0 0.0 per wave
12 LDS Latency LDS_Per_Workgroup Latency Cycles
@@ -6,16 +6,16 @@ SMEM,2.0,smem_
VALU,735.0,valu_
MFMA,,mfma_
VMEM,8.0,vmem_
LDS,0.0,lds_
LDS_Per_Workgroup,0.0,lds_
GWS,0.0,gws_
BR,22.0,br_
VGPR,24.0,vgpr_
SGPR,24.0,sgpr_
LDS Allocation,0.0,lds_alloc_
LDS_Per_Workgroup Allocation,0.0,lds_alloc_
Scratch Allocation,0.0,scratch_alloc_
Wavefronts,67894.0,wavefronts_
Workgroups,16973.0,workgroups_
LDS Req,0.0,lds_req_
LDS_Per_Workgroup Req,0.0,lds_req_
IL1 Fetch,163.0,il1_fetch_
IL1 Hit,100.0,il1_hit_
IL1_L2 Rd,0.0,il1_l2_req_
@@ -46,10 +46,10 @@ Fabric_L2 Wr,0.0,l2_fabric_wr_
Fabric_l2 Atomic,0.0,l2_fabric_atom_
HBM Rd,44.0,hbm_rd_
HBM Wr,0.0,hbm_wr_
LDS Util,0.0,lds_util_
LDS_Per_Workgroup Util,0.0,lds_util_
VL1 Coalesce,70.0,vl1_coales_
VL1 Stall,30.0,vl1_stall_
LDS Lat,,lds_lat_
LDS_Per_Workgroup Lat,,lds_lat_
vL1D Lat,,sl1_lat_
IL1 Lat,,il1_lat_
Wave Occupancy,34.0,wave_occ_
1 Metric Value Alias
6 VALU 735.0 valu_
7 MFMA mfma_
8 VMEM 8.0 vmem_
9 LDS LDS_Per_Workgroup 0.0 lds_
10 GWS 0.0 gws_
11 BR 22.0 br_
12 VGPR 24.0 vgpr_
13 SGPR 24.0 sgpr_
14 LDS Allocation LDS_Per_Workgroup Allocation 0.0 lds_alloc_
15 Scratch Allocation 0.0 scratch_alloc_
16 Wavefronts 67894.0 wavefronts_
17 Workgroups 16973.0 workgroups_
18 LDS Req LDS_Per_Workgroup Req 0.0 lds_req_
19 IL1 Fetch 163.0 il1_fetch_
20 IL1 Hit 100.0 il1_hit_
21 IL1_L2 Rd 0.0 il1_l2_req_
46 Fabric_l2 Atomic 0.0 l2_fabric_atom_
47 HBM Rd 44.0 hbm_rd_
48 HBM Wr 0.0 hbm_wr_
49 LDS Util LDS_Per_Workgroup Util 0.0 lds_util_
50 VL1 Coalesce 70.0 vl1_coales_
51 VL1 Stall 30.0 vl1_stall_
52 LDS Lat LDS_Per_Workgroup Lat lds_lat_
53 vL1D Lat sl1_lat_
54 IL1 Lat il1_lat_
55 Wave Occupancy 34.0 wave_occ_
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id
Dispatch_ID,Kernel_Name,GPU_ID
0,__amd_rocclr_fillBuffer.kd,0
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID
2 0 __amd_rocclr_fillBuffer.kd 0
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0
@@ -12,8 +12,8 @@ VALU Util,59.49293302260621,Pct,100,59.49293302260621
MFMA Util,,Pct,100,
VALU Active Threads/Wave,63.96757475781579,Threads,64,99.94933555908717
IPC - Issue,0.8437242643821745,Instr/cycle,5,16.874485287643488
LDS BW,0.0,Gb/sec,23070.72,0.0
LDS Bank Conflict,,Conflicts/access,32,
LDS_Per_Workgroup BW,0.0,Gb/sec,23070.72,0.0
LDS_Per_Workgroup Bank Conflict,,Conflicts/access,32,
Instr Cache Hit Rate,99.99340470515173,Pct,100,99.99340470515173
Instr Cache BW,1409.2232915418736,Gb/s,4614.144,30.54138083991036
Scalar L1D Cache Hit Rate,99.35620448528866,Pct,100,99.35620448528866
1 Metric Value Unit Peak PoP
12 MFMA Util Pct 100
13 VALU Active Threads/Wave 63.96757475781579 Threads 64 99.94933555908717
14 IPC - Issue 0.8437242643821745 Instr/cycle 5 16.874485287643488
15 LDS BW LDS_Per_Workgroup BW 0.0 Gb/sec 23070.72 0.0
16 LDS Bank Conflict LDS_Per_Workgroup Bank Conflict Conflicts/access 32
17 Instr Cache Hit Rate 99.99340470515173 Pct 100 99.99340470515173
18 Instr Cache BW 1409.2232915418736 Gb/s 4614.144 30.54138083991036
19 Scalar L1D Cache Hit Rate 99.35620448528866 Pct 100 99.35620448528866
@@ -6,7 +6,7 @@ Scratch Stall,0.0,0,0,Cycles
Insufficient SIMD Waveslots,57830.431137724554,0,731049,Simd
Insufficient SIMD VGPRs,568474.6706586826,0,41500307,Simd
Insufficient SIMD SGPRs,0.0,0,0,Simd
Insufficient CU LDS,0.0,0,0,Cu
Insufficient CU LDS_Per_Workgroup,0.0,0,0,Cu
Insufficient CU Barries,0.0,0,0,Cu
Insufficient Bulky Resource,0.0,0,0,Cu
Reach CU Threadgroups Limit,0.0,0,0,Cycles
1 Metric Avg Min Max Unit
6 Insufficient SIMD Waveslots 57830.431137724554 0 731049 Simd
7 Insufficient SIMD VGPRs 568474.6706586826 0 41500307 Simd
8 Insufficient SIMD SGPRs 0.0 0 0 Simd
9 Insufficient CU LDS Insufficient CU LDS_Per_Workgroup 0.0 0 0 Cu
10 Insufficient CU Barries 0.0 0 0 Cu
11 Insufficient Bulky Resource 0.0 0 0 Cu
12 Reach CU Threadgroups Limit 0.0 0 0 Cycles
@@ -6,5 +6,5 @@ Saved Wavefronts,0.0,0,0,Wavefronts
Restored Wavefronts,0.0,0,0,Wavefronts
VGPRs,23.976047904191617,8,36,Registers
SGPRs,24.047904191616766,24,32,Registers
LDS Allocation,0.0,0,0,Bytes
LDS_Per_Workgroup Allocation,0.0,0,0,Bytes
Scratch Allocation,0.0,0,0,Bytes
1 Metric Avg Min Max Unit
6 Restored Wavefronts 0.0 0 0 Wavefronts
7 VGPRs 23.976047904191617 8 36 Registers
8 SGPRs 24.047904191616766 24 32 Registers
9 LDS Allocation LDS_Per_Workgroup Allocation 0.0 0 0 Bytes
10 Scratch Allocation 0.0 0 0 Bytes
@@ -1,2 +1,2 @@
workload_name,host_name,host_cpu,host_distro,host_kernel,host_rocmver,date,gpu_soc,numSE,numCU,numSIMD,waveSize,maxWavesPerCU,maxWorkgroupSize,L1,L2,sclk,mclk,cur_sclk,cur_mclk,L2Banks,name,numSQC,hbmBW,ip_blocks
dev0,vesuvius,AMD EPYC 7542 32-Core Processor,,4.18.0-240.15.1.el8_3.x86_64,4.2.0-21,Thu Sep 22 11:31:14 2022 (CDT),gfx908,8,120,4,64,40,1024,16,,1502,1200,300,1200,32,mi100,48,1228.8,SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
dev0,vesuvius,AMD EPYC 7542 32-Core Processor,,4.18.0-240.15.1.el8_3.x86_64,4.2.0-21,Thu Sep 22 11:31:14 2022 (CDT),gfx908,8,120,4,64,40,1024,16,,1502,1200,300,1200,32,mi100,48,1228.8,SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
1 workload_name host_name host_cpu host_distro host_kernel host_rocmver date gpu_soc numSE numCU numSIMD waveSize maxWavesPerCU maxWorkgroupSize L1 L2 sclk mclk cur_sclk cur_mclk L2Banks name numSQC hbmBW ip_blocks
2 dev0 vesuvius AMD EPYC 7542 32-Core Processor 4.18.0-240.15.1.el8_3.x86_64 4.2.0-21 Thu Sep 22 11:31:14 2022 (CDT) gfx908 8 120 4 64 40 1024 16 1502 1200 300 1200 32 mi100 48 1228.8 SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,921580,921585,33554432,256,0,0,8,32,6464,0x0,0x7fc0c2804180,12076328266793044,12076328266837802,12076328267160519,12076328267269900
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,921580,921585,32768,256,0,0,24,24,12480,0x0,0x7fc0c2835100,12076328282132912,12076328282246095,12076328282252495,12076328282258235
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,921580,921585,4194304,256,0,0,24,24,12928,0x7fc1ce3b2900,0x7fc0c2835140,12076328282304692,12076328282317774,12076328282452973,12076328282456624
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 921580 921585 33554432 256 0 0 8 32 6464 0x0 0x7fc0c2804180 12076328266793044 12076328266837802 12076328267160519 12076328267269900
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 921580 921585 32768 256 0 0 24 24 12480 0x0 0x7fc0c2835100 12076328282132912 12076328282246095 12076328282252495 12076328282258235
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 921580 921585 4194304 256 0 0 24 24 12928 0x7fc1ce3b2900 0x7fc0c2835140 12076328282304692 12076328282317774 12076328282452973 12076328282456624
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,SQ_WAVES,SQ_IFETCH,SQ_IFETCH_LEVEL,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,SQ_WAVES,SQ_IFETCH,SQ_IFETCH_LEVEL,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,223297,223297,33554432,256,0,0,4,32,4160,0x0,0x7fc57a604280,379284,379284,524288,4718592,681163,76310828,17598097140845,17597387743185,17598246526395,17598246639545
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,223297,223297,32768,256,0,0,12,24,13888,0x0,0x7fc57a623f80,33251,33251,512,8192,6010,679448,17598251787224,17598246526395,17598251919198,17598251924230
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,223297,223297,4194304,256,0,0,12,24,14336,0x7fc57d663380,0x7fc57a623fc0,163594,163594,65536,917504,141997,15950860,17598251961259,17598251919198,17598252301279,17598252303751
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj GRBM_COUNT GRBM_GUI_ACTIVE SQ_WAVES SQ_IFETCH SQ_IFETCH_LEVEL SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 223297 223297 33554432 256 0 0 4 32 4160 0x0 0x7fc57a604280 379284 379284 524288 4718592 681163 76310828 17598097140845 17597387743185 17598246526395 17598246639545
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 223297 223297 32768 256 0 0 12 24 13888 0x0 0x7fc57a623f80 33251 33251 512 8192 6010 679448 17598251787224 17598246526395 17598251919198 17598251924230
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 223297 223297 4194304 256 0 0 12 24 14336 0x7fc57d663380 0x7fc57a623fc0 163594 163594 65536 917504 141997 15950860 17598251961259 17598251919198 17598252301279 17598252303751
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_LDS,SQ_INST_LEVEL_LDS,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_LDS,SQ_INST_LEVEL_LDS,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,225145,225145,33554432,256,0,0,4,32,4160,0x0,0x7f6011204280,0,0,0,17617373642292,17616657358066,17617521510730,17617521624110
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,225145,225145,32768,256,0,0,12,24,13888,0x0,0x7f6011223f80,0,0,0,17617526822058,17617521510730,17617526949772,17617526954185
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,225145,225145,4194304,256,0,0,12,24,14336,0x7f601422d380,0x7f6011223fc0,0,0,0,17617526989654,17617526949772,17617527316172,17617527318486
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_LDS SQ_INST_LEVEL_LDS SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 225145 225145 33554432 256 0 0 4 32 4160 0x0 0x7f6011204280 0 0 0 17617373642292 17616657358066 17617521510730 17617521624110
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 225145 225145 32768 256 0 0 12 24 13888 0x0 0x7f6011223f80 0 0 0 17617526822058 17617521510730 17617526949772 17617526954185
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 225145 225145 4194304 256 0 0 12 24 14336 0x7f601422d380 0x7f6011223fc0 0 0 0 17617526989654 17617526949772 17617527316172 17617527318486
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_SMEM,SQ_INST_LEVEL_SMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_SMEM,SQ_INST_LEVEL_SMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,223075,223075,33554432,256,0,0,4,32,4160,0x0,0x7f931ec04280,3670016,2924224,327281248,17597154367976,17588719430319,17597306738811,17597306856651
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,223075,223075,32768,256,0,0,12,24,13888,0x0,0x7f931ec23f80,512,96990,10865032,17597311964571,17597306738811,17597312097854,17597312102767
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,223075,223075,4194304,256,0,0,12,24,14336,0x7f9321c13380,0x7f931ec23fc0,65536,635542,71138720,17597312138116,17597312097854,17597312468574,17597312471268
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_SMEM SQ_INST_LEVEL_SMEM SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 223075 223075 33554432 256 0 0 4 32 4160 0x0 0x7f931ec04280 3670016 2924224 327281248 17597154367976 17588719430319 17597306738811 17597306856651
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 223075 223075 32768 256 0 0 12 24 13888 0x0 0x7f931ec23f80 512 96990 10865032 17597311964571 17597306738811 17597312097854 17597312102767
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 223075 223075 4194304 256 0 0 12 24 14336 0x7f9321c13380 0x7f931ec23fc0 65536 635542 71138720 17597312138116 17597312097854 17597312468574 17597312471268
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_VMEM,SQ_INST_LEVEL_VMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_VMEM,SQ_INST_LEVEL_VMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,224923,224923,33554432,256,0,0,4,32,4160,0x0,0x7f6676804280,524288,5433099,608528124,17616429017287,17614162329648,17616578244180,17616578354430
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,224923,224923,32768,256,0,0,12,24,13888,0x0,0x7f6676823f80,4096,42285,4736872,17616583510399,17616578244180,17616583637143,17616583641776
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,224923,224923,4194304,256,0,0,12,24,14336,0x7f66798a9380,0x7f6676823fc0,524288,10680424,1196193368,17616583675735,17616583637143,17616584007223,17616584009546
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_VMEM SQ_INST_LEVEL_VMEM SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 224923 224923 33554432 256 0 0 4 32 4160 0x0 0x7f6676804280 524288 5433099 608528124 17616429017287 17614162329648 17616578244180 17616578354430
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 224923 224923 32768 256 0 0 12 24 13888 0x0 0x7f6676823f80 4096 42285 4736872 17616583510399 17616578244180 17616583637143 17616583641776
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 224923 224923 4194304 256 0 0 12 24 14336 0x7f66798a9380 0x7f6676823fc0 524288 10680424 1196193368 17616583675735 17616583637143 17616584007223 17616584009546
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,CPC_ME1_BUSY_FOR_PACKET_DECODE,SQ_CYCLES,SQ_WAVES,SQ_WAVE_CYCLES,SQ_BUSY_CYCLES,SQ_LEVEL_WAVES,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,CPC_ME1_BUSY_FOR_PACKET_DECODE,SQ_CYCLES,SQ_WAVES,SQ_WAVE_CYCLES,SQ_BUSY_CYCLES,SQ_LEVEL_WAVES,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,223519,223519,33554432,256,0,0,4,32,4160,0x0,0x7f1ce5804280,387094,387094,8680,3096760,524288,245771477,3011216,0,999328548,17599035568236,17598328816642,17599185813205,17599185923274
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,223519,223519,32768,256,0,0,12,24,13888,0x0,0x7f1ce5823f80,33003,33003,29549,264032,512,1739044,167125,0,6969744,17599191082624,17599185813205,17599191227446,17599191232450
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,223519,223519,4194304,256,0,0,12,24,14336,0x7f1ce8890380,0x7f1ce5823fc0,164050,164050,13444,1312408,65536,80869811,1211279,0,325210296,17599191275709,17599191227446,17599191628886,17599191631540
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj GRBM_COUNT GRBM_GUI_ACTIVE CPC_ME1_BUSY_FOR_PACKET_DECODE SQ_CYCLES SQ_WAVES SQ_WAVE_CYCLES SQ_BUSY_CYCLES SQ_LEVEL_WAVES SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 223519 223519 33554432 256 0 0 4 32 4160 0x0 0x7f1ce5804280 387094 387094 8680 3096760 524288 245771477 3011216 0 999328548 17599035568236 17598328816642 17599185813205 17599185923274
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 223519 223519 32768 256 0 0 12 24 13888 0x0 0x7f1ce5823f80 33003 33003 29549 264032 512 1739044 167125 0 6969744 17599191082624 17599185813205 17599191227446 17599191232450
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 223519 223519 4194304 256 0 0 12 24 14336 0x7f1ce8890380 0x7f1ce5823fc0 164050 164050 13444 1312408 65536 80869811 1211279 0 325210296 17599191275709 17599191227446 17599191628886 17599191631540
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id
Dispatch_ID,Kernel_Name,GPU_ID
0,__amd_rocclr_fillBufferAligned.kd,0
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID
2 0 __amd_rocclr_fillBufferAligned.kd 0
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0
Las diferiencias del archivo han sido suprimidas porque una o mas lineas son muy largas
@@ -1,4 +1,4 @@
KernelName,Count,Sum(ns),Mean(ns),Median(ns),Pct
Kernel_Name,Count,Sum(ns),Mean(ns),Median(ns),Pct
"void benchmark_func<int, 256, 8u, 512u>(int, int*) [clone .kd]",1,3359203.0,3359203.0,3359203.0,7.843408332395092
"void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 512u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd]",1,1724962.0,1724962.0,1724962.0,4.027616468509019
"void benchmark_func<double, 256, 8u, 512u>(double, double*) [clone .kd]",1,1716642.0,1716642.0,1716642.0,4.008190087511643
1 KernelName Kernel_Name Count Sum(ns) Mean(ns) Median(ns) Pct
2 void benchmark_func<int, 256, 8u, 512u>(int, int*) [clone .kd] 1 3359203.0 3359203.0 3359203.0 7.843408332395092
3 void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 512u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd] 1 1724962.0 1724962.0 1724962.0 4.027616468509019
4 void benchmark_func<double, 256, 8u, 512u>(double, double*) [clone .kd] 1 1716642.0 1716642.0 1716642.0 4.008190087511643
@@ -1,7 +1,7 @@
Metric,Count,Unit
VALU - Vector,494.8622754491018,Instr per wave
VMEM,7.958083832335329,Instr per wave
LDS,0.0,Instr per wave
LDS_Per_Workgroup,0.0,Instr per wave
VALU - MFMA,0.0,Instr per wave
SALU,24.520958083832337,Instr per wave
SMEM,1.8023952095808384,Instr per wave
1 Metric Count Unit
2 VALU - Vector 494.8622754491018 Instr per wave
3 VMEM 7.958083832335329 Instr per wave
4 LDS LDS_Per_Workgroup 0.0 Instr per wave
5 VALU - MFMA 0.0 Instr per wave
6 SALU 24.520958083832337 Instr per wave
7 SMEM 1.8023952095808384 Instr per wave
@@ -23,4 +23,4 @@ gfx90a
mi200
56
1638.4
roofline|SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
roofline|SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
1 Info
23 mi200
24 56
25 1638.4
26 roofline|SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF roofline|SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
@@ -1,12 +1,12 @@
Metric,Avg,Min,Max,Unit
Wave Cycles,18379.615702235056,1876.4345169067383,258464.3599243164,Cycles/wave
LDS Instrs,0.0,0.0,0.0,Instr per wave
LDS_Per_Workgroup Instrs,0.0,0.0,0.0,Instr per wave
Bandwidth,0.0,0.0,0.0,Bytes per wave
Bank Conficts/Access,,,,Conflicts/access
Index Accesses,0.0,0.0,0.0,Cycles per wave
Dispatch_ID Accesses,0.0,0.0,0.0,Cycles per wave
Atomic Cycles,0.0,0.0,0.0,Cycles per wave
Bank Conflict,0.0,0.0,0.0,Cycles per wave
Addr Conflict,0.0,0.0,0.0,Cycles per wave
Unaligned Stall,0.0,0.0,0.0,Cycles per wave
Mem Violations,0.0,0.0,0.0, per wave
LDS Latency,,,,Cycles
LDS_Per_Workgroup Latency,,,,Cycles
1 Metric Avg Min Max Unit
2 Wave Cycles 18379.615702235056 1876.4345169067383 258464.3599243164 Cycles/wave
3 LDS Instrs LDS_Per_Workgroup Instrs 0.0 0.0 0.0 Instr per wave
4 Bandwidth 0.0 0.0 0.0 Bytes per wave
5 Bank Conficts/Access Conflicts/access
6 Index Accesses Dispatch_ID Accesses 0.0 0.0 0.0 Cycles per wave
7 Atomic Cycles 0.0 0.0 0.0 Cycles per wave
8 Bank Conflict 0.0 0.0 0.0 Cycles per wave
9 Addr Conflict 0.0 0.0 0.0 Cycles per wave
10 Unaligned Stall 0.0 0.0 0.0 Cycles per wave
11 Mem Violations 0.0 0.0 0.0 per wave
12 LDS Latency LDS_Per_Workgroup Latency Cycles
@@ -6,16 +6,16 @@ SMEM,2.0,smem_
VALU,495.0,valu_
MFMA,0.0,mfma_
VMEM,8.0,vmem_
LDS,0.0,lds_
LDS_Per_Workgroup,0.0,lds_
GWS,0.0,gws_
BR,10.0,br_
VGPR,12.0,vgpr_
SGPR,24.0,sgpr_
LDS Allocation,0.0,lds_alloc_
LDS_Per_Workgroup Allocation,0.0,lds_alloc_
Scratch Allocation,0.0,scratch_alloc_
Wavefronts,67894.0,wavefronts_
Workgroups,16973.0,workgroups_
LDS Req,0.0,lds_req_
LDS_Per_Workgroup Req,0.0,lds_req_
IL1 Fetch,128.0,il1_fetch_
IL1 Hit,100.0,il1_hit_
IL1_L2 Rd,0.0,il1_l2_req_
@@ -46,10 +46,10 @@ Fabric_L2 Wr,0.0,l2_fabric_wr_
Fabric_l2 Atomic,0.0,l2_fabric_atom_
HBM Rd,44.0,hbm_rd_
HBM Wr,0.0,hbm_wr_
LDS Util,0.0,lds_util_
LDS_Per_Workgroup Util,0.0,lds_util_
VL1 Coalesce,70.0,vl1_coales_
VL1 Stall,2.0,vl1_stall_
LDS Lat,,lds_lat_
LDS_Per_Workgroup Lat,,lds_lat_
vL1D Lat,,sl1_lat_
IL1 Lat,,il1_lat_
Wave Occupancy,26.0,wave_occ_
1 Metric Value Alias
6 VALU 495.0 valu_
7 MFMA 0.0 mfma_
8 VMEM 8.0 vmem_
9 LDS LDS_Per_Workgroup 0.0 lds_
10 GWS 0.0 gws_
11 BR 10.0 br_
12 VGPR 12.0 vgpr_
13 SGPR 24.0 sgpr_
14 LDS Allocation LDS_Per_Workgroup Allocation 0.0 lds_alloc_
15 Scratch Allocation 0.0 scratch_alloc_
16 Wavefronts 67894.0 wavefronts_
17 Workgroups 16973.0 workgroups_
18 LDS Req LDS_Per_Workgroup Req 0.0 lds_req_
19 IL1 Fetch 128.0 il1_fetch_
20 IL1 Hit 100.0 il1_hit_
21 IL1_L2 Rd 0.0 il1_l2_req_
46 Fabric_l2 Atomic 0.0 l2_fabric_atom_
47 HBM Rd 44.0 hbm_rd_
48 HBM Wr 0.0 hbm_wr_
49 LDS Util LDS_Per_Workgroup Util 0.0 lds_util_
50 VL1 Coalesce 70.0 vl1_coales_
51 VL1 Stall 2.0 vl1_stall_
52 LDS Lat LDS_Per_Workgroup Lat lds_lat_
53 vL1D Lat sl1_lat_
54 IL1 Lat il1_lat_
55 Wave Occupancy 26.0 wave_occ_
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id
Dispatch_ID,Kernel_Name,GPU_ID
0,__amd_rocclr_fillBufferAligned.kd,0
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID
2 0 __amd_rocclr_fillBufferAligned.kd 0
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0
@@ -12,8 +12,8 @@ VALU Util,58.32499961405379,Pct,100,58.32499961405379
MFMA Util,0.0,Pct,100,0.0
VALU Active Threads/Wave,64.0,Threads,64,100.0
IPC - Issue,1.0,Instr/cycle,5,20.0
LDS BW,0.0,Gb/sec,22630.4,0.0
LDS Bank Conflict,,Conflicts/access,32,
LDS_Per_Workgroup BW,0.0,Gb/sec,22630.4,0.0
LDS_Per_Workgroup Bank Conflict,,Conflicts/access,32,
Instr Cache Hit Rate,99.99250938551732,Pct,100,99.99250938551732
Instr Cache BW,1673.2474012593727,Gb/s,6092.8,27.46270025701439
Scalar L1D Cache Hit Rate,99.34855886013408,Pct,100,99.34855886013408
1 Metric Value Unit Peak PoP
12 MFMA Util 0.0 Pct 100 0.0
13 VALU Active Threads/Wave 64.0 Threads 64 100.0
14 IPC - Issue 1.0 Instr/cycle 5 20.0
15 LDS BW LDS_Per_Workgroup BW 0.0 Gb/sec 22630.4 0.0
16 LDS Bank Conflict LDS_Per_Workgroup Bank Conflict Conflicts/access 32
17 Instr Cache Hit Rate 99.99250938551732 Pct 100 99.99250938551732
18 Instr Cache BW 1673.2474012593727 Gb/s 6092.8 27.46270025701439
19 Scalar L1D Cache Hit Rate 99.34855886013408 Pct 100 99.34855886013408
@@ -6,7 +6,7 @@ Scratch Stall,0.0,0,0,Cycles
Insufficient SIMD Waveslots,16255612.035928143,0,427277590,Simd
Insufficient SIMD VGPRs,0.0,0,0,Simd
Insufficient SIMD SGPRs,0.0,0,0,Simd
Insufficient CU LDS,0.0,0,0,Cu
Insufficient CU LDS_Per_Workgroup,0.0,0,0,Cu
Insufficient CU Barries,0.0,0,0,Cu
Insufficient Bulky Resource,0.0,0,0,Cu
Reach CU Threadgroups Limit,0.0,0,0,Cycles
1 Metric Avg Min Max Unit
6 Insufficient SIMD Waveslots 16255612.035928143 0 427277590 Simd
7 Insufficient SIMD VGPRs 0.0 0 0 Simd
8 Insufficient SIMD SGPRs 0.0 0 0 Simd
9 Insufficient CU LDS Insufficient CU LDS_Per_Workgroup 0.0 0 0 Cu
10 Insufficient CU Barries 0.0 0 0 Cu
11 Insufficient Bulky Resource 0.0 0 0 Cu
12 Reach CU Threadgroups Limit 0.0 0 0 Cycles
@@ -6,5 +6,5 @@ Saved Wavefronts,0.0,0,0,Wavefronts
Restored Wavefronts,0.0,0,0,Wavefronts
VGPRs,11.784431137724551,4,16,Registers
SGPRs,24.047904191616766,24,32,Registers
LDS Allocation,0.0,0,0,Bytes
LDS_Per_Workgroup Allocation,0.0,0,0,Bytes
Scratch Allocation,0.0,0,0,Bytes
1 Metric Avg Min Max Unit
6 Restored Wavefronts 0.0 0 0 Wavefronts
7 VGPRs 11.784431137724551 4 16 Registers
8 SGPRs 24.047904191616766 24 32 Registers
9 LDS Allocation LDS_Per_Workgroup Allocation 0.0 0 0 Bytes
10 Scratch Allocation 0.0 0 0 Bytes
@@ -1,2 +1,2 @@
workload_name,host_name,host_cpu,host_distro,host_kernel,host_rocmver,date,gpu_soc,numSE,numCU,numSIMD,waveSize,maxWavesPerCU,maxWorkgroupSize,L1,L2,sclk,mclk,cur_sclk,cur_mclk,L2Banks,name,numSQC,hbmBW,ip_blocks
dev0,06fa5f860366,AMD EPYC 7282 16-Core Processor,Ubuntu 20.04.5 LTS,5.11.0-27-generic,5.1.3-66,Wed Sep 28 20:46:37 2022 (),gfx90a,8,104,4,64,32,1024,16,8192,1700,1600,800,1600,32,mi200,56,1638.4,roofline|SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
dev0,06fa5f860366,AMD EPYC 7282 16-Core Processor,Ubuntu 20.04.5 LTS,5.11.0-27-generic,5.1.3-66,Wed Sep 28 20:46:37 2022 (),gfx90a,8,104,4,64,32,1024,16,8192,1700,1600,800,1600,32,mi200,56,1638.4,roofline|SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
1 workload_name host_name host_cpu host_distro host_kernel host_rocmver date gpu_soc numSE numCU numSIMD waveSize maxWavesPerCU maxWorkgroupSize L1 L2 sclk mclk cur_sclk cur_mclk L2Banks name numSQC hbmBW ip_blocks
2 dev0 06fa5f860366 AMD EPYC 7282 16-Core Processor Ubuntu 20.04.5 LTS 5.11.0-27-generic 5.1.3-66 Wed Sep 28 20:46:37 2022 () gfx90a 8 104 4 64 32 1024 16 8192 1700 1600 800 1600 32 mi200 56 1638.4 roofline|SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF roofline|SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,225228,225228,33554432,256,0,0,4,32,4160,0x0,0x7f9f58604280,17618191082395,17618191108316,17618191348476,17618191437046
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,225228,225228,32768,256,0,0,12,24,13888,0x0,0x7f9f58623f80,17618196106138,17618196121120,17618196134240,17618196153037
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,225228,225228,4194304,256,0,0,12,24,14336,0x7f9f770e3380,0x7f9f58623fc0,17618196155947,17618196205120,17618196297920,17618196300333
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 225228 225228 33554432 256 0 0 4 32 4160 0x0 0x7f9f58604280 17618191082395 17618191108316 17618191348476 17618191437046
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 225228 225228 32768 256 0 0 12 24 13888 0x0 0x7f9f58623f80 17618196106138 17618196121120 17618196134240 17618196153037
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 225228 225228 4194304 256 0 0 12 24 14336 0x7f9f770e3380 0x7f9f58623fc0 17618196155947 17618196205120 17618196297920 17618196300333