Update csv headers, and SystemExit codes

Signed-off-by: JoseSantosAMD <Jose.Santos@amd.com>


[ROCm/rocprofiler-compute commit: 717a21cf84]
Dieser Commit ist enthalten in:
JoseSantosAMD
2024-02-02 20:04:11 -06:00
committet von Karl W. Schulz
Ursprung 595ca9141a
Commit 8ecc6dff7f
2842 geänderte Dateien mit 5653 neuen und 3927 gelöschten Zeilen
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,SQ_WAVES,SQ_IFETCH,SQ_IFETCH_LEVEL,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,SQ_WAVES,SQ_IFETCH,SQ_IFETCH_LEVEL,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,889519,889524,33554432,256,0,0,8,32,6464,0x0,0x7fade3204180,505329,505329,524288,6291456,792877,101561476,12075726469398590,12075726714802415,12075726715127053,12075726715240096
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,889519,889524,32768,256,0,0,24,24,12480,0x0,0x7fade3235100,28706,28706,512,8192,9185,1175988,12075726729418195,12075726729733214,12075726729739934,12075726729747417
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,889519,889524,4194304,256,0,0,24,24,12928,0x7faf1355c900,0x7fade3235140,213227,213227,65536,917504,139653,17875436,12075726729813149,12075726730045212,12075726730174971,12075726730179210
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj GRBM_COUNT GRBM_GUI_ACTIVE SQ_WAVES SQ_IFETCH SQ_IFETCH_LEVEL SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 889519 889524 33554432 256 0 0 8 32 6464 0x0 0x7fade3204180 505329 505329 524288 6291456 792877 101561476 12075726469398590 12075726714802415 12075726715127053 12075726715240096
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 889519 889524 32768 256 0 0 24 24 12480 0x0 0x7fade3235100 28706 28706 512 8192 9185 1175988 12075726729418195 12075726729733214 12075726729739934 12075726729747417
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 889519 889524 4194304 256 0 0 24 24 12928 0x7faf1355c900 0x7fade3235140 213227 213227 65536 917504 139653 17875436 12075726729813149 12075726730045212 12075726730174971 12075726730179210
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_LDS,SQ_INST_LEVEL_LDS,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_LDS,SQ_INST_LEVEL_LDS,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,891318,891323,33554432,256,0,0,8,32,6464,0x0,0x7fc0d7a04180,0,0,0,12075752974042678,12075753221733652,12075753222060211,12075753222176363
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,891318,891323,32768,256,0,0,24,24,12480,0x0,0x7fc0d7a35100,0,0,0,12075753236901319,12075753237218745,12075753237225305,12075753237239437
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,891318,891323,4194304,256,0,0,24,24,12928,0x7fc207c54900,0x7fc0d7a35140,0,0,0,12075753237289390,12075753237550103,12075753237689623,12075753237693862
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_LDS SQ_INST_LEVEL_LDS SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 891318 891323 33554432 256 0 0 8 32 6464 0x0 0x7fc0d7a04180 0 0 0 12075752974042678 12075753221733652 12075753222060211 12075753222176363
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 891318 891323 32768 256 0 0 24 24 12480 0x0 0x7fc0d7a35100 0 0 0 12075753236901319 12075753237218745 12075753237225305 12075753237239437
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 891318 891323 4194304 256 0 0 24 24 12928 0x7fc207c54900 0x7fc0d7a35140 0 0 0 12075753237289390 12075753237550103 12075753237689623 12075753237693862
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_SMEM,SQ_INST_LEVEL_SMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_SMEM,SQ_INST_LEVEL_SMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,890939,890944,33554432,256,0,0,8,32,6464,0x0,0x7f8564a04180,4194304,3065390,392527368,12075750428536136,12075750672999908,12075750673325666,12075750673439498
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,890939,890944,32768,256,0,0,24,24,12480,0x0,0x7f8564a35100,512,19888,2551816,12075750688487414,12075750688799270,12075750688805350,12075750688810875
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,890939,890944,4194304,256,0,0,24,24,12928,0x7f86705c7900,0x7f8564a35140,65536,164124,20967296,12075750688875716,12075750689167108,12075750689305348,12075750689309763
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_SMEM SQ_INST_LEVEL_SMEM SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 890939 890944 33554432 256 0 0 8 32 6464 0x0 0x7f8564a04180 4194304 3065390 392527368 12075750428536136 12075750672999908 12075750673325666 12075750673439498
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 890939 890944 32768 256 0 0 24 24 12480 0x0 0x7f8564a35100 512 19888 2551816 12075750688487414 12075750688799270 12075750688805350 12075750688810875
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 890939 890944 4194304 256 0 0 24 24 12928 0x7f86705c7900 0x7f8564a35140 65536 164124 20967296 12075750688875716 12075750689167108 12075750689305348 12075750689309763
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_VMEM,SQ_INST_LEVEL_VMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_VMEM,SQ_INST_LEVEL_VMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,891129,891134,33554432,256,0,0,8,32,6464,0x0,0x7f6bf5a04180,1048576,11211256,1434098376,12075751698989828,12075751948059256,12075751948385175,12075751948497607
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,891129,891134,32768,256,0,0,24,24,12480,0x0,0x7f6bf5a35100,4096,110042,14095848,12075751963395575,12075751963698309,12075751963704549,12075751963709468
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,891129,891134,4194304,256,0,0,24,24,12928,0x7f6d01626900,0x7f6bf5a35140,524288,12978555,1661180292,12075751963773006,12075751963993988,12075751964122787,12075751964126553
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_VMEM SQ_INST_LEVEL_VMEM SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 891129 891134 33554432 256 0 0 8 32 6464 0x0 0x7f6bf5a04180 1048576 11211256 1434098376 12075751698989828 12075751948059256 12075751948385175 12075751948497607
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 891129 891134 32768 256 0 0 24 24 12480 0x0 0x7f6bf5a35100 4096 110042 14095848 12075751963395575 12075751963698309 12075751963704549 12075751963709468
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 891129 891134 4194304 256 0 0 24 24 12928 0x7f6d01626900 0x7f6bf5a35140 524288 12978555 1661180292 12075751963773006 12075751963993988 12075751964122787 12075751964126553
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,CPC_ME1_BUSY_FOR_PACKET_DECODE,SQ_CYCLES,SQ_WAVES,SQ_WAVE_CYCLES,SQ_BUSY_CYCLES,SQ_LEVEL_WAVES,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,CPC_ME1_BUSY_FOR_PACKET_DECODE,SQ_CYCLES,SQ_WAVES,SQ_WAVE_CYCLES,SQ_BUSY_CYCLES,SQ_LEVEL_WAVES,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,891508,891513,33554432,256,0,0,8,32,6464,0x0,0x7f3019604180,499350,499350,16307,3994808,524288,366187131,3797807,0,1479546076,12075754251090885,12075754495567939,12075754495889537,12075754496009475
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,891508,891513,32768,256,0,0,24,24,12480,0x0,0x7f3019635100,27998,27998,20958,223992,512,1150884,77352,0,4617544,12075754510868550,12075754511211259,12075754511217979,12075754511227137
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,891508,891513,4194304,256,0,0,24,24,12928,0x7f3125360900,0x7f3019635140,215716,215716,22358,1725736,65536,144148643,1567089,0,578410044,12075754511296295,12075754511540537,12075754511672537,12075754511676271
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj GRBM_COUNT GRBM_GUI_ACTIVE CPC_ME1_BUSY_FOR_PACKET_DECODE SQ_CYCLES SQ_WAVES SQ_WAVE_CYCLES SQ_BUSY_CYCLES SQ_LEVEL_WAVES SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 891508 891513 33554432 256 0 0 8 32 6464 0x0 0x7f3019604180 499350 499350 16307 3994808 524288 366187131 3797807 0 1479546076 12075754251090885 12075754495567939 12075754495889537 12075754496009475
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 891508 891513 32768 256 0 0 24 24 12480 0x0 0x7f3019635100 27998 27998 20958 223992 512 1150884 77352 0 4617544 12075754510868550 12075754511211259 12075754511217979 12075754511227137
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 891508 891513 4194304 256 0 0 24 24 12928 0x7f3125360900 0x7f3019635140 215716 215716 22358 1725736 65536 144148643 1567089 0 578410044 12075754511296295 12075754511540537 12075754511672537 12075754511676271
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id
Dispatch_ID,Kernel_Name,GPU_ID
0,__amd_rocclr_fillBuffer.kd,0
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID
2 0 __amd_rocclr_fillBuffer.kd 0
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0
Dateidiff unterdrückt, weil mindestens eine Zeile zu lang ist
@@ -1,4 +1,4 @@
KernelName,Count,Sum(ns),Mean(ns),Median(ns),Pct
Kernel_Name,Count,Sum(ns),Mean(ns),Median(ns),Pct
"void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 512u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd]",1,6055628.0,6055628.0,6055628.0,9.164480938887923
"void benchmark_func<int, 256, 8u, 512u>(int, int*) [clone .kd]",1,4526201.0,4526201.0,4526201.0,6.849873009054627
"void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 256u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd]",1,3054533.0,3054533.0,3054533.0,4.62267653424288
1 KernelName Kernel_Name Count Sum(ns) Mean(ns) Median(ns) Pct
2 void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 512u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd] 1 6055628.0 6055628.0 6055628.0 9.164480938887923
3 void benchmark_func<int, 256, 8u, 512u>(int, int*) [clone .kd] 1 4526201.0 4526201.0 4526201.0 6.849873009054627
4 void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 256u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd] 1 3054533.0 3054533.0 3054533.0 4.62267653424288
@@ -1,7 +1,7 @@
Metric,Count,Unit
VALU - Vector,,Instr per wave
VMEM,,Instr per wave
LDS,0.0,Instr per wave
LDS_Per_Workgroup,0.0,Instr per wave
VALU - MFMA,,Instr per wave
SALU,46.862275449101794,Instr per wave
SMEM,1.8083832335329342,Instr per wave
1 Metric Count Unit
2 VALU - Vector Instr per wave
3 VMEM Instr per wave
4 LDS LDS_Per_Workgroup 0.0 Instr per wave
5 VALU - MFMA Instr per wave
6 SALU 46.862275449101794 Instr per wave
7 SMEM 1.8083832335329342 Instr per wave
@@ -23,4 +23,4 @@ gfx908
mi100
48
1228.8
SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
1 Info
23 mi100
24 48
25 1228.8
26 SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
@@ -1,12 +1,12 @@
Metric,Avg,Min,Max,Unit
Wave Cycles,33917.877889484706,2767.5569458007812,547956.5804443359,Cycles/wave
LDS Instrs,0.0,0.0,0.0,Instr per wave
LDS_Per_Workgroup Instrs,0.0,0.0,0.0,Instr per wave
Bandwidth,0.0,0.0,0.0,Bytes per wave
Bank Conficts/Access,,,,Conflicts/access
Index Accesses,0.0,0.0,0.0,Cycles per wave
Dispatch_ID Accesses,0.0,0.0,0.0,Cycles per wave
Atomic Cycles,0.0,0.0,0.0,Cycles per wave
Bank Conflict,0.0,0.0,0.0,Cycles per wave
Addr Conflict,0.0,0.0,0.0,Cycles per wave
Unaligned Stall,0.0,0.0,0.0,Cycles per wave
Mem Violations,0.0,0.0,0.0, per wave
LDS Latency,,,,Cycles
LDS_Per_Workgroup Latency,,,,Cycles
1 Metric Avg Min Max Unit
2 Wave Cycles 33917.877889484706 2767.5569458007812 547956.5804443359 Cycles/wave
3 LDS Instrs LDS_Per_Workgroup Instrs 0.0 0.0 0.0 Instr per wave
4 Bandwidth 0.0 0.0 0.0 Bytes per wave
5 Bank Conficts/Access Conflicts/access
6 Index Accesses Dispatch_ID Accesses 0.0 0.0 0.0 Cycles per wave
7 Atomic Cycles 0.0 0.0 0.0 Cycles per wave
8 Bank Conflict 0.0 0.0 0.0 Cycles per wave
9 Addr Conflict 0.0 0.0 0.0 Cycles per wave
10 Unaligned Stall 0.0 0.0 0.0 Cycles per wave
11 Mem Violations 0.0 0.0 0.0 per wave
12 LDS Latency LDS_Per_Workgroup Latency Cycles
@@ -6,16 +6,16 @@ SMEM,2.0,smem_
VALU,735.0,valu_
MFMA,,mfma_
VMEM,8.0,vmem_
LDS,0.0,lds_
LDS_Per_Workgroup,0.0,lds_
GWS,0.0,gws_
BR,22.0,br_
VGPR,24.0,vgpr_
SGPR,24.0,sgpr_
LDS Allocation,0.0,lds_alloc_
LDS_Per_Workgroup Allocation,0.0,lds_alloc_
Scratch Allocation,0.0,scratch_alloc_
Wavefronts,67894.0,wavefronts_
Workgroups,16973.0,workgroups_
LDS Req,0.0,lds_req_
LDS_Per_Workgroup Req,0.0,lds_req_
IL1 Fetch,163.0,il1_fetch_
IL1 Hit,100.0,il1_hit_
IL1_L2 Rd,0.0,il1_l2_req_
@@ -46,10 +46,10 @@ Fabric_L2 Wr,0.0,l2_fabric_wr_
Fabric_l2 Atomic,0.0,l2_fabric_atom_
HBM Rd,44.0,hbm_rd_
HBM Wr,0.0,hbm_wr_
LDS Util,0.0,lds_util_
LDS_Per_Workgroup Util,0.0,lds_util_
VL1 Coalesce,70.0,vl1_coales_
VL1 Stall,31.0,vl1_stall_
LDS Lat,,lds_lat_
LDS_Per_Workgroup Lat,,lds_lat_
vL1D Lat,,sl1_lat_
IL1 Lat,,il1_lat_
Wave Occupancy,37.0,wave_occ_
1 Metric Value Alias
6 VALU 735.0 valu_
7 MFMA mfma_
8 VMEM 8.0 vmem_
9 LDS LDS_Per_Workgroup 0.0 lds_
10 GWS 0.0 gws_
11 BR 22.0 br_
12 VGPR 24.0 vgpr_
13 SGPR 24.0 sgpr_
14 LDS Allocation LDS_Per_Workgroup Allocation 0.0 lds_alloc_
15 Scratch Allocation 0.0 scratch_alloc_
16 Wavefronts 67894.0 wavefronts_
17 Workgroups 16973.0 workgroups_
18 LDS Req LDS_Per_Workgroup Req 0.0 lds_req_
19 IL1 Fetch 163.0 il1_fetch_
20 IL1 Hit 100.0 il1_hit_
21 IL1_L2 Rd 0.0 il1_l2_req_
46 Fabric_l2 Atomic 0.0 l2_fabric_atom_
47 HBM Rd 44.0 hbm_rd_
48 HBM Wr 0.0 hbm_wr_
49 LDS Util LDS_Per_Workgroup Util 0.0 lds_util_
50 VL1 Coalesce 70.0 vl1_coales_
51 VL1 Stall 31.0 vl1_stall_
52 LDS Lat LDS_Per_Workgroup Lat lds_lat_
53 vL1D Lat sl1_lat_
54 IL1 Lat il1_lat_
55 Wave Occupancy 37.0 wave_occ_
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id
Dispatch_ID,Kernel_Name,GPU_ID
0,__amd_rocclr_fillBuffer.kd,0
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID
2 0 __amd_rocclr_fillBuffer.kd 0
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0
@@ -12,8 +12,8 @@ VALU Util,59.59200061950603,Pct,100,59.59200061950603
MFMA Util,,Pct,100,
VALU Active Threads/Wave,63.96947733475583,Threads,64,99.95230833555598
IPC - Issue,0.8437420287965051,Instr/cycle,5,16.8748405759301
LDS BW,0.0,Gb/sec,23070.72,0.0
LDS Bank Conflict,,Conflicts/access,32,
LDS_Per_Workgroup BW,0.0,Gb/sec,23070.72,0.0
LDS_Per_Workgroup Bank Conflict,,Conflicts/access,32,
Instr Cache Hit Rate,99.99342432649306,Pct,100,99.99342432649306
Instr Cache BW,1407.2673827157548,Gb/s,4614.144,30.49899142106867
Scalar L1D Cache Hit Rate,99.35620448525918,Pct,100,99.35620448525918
1 Metric Value Unit Peak PoP
12 MFMA Util Pct 100
13 VALU Active Threads/Wave 63.96947733475583 Threads 64 99.95230833555598
14 IPC - Issue 0.8437420287965051 Instr/cycle 5 16.8748405759301
15 LDS BW LDS_Per_Workgroup BW 0.0 Gb/sec 23070.72 0.0
16 LDS Bank Conflict LDS_Per_Workgroup Bank Conflict Conflicts/access 32
17 Instr Cache Hit Rate 99.99342432649306 Pct 100 99.99342432649306
18 Instr Cache BW 1407.2673827157548 Gb/s 4614.144 30.49899142106867
19 Scalar L1D Cache Hit Rate 99.35620448525918 Pct 100 99.35620448525918
@@ -6,7 +6,7 @@ Scratch Stall,0.0,0,0,Cycles
Insufficient SIMD Waveslots,61976.520958083835,0,735930,Simd
Insufficient SIMD VGPRs,542399.497005988,0,29155875,Simd
Insufficient SIMD SGPRs,0.0,0,0,Simd
Insufficient CU LDS,0.0,0,0,Cu
Insufficient CU LDS_Per_Workgroup,0.0,0,0,Cu
Insufficient CU Barries,0.0,0,0,Cu
Insufficient Bulky Resource,0.0,0,0,Cu
Reach CU Threadgroups Limit,0.0,0,0,Cycles
1 Metric Avg Min Max Unit
6 Insufficient SIMD Waveslots 61976.520958083835 0 735930 Simd
7 Insufficient SIMD VGPRs 542399.497005988 0 29155875 Simd
8 Insufficient SIMD SGPRs 0.0 0 0 Simd
9 Insufficient CU LDS Insufficient CU LDS_Per_Workgroup 0.0 0 0 Cu
10 Insufficient CU Barries 0.0 0 0 Cu
11 Insufficient Bulky Resource 0.0 0 0 Cu
12 Reach CU Threadgroups Limit 0.0 0 0 Cycles
@@ -6,5 +6,5 @@ Saved Wavefronts,0.0,0,0,Wavefronts
Restored Wavefronts,0.0,0,0,Wavefronts
VGPRs,23.976047904191617,8,36,Registers
SGPRs,24.047904191616766,24,32,Registers
LDS Allocation,0.0,0,0,Bytes
LDS_Per_Workgroup Allocation,0.0,0,0,Bytes
Scratch Allocation,0.0,0,0,Bytes
1 Metric Avg Min Max Unit
6 Restored Wavefronts 0.0 0 0 Wavefronts
7 VGPRs 23.976047904191617 8 36 Registers
8 SGPRs 24.047904191616766 24 32 Registers
9 LDS Allocation LDS_Per_Workgroup Allocation 0.0 0 0 Bytes
10 Scratch Allocation 0.0 0 0 Bytes
@@ -1,2 +1,2 @@
workload_name,host_name,host_cpu,host_distro,host_kernel,host_rocmver,date,gpu_soc,numSE,numCU,numSIMD,waveSize,maxWavesPerCU,maxWorkgroupSize,L1,L2,sclk,mclk,cur_sclk,cur_mclk,L2Banks,name,numSQC,hbmBW,ip_blocks
kernels,vesuvius,AMD EPYC 7542 32-Core Processor,,4.18.0-240.15.1.el8_3.x86_64,4.2.0-21,Thu Sep 22 11:21:41 2022 (CDT),gfx908,8,120,4,64,40,1024,16,,1502,1200,300,1200,32,mi100,48,1228.8,SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
kernels,vesuvius,AMD EPYC 7542 32-Core Processor,,4.18.0-240.15.1.el8_3.x86_64,4.2.0-21,Thu Sep 22 11:21:41 2022 (CDT),gfx908,8,120,4,64,40,1024,16,,1502,1200,300,1200,32,mi100,48,1228.8,SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
1 workload_name host_name host_cpu host_distro host_kernel host_rocmver date gpu_soc numSE numCU numSIMD waveSize maxWavesPerCU maxWorkgroupSize L1 L2 sclk mclk cur_sclk cur_mclk L2Banks name numSQC hbmBW ip_blocks
2 kernels vesuvius AMD EPYC 7542 32-Core Processor 4.18.0-240.15.1.el8_3.x86_64 4.2.0-21 Thu Sep 22 11:21:41 2022 (CDT) gfx908 8 120 4 64 40 1024 16 1502 1200 300 1200 32 mi100 48 1228.8 SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBuffer.kd",0,0,0,891557,891562,33554432,256,0,0,8,32,6464,0x0,0x7fbba9204180,12075755395432052,12075755395473365,12075755395797202,12075755395906163
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,891557,891562,32768,256,0,0,24,24,12480,0x0,0x7fbba9235100,12075755411537444,12075755411649045,12075755411655605,12075755411661073
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,4,891557,891562,4194304,256,0,0,24,24,12928,0x7fbcb4f48900,0x7fbba9235140,12075755411717368,12075755411733204,12075755411873363,12075755411876484
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBuffer.kd 0 0 0 891557 891562 33554432 256 0 0 8 32 6464 0x0 0x7fbba9204180 12075755395432052 12075755395473365 12075755395797202 12075755395906163
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 891557 891562 32768 256 0 0 24 24 12480 0x0 0x7fbba9235100 12075755411537444 12075755411649045 12075755411655605 12075755411661073
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 4 891557 891562 4194304 256 0 0 24 24 12928 0x7fbcb4f48900 0x7fbba9235140 12075755411717368 12075755411733204 12075755411873363 12075755411876484
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,SQ_WAVES,SQ_IFETCH,SQ_IFETCH_LEVEL,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,SQ_WAVES,SQ_IFETCH,SQ_IFETCH_LEVEL,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,188020,188020,33554432,256,0,0,4,32,4160,0x0,0x7ff003604280,381872,381872,524288,4718592,680045,76238404,17018811649857,17018099819752,17018955121694,17018955231973
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,188020,188020,32768,256,0,0,12,24,13888,0x0,0x7ff003623f80,32726,32726,512,8192,7488,835840,17018960426954,17018955121694,17018960558647,17018960563330
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,188020,188020,4194304,256,0,0,12,24,14336,0x7ff0066f6380,0x7ff003623fc0,165172,165172,65536,917504,152878,17126672,17018960599629,17018960558647,17018960927606,17018960930139
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj GRBM_COUNT GRBM_GUI_ACTIVE SQ_WAVES SQ_IFETCH SQ_IFETCH_LEVEL SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 188020 188020 33554432 256 0 0 4 32 4160 0x0 0x7ff003604280 381872 381872 524288 4718592 680045 76238404 17018811649857 17018099819752 17018955121694 17018955231973
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 188020 188020 32768 256 0 0 12 24 13888 0x0 0x7ff003623f80 32726 32726 512 8192 7488 835840 17018960426954 17018955121694 17018960558647 17018960563330
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 188020 188020 4194304 256 0 0 12 24 14336 0x7ff0066f6380 0x7ff003623fc0 165172 165172 65536 917504 152878 17126672 17018960599629 17018960558647 17018960927606 17018960930139
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_LDS,SQ_INST_LEVEL_LDS,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_LDS,SQ_INST_LEVEL_LDS,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,189868,189868,33554432,256,0,0,4,32,4160,0x0,0x7f8aad404280,0,0,0,17038275188179,17037561541743,17038422398116,17038422510425
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,189868,189868,32768,256,0,0,12,24,13888,0x0,0x7f8aad423f80,0,0,0,17038427681418,17038422398116,17038427809460,17038427814184
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,189868,189868,4194304,256,0,0,12,24,14336,0x7f8ab035f380,0x7f8aad423fc0,0,0,0,17038427847943,17038427809460,17038428182419,17038428185163
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_LDS SQ_INST_LEVEL_LDS SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 189868 189868 33554432 256 0 0 4 32 4160 0x0 0x7f8aad404280 0 0 0 17038275188179 17037561541743 17038422398116 17038422510425
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 189868 189868 32768 256 0 0 12 24 13888 0x0 0x7f8aad423f80 0 0 0 17038427681418 17038422398116 17038427809460 17038427814184
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 189868 189868 4194304 256 0 0 12 24 14336 0x7f8ab035f380 0x7f8aad423fc0 0 0 0 17038427847943 17038427809460 17038428182419 17038428185163
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_SMEM,SQ_INST_LEVEL_SMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_SMEM,SQ_INST_LEVEL_SMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,187798,187798,33554432,256,0,0,4,32,4160,0x0,0x7fdf25a04280,3670016,2898156,324749792,17017871486203,17004563619503,17018017050409,17018017164238
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,187798,187798,32768,256,0,0,12,24,13888,0x0,0x7fdf25a23f80,512,100390,11234352,17018022229652,17018017050409,17018022366561,17018022371497
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,187798,187798,4194304,256,0,0,12,24,14336,0x7fdf28a16380,0x7fdf25a23fc0,65536,646794,72359192,17018022406216,17018022366561,17018022736641,17018022739477
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_SMEM SQ_INST_LEVEL_SMEM SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 187798 187798 33554432 256 0 0 4 32 4160 0x0 0x7fdf25a04280 3670016 2898156 324749792 17017871486203 17004563619503 17018017050409 17018017164238
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 187798 187798 32768 256 0 0 12 24 13888 0x0 0x7fdf25a23f80 512 100390 11234352 17018022229652 17018017050409 17018022366561 17018022371497
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 187798 187798 4194304 256 0 0 12 24 14336 0x7fdf28a16380 0x7fdf25a23fc0 65536 646794 72359192 17018022406216 17018022366561 17018022736641 17018022739477
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,SQ_INSTS_VMEM,SQ_INST_LEVEL_VMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,SQ_INSTS_VMEM,SQ_INST_LEVEL_VMEM,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,189646,189646,33554432,256,0,0,4,32,4160,0x0,0x7f9d56804280,524288,5490901,614983748,17037332490146,17034965056754,17037481413903,17037481526322
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,189646,189646,32768,256,0,0,12,24,13888,0x0,0x7f9d56823f80,4096,35384,3967344,17037486684195,17037481413903,17037486810049,17037486814861
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,189646,189646,4194304,256,0,0,12,24,14336,0x7f9d5979f380,0x7f9d56823fc0,524288,10971179,1228733104,17037486847540,17037486810049,17037487179488,17037487182511
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj SQ_INSTS_VMEM SQ_INST_LEVEL_VMEM SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 189646 189646 33554432 256 0 0 4 32 4160 0x0 0x7f9d56804280 524288 5490901 614983748 17037332490146 17034965056754 17037481413903 17037481526322
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 189646 189646 32768 256 0 0 12 24 13888 0x0 0x7f9d56823f80 4096 35384 3967344 17037486684195 17037481413903 17037486810049 17037486814861
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 189646 189646 4194304 256 0 0 12 24 14336 0x7f9d5979f380 0x7f9d56823fc0 524288 10971179 1228733104 17037486847540 17037486810049 17037487179488 17037487182511
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,CPC_ME1_BUSY_FOR_PACKET_DECODE,SQ_CYCLES,SQ_WAVES,SQ_WAVE_CYCLES,SQ_BUSY_CYCLES,SQ_LEVEL_WAVES,SQ_ACCUM_PREV_HIRES,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,GRBM_COUNT,GRBM_GUI_ACTIVE,CPC_ME1_BUSY_FOR_PACKET_DECODE,SQ_CYCLES,SQ_WAVES,SQ_WAVE_CYCLES,SQ_BUSY_CYCLES,SQ_LEVEL_WAVES,SQ_ACCUM_PREV_HIRES,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,188242,188242,33554432,256,0,0,4,32,4160,0x0,0x7fd4a6804280,388284,388284,8778,3106280,524288,244967804,3019488,0,996171404,17019739890511,17019036428116,17019885027682,17019885140781
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,188242,188242,32768,256,0,0,12,24,13888,0x0,0x7fd4a6823f80,33728,33728,30230,269832,512,1693019,164026,0,6785384,17019890314053,17019885027682,17019890453268,17019890458139
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,188242,188242,4194304,256,0,0,12,24,14336,0x7fd4a9882380,0x7fd4a6823fc0,164607,164607,14285,1316864,65536,82622429,1217167,0,332218900,17019890502057,17019890453268,17019890848147,17019890850967
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj GRBM_COUNT GRBM_GUI_ACTIVE CPC_ME1_BUSY_FOR_PACKET_DECODE SQ_CYCLES SQ_WAVES SQ_WAVE_CYCLES SQ_BUSY_CYCLES SQ_LEVEL_WAVES SQ_ACCUM_PREV_HIRES DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 188242 188242 33554432 256 0 0 4 32 4160 0x0 0x7fd4a6804280 388284 388284 8778 3106280 524288 244967804 3019488 0 996171404 17019739890511 17019036428116 17019885027682 17019885140781
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 188242 188242 32768 256 0 0 12 24 13888 0x0 0x7fd4a6823f80 33728 33728 30230 269832 512 1693019 164026 0 6785384 17019890314053 17019885027682 17019890453268 17019890458139
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 188242 188242 4194304 256 0 0 12 24 14336 0x7fd4a9882380 0x7fd4a6823fc0 164607 164607 14285 1316864 65536 82622429 1217167 0 332218900 17019890502057 17019890453268 17019890848147 17019890850967
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id
Dispatch_ID,Kernel_Name,GPU_ID
0,__amd_rocclr_fillBufferAligned.kd,0
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID
2 0 __amd_rocclr_fillBufferAligned.kd 0
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0
Dateidiff unterdrückt, weil mindestens eine Zeile zu lang ist
@@ -1,4 +1,4 @@
KernelName,Count,Sum(ns),Mean(ns),Median(ns),Pct
Kernel_Name,Count,Sum(ns),Mean(ns),Median(ns),Pct
"void benchmark_func<int, 256, 8u, 512u>(int, int*) [clone .kd]",1,3356953.0,3356953.0,3356953.0,7.844214293382022
"void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 512u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd]",1,1724636.0,1724636.0,1724636.0,4.02996835585163
"void benchmark_func<double, 256, 8u, 512u>(double, double*) [clone .kd]",1,1715197.0,1715197.0,1715197.0,4.007912182078797
1 KernelName Kernel_Name Count Sum(ns) Mean(ns) Median(ns) Pct
2 void benchmark_func<int, 256, 8u, 512u>(int, int*) [clone .kd] 1 3356953.0 3356953.0 3356953.0 7.844214293382022
3 void benchmark_func<HIP_vector_type<float, 2u>, 256, 8u, 512u>(HIP_vector_type<float, 2u>, HIP_vector_type<float, 2u>*) [clone .kd] 1 1724636.0 1724636.0 1724636.0 4.02996835585163
4 void benchmark_func<double, 256, 8u, 512u>(double, double*) [clone .kd] 1 1715197.0 1715197.0 1715197.0 4.007912182078797
@@ -1,7 +1,7 @@
Metric,Count,Unit
VALU - Vector,494.8622754491018,Instr per wave
VMEM,7.958083832335329,Instr per wave
LDS,0.0,Instr per wave
LDS_Per_Workgroup,0.0,Instr per wave
VALU - MFMA,0.0,Instr per wave
SALU,24.520958083832337,Instr per wave
SMEM,1.8023952095808384,Instr per wave
1 Metric Count Unit
2 VALU - Vector 494.8622754491018 Instr per wave
3 VMEM 7.958083832335329 Instr per wave
4 LDS LDS_Per_Workgroup 0.0 Instr per wave
5 VALU - MFMA 0.0 Instr per wave
6 SALU 24.520958083832337 Instr per wave
7 SMEM 1.8023952095808384 Instr per wave
@@ -23,4 +23,4 @@ gfx90a
mi200
56
1638.4
roofline|SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
roofline|SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
1 Info
23 mi200
24 56
25 1638.4
26 roofline|SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF roofline|SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
@@ -1,12 +1,12 @@
Metric,Avg,Min,Max,Unit
Wave Cycles,18383.545308552817,1896.5850219726562,258014.9185180664,Cycles/wave
LDS Instrs,0.0,0.0,0.0,Instr per wave
LDS_Per_Workgroup Instrs,0.0,0.0,0.0,Instr per wave
Bandwidth,0.0,0.0,0.0,Bytes per wave
Bank Conficts/Access,,,,Conflicts/access
Index Accesses,0.0,0.0,0.0,Cycles per wave
Dispatch_ID Accesses,0.0,0.0,0.0,Cycles per wave
Atomic Cycles,0.0,0.0,0.0,Cycles per wave
Bank Conflict,0.0,0.0,0.0,Cycles per wave
Addr Conflict,0.0,0.0,0.0,Cycles per wave
Unaligned Stall,0.0,0.0,0.0,Cycles per wave
Mem Violations,0.0,0.0,0.0, per wave
LDS Latency,,,,Cycles
LDS_Per_Workgroup Latency,,,,Cycles
1 Metric Avg Min Max Unit
2 Wave Cycles 18383.545308552817 1896.5850219726562 258014.9185180664 Cycles/wave
3 LDS Instrs LDS_Per_Workgroup Instrs 0.0 0.0 0.0 Instr per wave
4 Bandwidth 0.0 0.0 0.0 Bytes per wave
5 Bank Conficts/Access Conflicts/access
6 Index Accesses Dispatch_ID Accesses 0.0 0.0 0.0 Cycles per wave
7 Atomic Cycles 0.0 0.0 0.0 Cycles per wave
8 Bank Conflict 0.0 0.0 0.0 Cycles per wave
9 Addr Conflict 0.0 0.0 0.0 Cycles per wave
10 Unaligned Stall 0.0 0.0 0.0 Cycles per wave
11 Mem Violations 0.0 0.0 0.0 per wave
12 LDS Latency LDS_Per_Workgroup Latency Cycles
@@ -6,16 +6,16 @@ SMEM,2.0,smem_
VALU,495.0,valu_
MFMA,0.0,mfma_
VMEM,8.0,vmem_
LDS,0.0,lds_
LDS_Per_Workgroup,0.0,lds_
GWS,0.0,gws_
BR,10.0,br_
VGPR,12.0,vgpr_
SGPR,24.0,sgpr_
LDS Allocation,0.0,lds_alloc_
LDS_Per_Workgroup Allocation,0.0,lds_alloc_
Scratch Allocation,0.0,scratch_alloc_
Wavefronts,67894.0,wavefronts_
Workgroups,16973.0,workgroups_
LDS Req,0.0,lds_req_
LDS_Per_Workgroup Req,0.0,lds_req_
IL1 Fetch,128.0,il1_fetch_
IL1 Hit,100.0,il1_hit_
IL1_L2 Rd,0.0,il1_l2_req_
@@ -46,10 +46,10 @@ Fabric_L2 Wr,0.0,l2_fabric_wr_
Fabric_l2 Atomic,0.0,l2_fabric_atom_
HBM Rd,44.0,hbm_rd_
HBM Wr,0.0,hbm_wr_
LDS Util,0.0,lds_util_
LDS_Per_Workgroup Util,0.0,lds_util_
VL1 Coalesce,70.0,vl1_coales_
VL1 Stall,2.0,vl1_stall_
LDS Lat,,lds_lat_
LDS_Per_Workgroup Lat,,lds_lat_
vL1D Lat,,sl1_lat_
IL1 Lat,,il1_lat_
Wave Occupancy,26.0,wave_occ_
1 Metric Value Alias
6 VALU 495.0 valu_
7 MFMA 0.0 mfma_
8 VMEM 8.0 vmem_
9 LDS LDS_Per_Workgroup 0.0 lds_
10 GWS 0.0 gws_
11 BR 10.0 br_
12 VGPR 12.0 vgpr_
13 SGPR 24.0 sgpr_
14 LDS Allocation LDS_Per_Workgroup Allocation 0.0 lds_alloc_
15 Scratch Allocation 0.0 scratch_alloc_
16 Wavefronts 67894.0 wavefronts_
17 Workgroups 16973.0 workgroups_
18 LDS Req LDS_Per_Workgroup Req 0.0 lds_req_
19 IL1 Fetch 128.0 il1_fetch_
20 IL1 Hit 100.0 il1_hit_
21 IL1_L2 Rd 0.0 il1_l2_req_
46 Fabric_l2 Atomic 0.0 l2_fabric_atom_
47 HBM Rd 44.0 hbm_rd_
48 HBM Wr 0.0 hbm_wr_
49 LDS Util LDS_Per_Workgroup Util 0.0 lds_util_
50 VL1 Coalesce 70.0 vl1_coales_
51 VL1 Stall 2.0 vl1_stall_
52 LDS Lat LDS_Per_Workgroup Lat lds_lat_
53 vL1D Lat sl1_lat_
54 IL1 Lat il1_lat_
55 Wave Occupancy 26.0 wave_occ_
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id
Dispatch_ID,Kernel_Name,GPU_ID
0,__amd_rocclr_fillBufferAligned.kd,0
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID
2 0 __amd_rocclr_fillBufferAligned.kd 0
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0
@@ -12,8 +12,8 @@ VALU Util,58.383802523427974,Pct,100,58.383802523427974
MFMA Util,0.0,Pct,100,0.0
VALU Active Threads/Wave,64.0,Threads,64,100.0
IPC - Issue,1.0,Instr/cycle,5,20.0
LDS BW,0.0,Gb/sec,22630.4,0.0
LDS Bank Conflict,,Conflicts/access,32,
LDS_Per_Workgroup BW,0.0,Gb/sec,22630.4,0.0
LDS_Per_Workgroup Bank Conflict,,Conflicts/access,32,
Instr Cache Hit Rate,99.9926058738864,Pct,100,99.9926058738864
Instr Cache BW,1674.7745445510106,Gb/s,6092.8,27.487764977531032
Scalar L1D Cache Hit Rate,99.34855886084364,Pct,100,99.34855886084364
1 Metric Value Unit Peak PoP
12 MFMA Util 0.0 Pct 100 0.0
13 VALU Active Threads/Wave 64.0 Threads 64 100.0
14 IPC - Issue 1.0 Instr/cycle 5 20.0
15 LDS BW LDS_Per_Workgroup BW 0.0 Gb/sec 22630.4 0.0
16 LDS Bank Conflict LDS_Per_Workgroup Bank Conflict Conflicts/access 32
17 Instr Cache Hit Rate 99.9926058738864 Pct 100 99.9926058738864
18 Instr Cache BW 1674.7745445510106 Gb/s 6092.8 27.487764977531032
19 Scalar L1D Cache Hit Rate 99.34855886084364 Pct 100 99.34855886084364
@@ -6,7 +6,7 @@ Scratch Stall,0.0,0,0,Cycles
Insufficient SIMD Waveslots,12620403.994011976,0,383533081,Simd
Insufficient SIMD VGPRs,0.0,0,0,Simd
Insufficient SIMD SGPRs,0.0,0,0,Simd
Insufficient CU LDS,0.0,0,0,Cu
Insufficient CU LDS_Per_Workgroup,0.0,0,0,Cu
Insufficient CU Barries,0.0,0,0,Cu
Insufficient Bulky Resource,0.0,0,0,Cu
Reach CU Threadgroups Limit,0.0,0,0,Cycles
1 Metric Avg Min Max Unit
6 Insufficient SIMD Waveslots 12620403.994011976 0 383533081 Simd
7 Insufficient SIMD VGPRs 0.0 0 0 Simd
8 Insufficient SIMD SGPRs 0.0 0 0 Simd
9 Insufficient CU LDS Insufficient CU LDS_Per_Workgroup 0.0 0 0 Cu
10 Insufficient CU Barries 0.0 0 0 Cu
11 Insufficient Bulky Resource 0.0 0 0 Cu
12 Reach CU Threadgroups Limit 0.0 0 0 Cycles
@@ -6,5 +6,5 @@ Saved Wavefronts,0.0,0,0,Wavefronts
Restored Wavefronts,0.0,0,0,Wavefronts
VGPRs,11.784431137724551,4,16,Registers
SGPRs,24.047904191616766,24,32,Registers
LDS Allocation,0.0,0,0,Bytes
LDS_Per_Workgroup Allocation,0.0,0,0,Bytes
Scratch Allocation,0.0,0,0,Bytes
1 Metric Avg Min Max Unit
6 Restored Wavefronts 0.0 0 0 Wavefronts
7 VGPRs 11.784431137724551 4 16 Registers
8 SGPRs 24.047904191616766 24 32 Registers
9 LDS Allocation LDS_Per_Workgroup Allocation 0.0 0 0 Bytes
10 Scratch Allocation 0.0 0 0 Bytes
@@ -1,2 +1,2 @@
workload_name,host_name,host_cpu,host_distro,host_kernel,host_rocmver,date,gpu_soc,numSE,numCU,numSIMD,waveSize,maxWavesPerCU,maxWorkgroupSize,L1,L2,sclk,mclk,cur_sclk,cur_mclk,L2Banks,name,numSQC,hbmBW,ip_blocks
kernels,06fa5f860366,AMD EPYC 7282 16-Core Processor,Ubuntu 20.04.5 LTS,5.11.0-27-generic,5.1.3-66,Wed Sep 28 20:36:58 2022 (),gfx90a,8,104,4,64,32,1024,16,8192,1700,1600,800,1600,32,mi200,56,1638.4,roofline|SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
kernels,06fa5f860366,AMD EPYC 7282 16-Core Processor,Ubuntu 20.04.5 LTS,5.11.0-27-generic,5.1.3-66,Wed Sep 28 20:36:58 2022 (),gfx90a,8,104,4,64,32,1024,16,8192,1700,1600,800,1600,32,mi200,56,1638.4,roofline|SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
1 workload_name host_name host_cpu host_distro host_kernel host_rocmver date gpu_soc numSE numCU numSIMD waveSize maxWavesPerCU maxWorkgroupSize L1 L2 sclk mclk cur_sclk cur_mclk L2Banks name numSQC hbmBW ip_blocks
2 kernels 06fa5f860366 AMD EPYC 7282 16-Core Processor Ubuntu 20.04.5 LTS 5.11.0-27-generic 5.1.3-66 Wed Sep 28 20:36:58 2022 () gfx90a 8 104 4 64 32 1024 16 8192 1700 1600 800 1600 32 mi200 56 1638.4 roofline|SQ|LDS|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF roofline|SQ|LDS_Per_Workgroup|SQC|TA|TD|TCP|TCC|SPI|CPC|CPF
@@ -1,4 +1,4 @@
Index,KernelName,gpu-id,queue-id,queue-index,pid,tid,grd,wgr,lds,scr,vgpr,sgpr,fbar,sig,obj,DispatchNs,BeginNs,EndNs,CompleteNs
Dispatch_ID,Kernel_Name,GPU_ID,queue-id,queue-index,pid,tid,grd,Workgroup_Size,LDS_Per_Workgroup,scr,vgpr,SGPR,fbar,sig,obj,DispatchNs,Start_Timestamp,End_Timestamp,CompleteNs
0,"__amd_rocclr_fillBufferAligned.kd",0,0,0,189951,189951,33554432,256,0,0,4,32,4160,0x0,0x7fefa1004280,17039094299446,17039094324187,17039094564027,17039094645986
1,"void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd]",0,0,2,189951,189951,32768,256,0,0,12,24,13888,0x0,0x7fefa1023f80,17039099396231,17039099412016,17039099425136,17039099444229
2,"void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd]",0,0,5,189951,189951,4194304,256,0,0,12,24,14336,0x7fefa40a4380,0x7fefa1023fc0,17039099447889,17039099497936,17039099590576,17039099592655
1 Index Dispatch_ID KernelName Kernel_Name gpu-id GPU_ID queue-id queue-index pid tid grd wgr Workgroup_Size lds LDS_Per_Workgroup scr vgpr sgpr SGPR fbar sig obj DispatchNs BeginNs Start_Timestamp EndNs End_Timestamp CompleteNs
2 0 __amd_rocclr_fillBufferAligned.kd 0 0 0 189951 189951 33554432 256 0 0 4 32 4160 0x0 0x7fefa1004280 17039094299446 17039094324187 17039094564027 17039094645986
3 1 void benchmark_func<short, 256, 8u, 0u>(short, short*) [clone .kd] 0 0 2 189951 189951 32768 256 0 0 12 24 13888 0x0 0x7fefa1023f80 17039099396231 17039099412016 17039099425136 17039099444229
4 2 void benchmark_func<float, 256, 8u, 0u>(float, float*) [clone .kd] 0 0 5 189951 189951 4194304 256 0 0 12 24 14336 0x7fefa40a4380 0x7fefa1023fc0 17039099447889 17039099497936 17039099590576 17039099592655