The pattern matching and vectgorization for reductions was not very
effective. Some of of the possible reduction values were marked as
external arguments, SLP could not find some reduction patterns because
of too early attempt to vectorize pair of binops arguments, the cost of
consts reductions was not correct. Patch addresses these issues and
improves the analysis/cost estimation and vectorization of the
reductions.
The most significant changes in SLP.NumVectorInstructions:
Metric: SLP.NumVectorInstructions [140/14396]
Program results results0 diff
test-suite :: SingleSource/Benchmarks/Adobe-C++/loop_unroll.test 920.00 3548.00 285.7%
test-suite :: SingleSource/Benchmarks/BenchmarkGame/n-body.test 66.00 122.00 84.8%
test-suite :: MultiSource/Benchmarks/DOE-ProxyApps-C/miniGMG/miniGMG.test 100.00 128.00 28.0%
test-suite :: MultiSource/Benchmarks/Prolangs-C/TimberWolfMC/timberwolfmc.test 664.00 810.00 22.0%
test-suite :: MultiSource/Benchmarks/mafft/pairlocalalign.test 592.00 687.00 16.0%
test-suite :: MultiSource/Benchmarks/MiBench/consumer-lame/consumer-lame.test 402.00 426.00 6.0%
test-suite :: MultiSource/Applications/JM/lencod/lencod.test 1665.00 1745.00 4.8%
test-suite :: External/SPEC/CINT2017rate/500.perlbench_r/500.perlbench_r.test 135.00 139.00 3.0%
test-suite :: External/SPEC/CINT2017speed/600.perlbench_s/600.perlbench_s.test 135.00 139.00 3.0%
test-suite :: MultiSource/Benchmarks/7zip/7zip-benchmark.test 388.00 397.00 2.3%
test-suite :: MultiSource/Applications/JM/ldecod/ldecod.test 895.00 914.00 2.1%
test-suite :: MultiSource/Benchmarks/MiBench/telecomm-gsm/telecomm-gsm.test 240.00 244.00 1.7%
test-suite :: MultiSource/Benchmarks/mediabench/gsm/toast/toast.test 240.00 244.00 1.7%
test-suite :: External/SPEC/CINT2017speed/602.gcc_s/602.gcc_s.test 820.00 832.00 1.5%
test-suite :: External/SPEC/CINT2017rate/502.gcc_r/502.gcc_r.test 820.00 832.00 1.5%
test-suite :: External/SPEC/CFP2017rate/526.blender_r/526.blender_r.test 14804.00 14914.00 0.7%
test-suite :: MultiSource/Benchmarks/Bullet/bullet.test 8125.00 8183.00 0.7%
test-suite :: External/SPEC/CINT2017speed/625.x264_s/625.x264_s.test 1330.00 1338.00 0.6%
test-suite :: External/SPEC/CINT2017rate/525.x264_r/525.x264_r.test 1330.00 1338.00 0.6%
test-suite :: External/SPEC/CFP2017rate/510.parest_r/510.parest_r.test 9832.00 9880.00 0.5%
test-suite :: External/SPEC/CFP2017rate/511.povray_r/511.povray_r.test 5267.00 5291.00 0.5%
test-suite :: External/SPEC/CFP2017rate/538.imagick_r/538.imagick_r.test 4018.00 4024.00 0.1%
test-suite :: External/SPEC/CFP2017speed/638.imagick_s/638.imagick_s.test 4018.00 4024.00 0.1%
test-suite :: External/SPEC/CFP2017speed/644.nab_s/644.nab_s.test 426.00 424.00 -0.5%
test-suite :: External/SPEC/CFP2017rate/544.nab_r/544.nab_r.test 426.00 424.00 -0.5%
test-suite :: External/SPEC/CINT2017rate/541.leela_r/541.leela_r.test 201.00 192.00 -4.5%
test-suite :: External/SPEC/CINT2017speed/641.leela_s/641.leela_s.test 201.00 192.00 -4.5%
644.nab_s and 544.nab_r - reduced number of shuffles but increased number
of useful vectorized instructions.
641.leela_s and 541.leela_r - the function
`@_ZN9FastBoard25get_pattern3_augment_specEiib` is not inlined anymore
but its body gets vectorized successfully. Before, the function was
inlined twice and vectorized just after inlining, currently it is not
required. The vector code looks pretty similar, just like as it was before.
Differential Revision: https://reviews.llvm.org/D111574
536 lines
23 KiB
LLVM
536 lines
23 KiB
LLVM
; NOTE: Assertions have been autogenerated by utils/update_test_checks.py
|
|
; RUN: opt < %s -slp-vectorizer -mtriple=x86_64-- -S | FileCheck %s --check-prefixes=CHECK,SSE
|
|
; RUN: opt < %s -slp-vectorizer -mtriple=x86_64-- -mattr=avx512vl -S | FileCheck %s --check-prefixes=CHECK,AVX
|
|
|
|
declare void @use1(i1)
|
|
|
|
define i1 @logical_and_icmp(<4 x i32> %x) {
|
|
; CHECK-LABEL: @logical_and_icmp(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp slt <4 x i32> [[X:%.*]], zeroinitializer
|
|
; CHECK-NEXT: [[TMP2:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP3:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP2]])
|
|
; CHECK-NEXT: ret i1 [[TMP3]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp slt i32 %x0, 0
|
|
%c1 = icmp slt i32 %x1, 0
|
|
%c2 = icmp slt i32 %x2, 0
|
|
%c3 = icmp slt i32 %x3, 0
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
ret i1 %s3
|
|
}
|
|
|
|
define i1 @logical_or_icmp(<4 x i32> %x, <4 x i32> %y) {
|
|
; CHECK-LABEL: @logical_or_icmp(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp slt <4 x i32> [[X:%.*]], [[Y:%.*]]
|
|
; CHECK-NEXT: [[TMP2:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP3:%.*]] = call i1 @llvm.vector.reduce.or.v4i1(<4 x i1> [[TMP2]])
|
|
; CHECK-NEXT: ret i1 [[TMP3]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%y0 = extractelement <4 x i32> %y, i32 0
|
|
%y1 = extractelement <4 x i32> %y, i32 1
|
|
%y2 = extractelement <4 x i32> %y, i32 2
|
|
%y3 = extractelement <4 x i32> %y, i32 3
|
|
%c0 = icmp slt i32 %x0, %y0
|
|
%c1 = icmp slt i32 %x1, %y1
|
|
%c2 = icmp slt i32 %x2, %y2
|
|
%c3 = icmp slt i32 %x3, %y3
|
|
%s1 = select i1 %c0, i1 true, i1 %c1
|
|
%s2 = select i1 %s1, i1 true, i1 %c2
|
|
%s3 = select i1 %s2, i1 true, i1 %c3
|
|
ret i1 %s3
|
|
}
|
|
|
|
define i1 @logical_and_fcmp(<4 x float> %x) {
|
|
; CHECK-LABEL: @logical_and_fcmp(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = fcmp olt <4 x float> [[X:%.*]], zeroinitializer
|
|
; CHECK-NEXT: [[TMP2:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP3:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP2]])
|
|
; CHECK-NEXT: ret i1 [[TMP3]]
|
|
;
|
|
%x0 = extractelement <4 x float> %x, i32 0
|
|
%x1 = extractelement <4 x float> %x, i32 1
|
|
%x2 = extractelement <4 x float> %x, i32 2
|
|
%x3 = extractelement <4 x float> %x, i32 3
|
|
%c0 = fcmp olt float %x0, 0.0
|
|
%c1 = fcmp olt float %x1, 0.0
|
|
%c2 = fcmp olt float %x2, 0.0
|
|
%c3 = fcmp olt float %x3, 0.0
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
ret i1 %s3
|
|
}
|
|
|
|
define i1 @logical_or_fcmp(<4 x float> %x) {
|
|
; CHECK-LABEL: @logical_or_fcmp(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = fcmp olt <4 x float> [[X:%.*]], zeroinitializer
|
|
; CHECK-NEXT: [[TMP2:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP3:%.*]] = call i1 @llvm.vector.reduce.or.v4i1(<4 x i1> [[TMP2]])
|
|
; CHECK-NEXT: ret i1 [[TMP3]]
|
|
;
|
|
%x0 = extractelement <4 x float> %x, i32 0
|
|
%x1 = extractelement <4 x float> %x, i32 1
|
|
%x2 = extractelement <4 x float> %x, i32 2
|
|
%x3 = extractelement <4 x float> %x, i32 3
|
|
%c0 = fcmp olt float %x0, 0.0
|
|
%c1 = fcmp olt float %x1, 0.0
|
|
%c2 = fcmp olt float %x2, 0.0
|
|
%c3 = fcmp olt float %x3, 0.0
|
|
%s1 = select i1 %c0, i1 true, i1 %c1
|
|
%s2 = select i1 %s1, i1 true, i1 %c2
|
|
%s3 = select i1 %s2, i1 true, i1 %c3
|
|
ret i1 %s3
|
|
}
|
|
|
|
define i1 @logical_and_icmp_diff_preds(<4 x i32> %x) {
|
|
; SSE-LABEL: @logical_and_icmp_diff_preds(
|
|
; SSE-NEXT: [[X0:%.*]] = extractelement <4 x i32> [[X:%.*]], i32 0
|
|
; SSE-NEXT: [[X1:%.*]] = extractelement <4 x i32> [[X]], i32 1
|
|
; SSE-NEXT: [[X2:%.*]] = extractelement <4 x i32> [[X]], i32 2
|
|
; SSE-NEXT: [[X3:%.*]] = extractelement <4 x i32> [[X]], i32 3
|
|
; SSE-NEXT: [[C0:%.*]] = icmp ult i32 [[X0]], 0
|
|
; SSE-NEXT: [[C2:%.*]] = icmp sgt i32 [[X2]], 0
|
|
; SSE-NEXT: [[TMP1:%.*]] = insertelement <2 x i32> poison, i32 [[X3]], i32 0
|
|
; SSE-NEXT: [[TMP2:%.*]] = insertelement <2 x i32> [[TMP1]], i32 [[X1]], i32 1
|
|
; SSE-NEXT: [[TMP3:%.*]] = icmp slt <2 x i32> [[TMP2]], zeroinitializer
|
|
; SSE-NEXT: [[TMP4:%.*]] = extractelement <2 x i1> [[TMP3]], i32 1
|
|
; SSE-NEXT: [[S1:%.*]] = select i1 [[C0]], i1 [[TMP4]], i1 false
|
|
; SSE-NEXT: [[S2:%.*]] = select i1 [[S1]], i1 [[C2]], i1 false
|
|
; SSE-NEXT: [[TMP5:%.*]] = extractelement <2 x i1> [[TMP3]], i32 0
|
|
; SSE-NEXT: [[S3:%.*]] = select i1 [[S2]], i1 [[TMP5]], i1 false
|
|
; SSE-NEXT: ret i1 [[S3]]
|
|
;
|
|
; AVX-LABEL: @logical_and_icmp_diff_preds(
|
|
; AVX-NEXT: [[X0:%.*]] = extractelement <4 x i32> [[X:%.*]], i32 0
|
|
; AVX-NEXT: [[X1:%.*]] = extractelement <4 x i32> [[X]], i32 1
|
|
; AVX-NEXT: [[X2:%.*]] = extractelement <4 x i32> [[X]], i32 2
|
|
; AVX-NEXT: [[X3:%.*]] = extractelement <4 x i32> [[X]], i32 3
|
|
; AVX-NEXT: [[C0:%.*]] = icmp ult i32 [[X0]], 0
|
|
; AVX-NEXT: [[C1:%.*]] = icmp slt i32 [[X1]], 0
|
|
; AVX-NEXT: [[C2:%.*]] = icmp sgt i32 [[X2]], 0
|
|
; AVX-NEXT: [[C3:%.*]] = icmp slt i32 [[X3]], 0
|
|
; AVX-NEXT: [[S1:%.*]] = select i1 [[C0]], i1 [[C1]], i1 false
|
|
; AVX-NEXT: [[S2:%.*]] = select i1 [[S1]], i1 [[C2]], i1 false
|
|
; AVX-NEXT: [[S3:%.*]] = select i1 [[S2]], i1 [[C3]], i1 false
|
|
; AVX-NEXT: ret i1 [[S3]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp ult i32 %x0, 0
|
|
%c1 = icmp slt i32 %x1, 0
|
|
%c2 = icmp sgt i32 %x2, 0
|
|
%c3 = icmp slt i32 %x3, 0
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
ret i1 %s3
|
|
}
|
|
|
|
define i1 @logical_and_icmp_diff_const(<4 x i32> %x) {
|
|
; CHECK-LABEL: @logical_and_icmp_diff_const(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp sgt <4 x i32> [[X:%.*]], <i32 0, i32 1, i32 2, i32 3>
|
|
; CHECK-NEXT: [[TMP2:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP3:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP2]])
|
|
; CHECK-NEXT: ret i1 [[TMP3]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp sgt i32 %x0, 0
|
|
%c1 = icmp sgt i32 %x1, 1
|
|
%c2 = icmp sgt i32 %x2, 2
|
|
%c3 = icmp sgt i32 %x3, 3
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
ret i1 %s3
|
|
}
|
|
|
|
define i1 @mixed_logical_icmp(<4 x i32> %x) {
|
|
; CHECK-LABEL: @mixed_logical_icmp(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp sgt <4 x i32> [[X:%.*]], zeroinitializer
|
|
; CHECK-NEXT: [[TMP2:%.*]] = extractelement <4 x i1> [[TMP1]], i32 0
|
|
; CHECK-NEXT: [[TMP3:%.*]] = extractelement <4 x i1> [[TMP1]], i32 1
|
|
; CHECK-NEXT: [[S1:%.*]] = select i1 [[TMP2]], i1 [[TMP3]], i1 false
|
|
; CHECK-NEXT: [[TMP4:%.*]] = extractelement <4 x i1> [[TMP1]], i32 2
|
|
; CHECK-NEXT: [[S2:%.*]] = select i1 [[S1]], i1 true, i1 [[TMP4]]
|
|
; CHECK-NEXT: [[TMP5:%.*]] = extractelement <4 x i1> [[TMP1]], i32 3
|
|
; CHECK-NEXT: [[S3:%.*]] = select i1 [[S2]], i1 [[TMP5]], i1 false
|
|
; CHECK-NEXT: ret i1 [[S3]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp sgt i32 %x0, 0
|
|
%c1 = icmp sgt i32 %x1, 0
|
|
%c2 = icmp sgt i32 %x2, 0
|
|
%c3 = icmp sgt i32 %x3, 0
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 true, i1 %c2
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
ret i1 %s3
|
|
}
|
|
|
|
define i1 @logical_and_icmp_subvec(<4 x i32> %x) {
|
|
; SSE-LABEL: @logical_and_icmp_subvec(
|
|
; SSE-NEXT: [[X0:%.*]] = extractelement <4 x i32> [[X:%.*]], i32 0
|
|
; SSE-NEXT: [[X1:%.*]] = extractelement <4 x i32> [[X]], i32 1
|
|
; SSE-NEXT: [[X2:%.*]] = extractelement <4 x i32> [[X]], i32 2
|
|
; SSE-NEXT: [[TMP1:%.*]] = insertelement <2 x i32> poison, i32 [[X1]], i32 0
|
|
; SSE-NEXT: [[TMP2:%.*]] = insertelement <2 x i32> [[TMP1]], i32 [[X0]], i32 1
|
|
; SSE-NEXT: [[TMP3:%.*]] = icmp slt <2 x i32> [[TMP2]], zeroinitializer
|
|
; SSE-NEXT: [[C2:%.*]] = icmp slt i32 [[X2]], 0
|
|
; SSE-NEXT: [[TMP4:%.*]] = extractelement <2 x i1> [[TMP3]], i32 0
|
|
; SSE-NEXT: [[TMP5:%.*]] = extractelement <2 x i1> [[TMP3]], i32 1
|
|
; SSE-NEXT: [[S1:%.*]] = select i1 [[TMP5]], i1 [[TMP4]], i1 false
|
|
; SSE-NEXT: [[S2:%.*]] = select i1 [[S1]], i1 [[C2]], i1 false
|
|
; SSE-NEXT: ret i1 [[S2]]
|
|
;
|
|
; AVX-LABEL: @logical_and_icmp_subvec(
|
|
; AVX-NEXT: [[X0:%.*]] = extractelement <4 x i32> [[X:%.*]], i32 0
|
|
; AVX-NEXT: [[X1:%.*]] = extractelement <4 x i32> [[X]], i32 1
|
|
; AVX-NEXT: [[X2:%.*]] = extractelement <4 x i32> [[X]], i32 2
|
|
; AVX-NEXT: [[C0:%.*]] = icmp slt i32 [[X0]], 0
|
|
; AVX-NEXT: [[C1:%.*]] = icmp slt i32 [[X1]], 0
|
|
; AVX-NEXT: [[C2:%.*]] = icmp slt i32 [[X2]], 0
|
|
; AVX-NEXT: [[S1:%.*]] = select i1 [[C0]], i1 [[C1]], i1 false
|
|
; AVX-NEXT: [[S2:%.*]] = select i1 [[S1]], i1 [[C2]], i1 false
|
|
; AVX-NEXT: ret i1 [[S2]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%c0 = icmp slt i32 %x0, 0
|
|
%c1 = icmp slt i32 %x1, 0
|
|
%c2 = icmp slt i32 %x2, 0
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
ret i1 %s2
|
|
}
|
|
|
|
; TODO: This is better than all-scalar and still safe,
|
|
; but we want this to be 2 reductions with glue
|
|
; logic...or a wide reduction?
|
|
|
|
define i1 @logical_and_icmp_clamp(<4 x i32> %x) {
|
|
; CHECK-LABEL: @logical_and_icmp_clamp(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp slt <4 x i32> [[X:%.*]], <i32 42, i32 42, i32 42, i32 42>
|
|
; CHECK-NEXT: [[TMP2:%.*]] = icmp sgt <4 x i32> [[X]], <i32 17, i32 17, i32 17, i32 17>
|
|
; CHECK-NEXT: [[TMP3:%.*]] = freeze <4 x i1> [[TMP2]]
|
|
; CHECK-NEXT: [[TMP4:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP3]])
|
|
; CHECK-NEXT: [[TMP5:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP6:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP5]])
|
|
; CHECK-NEXT: [[OP_RDX:%.*]] = select i1 [[TMP4]], i1 [[TMP6]], i1 false
|
|
; CHECK-NEXT: ret i1 [[OP_RDX]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp slt i32 %x0, 42
|
|
%c1 = icmp slt i32 %x1, 42
|
|
%c2 = icmp slt i32 %x2, 42
|
|
%c3 = icmp slt i32 %x3, 42
|
|
%d0 = icmp sgt i32 %x0, 17
|
|
%d1 = icmp sgt i32 %x1, 17
|
|
%d2 = icmp sgt i32 %x2, 17
|
|
%d3 = icmp sgt i32 %x3, 17
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
%s4 = select i1 %s3, i1 %d0, i1 false
|
|
%s5 = select i1 %s4, i1 %d1, i1 false
|
|
%s6 = select i1 %s5, i1 %d2, i1 false
|
|
%s7 = select i1 %s6, i1 %d3, i1 false
|
|
ret i1 %s7
|
|
}
|
|
|
|
define i1 @logical_and_icmp_clamp_extra_use_cmp(<4 x i32> %x) {
|
|
; CHECK-LABEL: @logical_and_icmp_clamp_extra_use_cmp(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp slt <4 x i32> [[X:%.*]], <i32 42, i32 42, i32 42, i32 42>
|
|
; CHECK-NEXT: [[TMP2:%.*]] = extractelement <4 x i1> [[TMP1]], i32 2
|
|
; CHECK-NEXT: call void @use1(i1 [[TMP2]])
|
|
; CHECK-NEXT: [[TMP3:%.*]] = icmp sgt <4 x i32> [[X]], <i32 17, i32 17, i32 17, i32 17>
|
|
; CHECK-NEXT: [[TMP4:%.*]] = freeze <4 x i1> [[TMP3]]
|
|
; CHECK-NEXT: [[TMP5:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP4]])
|
|
; CHECK-NEXT: [[TMP6:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP7:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP6]])
|
|
; CHECK-NEXT: [[OP_RDX:%.*]] = select i1 [[TMP5]], i1 [[TMP7]], i1 false
|
|
; CHECK-NEXT: ret i1 [[OP_RDX]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp slt i32 %x0, 42
|
|
%c1 = icmp slt i32 %x1, 42
|
|
%c2 = icmp slt i32 %x2, 42
|
|
call void @use1(i1 %c2)
|
|
%c3 = icmp slt i32 %x3, 42
|
|
%d0 = icmp sgt i32 %x0, 17
|
|
%d1 = icmp sgt i32 %x1, 17
|
|
%d2 = icmp sgt i32 %x2, 17
|
|
%d3 = icmp sgt i32 %x3, 17
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
%s4 = select i1 %s3, i1 %d0, i1 false
|
|
%s5 = select i1 %s4, i1 %d1, i1 false
|
|
%s6 = select i1 %s5, i1 %d2, i1 false
|
|
%s7 = select i1 %s6, i1 %d3, i1 false
|
|
ret i1 %s7
|
|
}
|
|
|
|
define i1 @logical_and_icmp_clamp_extra_use_select(<4 x i32> %x) {
|
|
; CHECK-LABEL: @logical_and_icmp_clamp_extra_use_select(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp slt <4 x i32> [[X:%.*]], <i32 42, i32 42, i32 42, i32 42>
|
|
; CHECK-NEXT: [[TMP2:%.*]] = icmp sgt <4 x i32> [[X]], <i32 17, i32 17, i32 17, i32 17>
|
|
; CHECK-NEXT: [[TMP3:%.*]] = extractelement <4 x i1> [[TMP1]], i32 0
|
|
; CHECK-NEXT: [[TMP4:%.*]] = extractelement <4 x i1> [[TMP1]], i32 1
|
|
; CHECK-NEXT: [[S1:%.*]] = select i1 [[TMP3]], i1 [[TMP4]], i1 false
|
|
; CHECK-NEXT: [[TMP5:%.*]] = extractelement <4 x i1> [[TMP1]], i32 2
|
|
; CHECK-NEXT: [[S2:%.*]] = select i1 [[S1]], i1 [[TMP5]], i1 false
|
|
; CHECK-NEXT: call void @use1(i1 [[S2]])
|
|
; CHECK-NEXT: [[TMP6:%.*]] = freeze <4 x i1> [[TMP2]]
|
|
; CHECK-NEXT: [[TMP7:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP6]])
|
|
; CHECK-NEXT: [[TMP8:%.*]] = extractelement <4 x i1> [[TMP1]], i32 3
|
|
; CHECK-NEXT: [[OP_RDX:%.*]] = select i1 [[TMP8]], i1 [[S2]], i1 false
|
|
; CHECK-NEXT: [[OP_RDX1:%.*]] = select i1 [[TMP7]], i1 [[OP_RDX]], i1 false
|
|
; CHECK-NEXT: ret i1 [[OP_RDX1]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp slt i32 %x0, 42
|
|
%c1 = icmp slt i32 %x1, 42
|
|
%c2 = icmp slt i32 %x2, 42
|
|
%c3 = icmp slt i32 %x3, 42
|
|
%d0 = icmp sgt i32 %x0, 17
|
|
%d1 = icmp sgt i32 %x1, 17
|
|
%d2 = icmp sgt i32 %x2, 17
|
|
%d3 = icmp sgt i32 %x3, 17
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
call void @use1(i1 %s2)
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
%s4 = select i1 %s3, i1 %d0, i1 false
|
|
%s5 = select i1 %s4, i1 %d1, i1 false
|
|
%s6 = select i1 %s5, i1 %d2, i1 false
|
|
%s7 = select i1 %s6, i1 %d3, i1 false
|
|
ret i1 %s7
|
|
}
|
|
|
|
define i1 @logical_and_icmp_clamp_v8i32(<8 x i32> %x, <8 x i32> %y) {
|
|
; CHECK-LABEL: @logical_and_icmp_clamp_v8i32(
|
|
; CHECK-NEXT: [[X0:%.*]] = extractelement <8 x i32> [[X:%.*]], i32 0
|
|
; CHECK-NEXT: [[X1:%.*]] = extractelement <8 x i32> [[X]], i32 1
|
|
; CHECK-NEXT: [[X2:%.*]] = extractelement <8 x i32> [[X]], i32 2
|
|
; CHECK-NEXT: [[X3:%.*]] = extractelement <8 x i32> [[X]], i32 3
|
|
; CHECK-NEXT: [[Y0:%.*]] = extractelement <8 x i32> [[Y:%.*]], i32 0
|
|
; CHECK-NEXT: [[Y1:%.*]] = extractelement <8 x i32> [[Y]], i32 1
|
|
; CHECK-NEXT: [[Y2:%.*]] = extractelement <8 x i32> [[Y]], i32 2
|
|
; CHECK-NEXT: [[Y3:%.*]] = extractelement <8 x i32> [[Y]], i32 3
|
|
; CHECK-NEXT: [[TMP1:%.*]] = insertelement <8 x i32> poison, i32 [[X1]], i32 0
|
|
; CHECK-NEXT: [[TMP2:%.*]] = insertelement <8 x i32> [[TMP1]], i32 [[X0]], i32 1
|
|
; CHECK-NEXT: [[TMP3:%.*]] = insertelement <8 x i32> [[TMP2]], i32 [[X2]], i32 2
|
|
; CHECK-NEXT: [[TMP4:%.*]] = insertelement <8 x i32> [[TMP3]], i32 [[X3]], i32 3
|
|
; CHECK-NEXT: [[SHUFFLE:%.*]] = shufflevector <8 x i32> [[TMP4]], <8 x i32> poison, <8 x i32> <i32 0, i32 1, i32 2, i32 3, i32 1, i32 0, i32 2, i32 3>
|
|
; CHECK-NEXT: [[TMP5:%.*]] = insertelement <8 x i32> <i32 42, i32 42, i32 42, i32 42, i32 poison, i32 poison, i32 poison, i32 poison>, i32 [[Y0]], i32 4
|
|
; CHECK-NEXT: [[TMP6:%.*]] = insertelement <8 x i32> [[TMP5]], i32 [[Y1]], i32 5
|
|
; CHECK-NEXT: [[TMP7:%.*]] = insertelement <8 x i32> [[TMP6]], i32 [[Y2]], i32 6
|
|
; CHECK-NEXT: [[TMP8:%.*]] = insertelement <8 x i32> [[TMP7]], i32 [[Y3]], i32 7
|
|
; CHECK-NEXT: [[TMP9:%.*]] = icmp slt <8 x i32> [[SHUFFLE]], [[TMP8]]
|
|
; CHECK-NEXT: [[TMP10:%.*]] = freeze <8 x i1> [[TMP9]]
|
|
; CHECK-NEXT: [[TMP11:%.*]] = call i1 @llvm.vector.reduce.and.v8i1(<8 x i1> [[TMP10]])
|
|
; CHECK-NEXT: ret i1 [[TMP11]]
|
|
;
|
|
%x0 = extractelement <8 x i32> %x, i32 0
|
|
%x1 = extractelement <8 x i32> %x, i32 1
|
|
%x2 = extractelement <8 x i32> %x, i32 2
|
|
%x3 = extractelement <8 x i32> %x, i32 3
|
|
%y0 = extractelement <8 x i32> %y, i32 0
|
|
%y1 = extractelement <8 x i32> %y, i32 1
|
|
%y2 = extractelement <8 x i32> %y, i32 2
|
|
%y3 = extractelement <8 x i32> %y, i32 3
|
|
%c0 = icmp slt i32 %x0, 42
|
|
%c1 = icmp slt i32 %x1, 42
|
|
%c2 = icmp slt i32 %x2, 42
|
|
%c3 = icmp slt i32 %x3, 42
|
|
%d0 = icmp slt i32 %x0, %y0
|
|
%d1 = icmp slt i32 %x1, %y1
|
|
%d2 = icmp slt i32 %x2, %y2
|
|
%d3 = icmp slt i32 %x3, %y3
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
%s4 = select i1 %s3, i1 %d0, i1 false
|
|
%s5 = select i1 %s4, i1 %d1, i1 false
|
|
%s6 = select i1 %s5, i1 %d2, i1 false
|
|
%s7 = select i1 %s6, i1 %d3, i1 false
|
|
ret i1 %s7
|
|
}
|
|
|
|
define i1 @logical_and_icmp_clamp_partial(<4 x i32> %x) {
|
|
; SSE-LABEL: @logical_and_icmp_clamp_partial(
|
|
; SSE-NEXT: [[TMP1:%.*]] = extractelement <4 x i32> [[X:%.*]], i32 2
|
|
; SSE-NEXT: [[TMP2:%.*]] = extractelement <4 x i32> [[X]], i32 1
|
|
; SSE-NEXT: [[TMP3:%.*]] = extractelement <4 x i32> [[X]], i32 0
|
|
; SSE-NEXT: [[TMP4:%.*]] = insertelement <2 x i32> poison, i32 [[TMP2]], i32 0
|
|
; SSE-NEXT: [[TMP5:%.*]] = insertelement <2 x i32> [[TMP4]], i32 [[TMP3]], i32 1
|
|
; SSE-NEXT: [[TMP6:%.*]] = icmp slt <2 x i32> [[TMP5]], <i32 42, i32 42>
|
|
; SSE-NEXT: [[C2:%.*]] = icmp slt i32 [[TMP1]], 42
|
|
; SSE-NEXT: [[TMP7:%.*]] = icmp sgt <4 x i32> [[X]], <i32 17, i32 17, i32 17, i32 17>
|
|
; SSE-NEXT: [[TMP8:%.*]] = freeze <4 x i1> [[TMP7]]
|
|
; SSE-NEXT: [[TMP9:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP8]])
|
|
; SSE-NEXT: [[TMP10:%.*]] = extractelement <2 x i1> [[TMP6]], i32 0
|
|
; SSE-NEXT: [[TMP11:%.*]] = extractelement <2 x i1> [[TMP6]], i32 1
|
|
; SSE-NEXT: [[OP_RDX:%.*]] = select i1 [[TMP10]], i1 [[TMP11]], i1 false
|
|
; SSE-NEXT: [[OP_RDX1:%.*]] = select i1 [[OP_RDX]], i1 [[C2]], i1 false
|
|
; SSE-NEXT: [[OP_RDX2:%.*]] = select i1 [[TMP9]], i1 [[OP_RDX1]], i1 false
|
|
; SSE-NEXT: ret i1 [[OP_RDX2]]
|
|
;
|
|
; AVX-LABEL: @logical_and_icmp_clamp_partial(
|
|
; AVX-NEXT: [[TMP1:%.*]] = extractelement <4 x i32> [[X:%.*]], i32 2
|
|
; AVX-NEXT: [[TMP2:%.*]] = extractelement <4 x i32> [[X]], i32 1
|
|
; AVX-NEXT: [[TMP3:%.*]] = extractelement <4 x i32> [[X]], i32 0
|
|
; AVX-NEXT: [[C0:%.*]] = icmp slt i32 [[TMP3]], 42
|
|
; AVX-NEXT: [[C1:%.*]] = icmp slt i32 [[TMP2]], 42
|
|
; AVX-NEXT: [[C2:%.*]] = icmp slt i32 [[TMP1]], 42
|
|
; AVX-NEXT: [[TMP4:%.*]] = icmp sgt <4 x i32> [[X]], <i32 17, i32 17, i32 17, i32 17>
|
|
; AVX-NEXT: [[TMP5:%.*]] = freeze <4 x i1> [[TMP4]]
|
|
; AVX-NEXT: [[TMP6:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP5]])
|
|
; AVX-NEXT: [[OP_RDX:%.*]] = select i1 [[C1]], i1 [[C0]], i1 false
|
|
; AVX-NEXT: [[OP_RDX1:%.*]] = select i1 [[OP_RDX]], i1 [[C2]], i1 false
|
|
; AVX-NEXT: [[OP_RDX2:%.*]] = select i1 [[TMP6]], i1 [[OP_RDX1]], i1 false
|
|
; AVX-NEXT: ret i1 [[OP_RDX2]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp slt i32 %x0, 42
|
|
%c1 = icmp slt i32 %x1, 42
|
|
%c2 = icmp slt i32 %x2, 42
|
|
; remove an element from the previous test
|
|
%d0 = icmp sgt i32 %x0, 17
|
|
%d1 = icmp sgt i32 %x1, 17
|
|
%d2 = icmp sgt i32 %x2, 17
|
|
%d3 = icmp sgt i32 %x3, 17
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
; remove an element from the previous test
|
|
%s4 = select i1 %s2, i1 %d0, i1 false
|
|
%s5 = select i1 %s4, i1 %d1, i1 false
|
|
%s6 = select i1 %s5, i1 %d2, i1 false
|
|
%s7 = select i1 %s6, i1 %d3, i1 false
|
|
ret i1 %s7
|
|
}
|
|
|
|
define i1 @logical_and_icmp_clamp_pred_diff(<4 x i32> %x) {
|
|
; CHECK-LABEL: @logical_and_icmp_clamp_pred_diff(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp slt <4 x i32> [[X:%.*]], <i32 42, i32 42, i32 42, i32 42>
|
|
; CHECK-NEXT: [[TMP2:%.*]] = icmp ult <4 x i32> [[X]], <i32 42, i32 42, i32 42, i32 42>
|
|
; CHECK-NEXT: [[TMP3:%.*]] = shufflevector <4 x i1> [[TMP1]], <4 x i1> [[TMP2]], <4 x i32> <i32 0, i32 1, i32 2, i32 7>
|
|
; CHECK-NEXT: [[TMP4:%.*]] = icmp sgt <4 x i32> [[X]], <i32 17, i32 17, i32 17, i32 17>
|
|
; CHECK-NEXT: [[TMP5:%.*]] = freeze <4 x i1> [[TMP4]]
|
|
; CHECK-NEXT: [[TMP6:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP5]])
|
|
; CHECK-NEXT: [[TMP7:%.*]] = freeze <4 x i1> [[TMP3]]
|
|
; CHECK-NEXT: [[TMP8:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP7]])
|
|
; CHECK-NEXT: [[OP_RDX:%.*]] = select i1 [[TMP6]], i1 [[TMP8]], i1 false
|
|
; CHECK-NEXT: ret i1 [[OP_RDX]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%c0 = icmp slt i32 %x0, 42
|
|
%c1 = icmp slt i32 %x1, 42
|
|
%c2 = icmp slt i32 %x2, 42
|
|
%c3 = icmp ult i32 %x3, 42 ; predicate changed
|
|
%d0 = icmp sgt i32 %x0, 17
|
|
%d1 = icmp sgt i32 %x1, 17
|
|
%d2 = icmp sgt i32 %x2, 17
|
|
%d3 = icmp sgt i32 %x3, 17
|
|
%s1 = select i1 %c0, i1 %c1, i1 false
|
|
%s2 = select i1 %s1, i1 %c2, i1 false
|
|
%s3 = select i1 %s2, i1 %c3, i1 false
|
|
%s4 = select i1 %s3, i1 %d0, i1 false
|
|
%s5 = select i1 %s4, i1 %d1, i1 false
|
|
%s6 = select i1 %s5, i1 %d2, i1 false
|
|
%s7 = select i1 %s6, i1 %d3, i1 false
|
|
ret i1 %s7
|
|
}
|
|
|
|
define i1 @logical_and_icmp_extra_op(<4 x i32> %x, <4 x i32> %y, i1 %c) {
|
|
; CHECK-LABEL: @logical_and_icmp_extra_op(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp slt <4 x i32> [[X:%.*]], [[Y:%.*]]
|
|
; CHECK-NEXT: [[S3:%.*]] = select i1 [[C:%.*]], i1 [[C]], i1 false
|
|
; CHECK-NEXT: [[TMP2:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP3:%.*]] = call i1 @llvm.vector.reduce.and.v4i1(<4 x i1> [[TMP2]])
|
|
; CHECK-NEXT: [[OP_RDX:%.*]] = select i1 [[TMP3]], i1 [[S3]], i1 false
|
|
; CHECK-NEXT: ret i1 [[OP_RDX]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%y0 = extractelement <4 x i32> %y, i32 0
|
|
%y1 = extractelement <4 x i32> %y, i32 1
|
|
%y2 = extractelement <4 x i32> %y, i32 2
|
|
%y3 = extractelement <4 x i32> %y, i32 3
|
|
%d0 = icmp slt i32 %x0, %y0
|
|
%d1 = icmp slt i32 %x1, %y1
|
|
%d2 = icmp slt i32 %x2, %y2
|
|
%d3 = icmp slt i32 %x3, %y3
|
|
%s3 = select i1 %c, i1 %c, i1 false
|
|
%s4 = select i1 %s3, i1 %d0, i1 false
|
|
%s5 = select i1 %s4, i1 %d1, i1 false
|
|
%s6 = select i1 %s5, i1 %d2, i1 false
|
|
%s7 = select i1 %s6, i1 %d3, i1 false
|
|
ret i1 %s7
|
|
}
|
|
|
|
define i1 @logical_or_icmp_extra_op(<4 x i32> %x, <4 x i32> %y, i1 %c) {
|
|
; CHECK-LABEL: @logical_or_icmp_extra_op(
|
|
; CHECK-NEXT: [[TMP1:%.*]] = icmp slt <4 x i32> [[X:%.*]], [[Y:%.*]]
|
|
; CHECK-NEXT: [[S3:%.*]] = select i1 [[C:%.*]], i1 true, i1 [[C]]
|
|
; CHECK-NEXT: [[TMP2:%.*]] = freeze <4 x i1> [[TMP1]]
|
|
; CHECK-NEXT: [[TMP3:%.*]] = call i1 @llvm.vector.reduce.or.v4i1(<4 x i1> [[TMP2]])
|
|
; CHECK-NEXT: [[OP_RDX:%.*]] = select i1 [[TMP3]], i1 true, i1 [[S3]]
|
|
; CHECK-NEXT: ret i1 [[OP_RDX]]
|
|
;
|
|
%x0 = extractelement <4 x i32> %x, i32 0
|
|
%x1 = extractelement <4 x i32> %x, i32 1
|
|
%x2 = extractelement <4 x i32> %x, i32 2
|
|
%x3 = extractelement <4 x i32> %x, i32 3
|
|
%y0 = extractelement <4 x i32> %y, i32 0
|
|
%y1 = extractelement <4 x i32> %y, i32 1
|
|
%y2 = extractelement <4 x i32> %y, i32 2
|
|
%y3 = extractelement <4 x i32> %y, i32 3
|
|
%d0 = icmp slt i32 %x0, %y0
|
|
%d1 = icmp slt i32 %x1, %y1
|
|
%d2 = icmp slt i32 %x2, %y2
|
|
%d3 = icmp slt i32 %x3, %y3
|
|
%s3 = select i1 %c, i1 true, i1 %c
|
|
%s4 = select i1 %s3, i1 true, i1 %d0
|
|
%s5 = select i1 %s4, i1 true, i1 %d1
|
|
%s6 = select i1 %s5, i1 true, i1 %d2
|
|
%s7 = select i1 %s6, i1 true, i1 %d3
|
|
ret i1 %s7
|
|
}
|