test/CodeGenCUDA/fp-contract.cu

*67e74705SXin Li// REQUIRES: x86-registered-target
*67e74705SXin Li// REQUIRES: nvptx-registered-target
*67e74705SXin Li
*67e74705SXin Li// By default we should fuse multiply/add into fma instruction.
*67e74705SXin Li// RUN: %clang_cc1 -fcuda-is-device -triple nvptx-nvidia-cuda -S \
*67e74705SXin Li// RUN:   -disable-llvm-passes -o - %s | FileCheck -check-prefix ENABLED %s
*67e74705SXin Li
*67e74705SXin Li// Explicit -ffp-contract=fast
*67e74705SXin Li// RUN: %clang_cc1 -fcuda-is-device -triple nvptx-nvidia-cuda -S \
*67e74705SXin Li// RUN:   -ffp-contract=fast -disable-llvm-passes -o - %s \
*67e74705SXin Li// RUN:   | FileCheck -check-prefix ENABLED %s
*67e74705SXin Li
*67e74705SXin Li// Explicit -ffp-contract=on -- fusing by front-end (disabled).
*67e74705SXin Li// RUN: %clang_cc1 -fcuda-is-device -triple nvptx-nvidia-cuda -S \
*67e74705SXin Li// RUN:   -ffp-contract=on -disable-llvm-passes -o - %s \
*67e74705SXin Li// RUN:   | FileCheck -check-prefix DISABLED %s
*67e74705SXin Li
*67e74705SXin Li// Explicit -ffp-contract=off should disable instruction fusing.
*67e74705SXin Li// RUN: %clang_cc1 -fcuda-is-device -triple nvptx-nvidia-cuda -S \
*67e74705SXin Li// RUN:   -ffp-contract=off -disable-llvm-passes -o - %s \
*67e74705SXin Li// RUN:   | FileCheck -check-prefix DISABLED %s
*67e74705SXin Li
*67e74705SXin Li
*67e74705SXin Li#include "Inputs/cuda.h"
*67e74705SXin Li
*67e74705SXin Li__host__ __device__ float func(float a, float b, float c) { return a + b * c; }
*67e74705SXin Li// ENABLED:       fma.rn.f32
*67e74705SXin Li// ENABLED-NEXT:  st.param.f32
*67e74705SXin Li
*67e74705SXin Li// DISABLED:      mul.rn.f32
*67e74705SXin Li// DISABLED-NEXT: add.rn.f32
*67e74705SXin Li// DISABLED-NEXT: st.param.f32