Refine the quantization instance library

dc7b6568 · rocking · c0be8480 · dc7b6568 · dc7b6568 · dc7b6568
Commit dc7b6568 authored Mar 09, 2023 by rocking
6 changed files
--- a/library/src/tensor_operation_instance/gpu/quantization/CMakeLists.txt
+++ b/library/src/tensor_operation_instance/gpu/quantization/CMakeLists.txt
 add_instance_library(device_quantization_instance
-    conv2d_fwd/device_conv2d_xdl_bias_perchannel_quantization_int8_instance.cpp
-    conv2d_fwd/device_conv2d_xdl_bias_perlayer_quantization_int8_instance.cpp
-    conv2d_fwd/device_conv2d_xdl_perchannel_quantization_int8_instance.cpp
-    conv2d_fwd/device_conv2d_xdl_perlayer_quantization_int8_instance.cpp
+    conv2d_fwd/device_conv2d_bias_perchannel_quantization_int8_instance.cpp
+    conv2d_fwd/device_conv2d_bias_perlayer_quantization_int8_instance.cpp
+    conv2d_fwd/device_conv2d_perchannel_quantization_int8_instance.cpp
+    conv2d_fwd/device_conv2d_perlayer_quantization_int8_instance.cpp
 )
--- a/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_bias_perchannel_quantization_int8_instance.cpp
+++ b/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_bias_perchannel_quantization_int8_instance.cpp
 // SPDX-License-Identifier: MIT
 // Copyright (c) 2018-2022, Advanced Micro Devices, Inc. All rights reserved.

-#include "device_conv2d_xdl_int8_instance.hpp"
+#include "device_conv2d_int8_instance.hpp"

 namespace ck {
 namespace tensor_operation {
@@ -22,20 +22,23 @@ void add_device_conv2d_bias_perchannel_quantization_int8_instances(
                                                              Add_Mul2_Clamp>>>& instances)
 {
    add_device_operation_instances(instances,
-                                   device_conv2d_int8_32Ds_instances<GK_GK_Tuple,
-                                                                     I32_F32_Tuple,
-                                                                     Add_Mul2_Clamp,
-                                                                     ConvFwdDefault>{});
+                                   device_grouped_conv2d_xdl_int8_instances<GK_GK_Tuple,
+                                                                            I32_F32_Tuple,
+                                                                            Add_Mul2_Clamp,
+                                                                            ConvFwdDefault,
+                                                                            8>{});
    add_device_operation_instances(instances,
-                                   device_conv2d_int8_32Ds_instances<GK_GK_Tuple,
-                                                                     I32_F32_Tuple,
-                                                                     Add_Mul2_Clamp,
-                                                                     ConvFwd1x1P0>{});
+                                   device_grouped_conv2d_xdl_int8_instances<GK_GK_Tuple,
+                                                                            I32_F32_Tuple,
+                                                                            Add_Mul2_Clamp,
+                                                                            ConvFwd1x1P0,
+                                                                            8>{});
    add_device_operation_instances(instances,
-                                   device_conv2d_int8_32Ds_instances<GK_GK_Tuple,
-                                                                     I32_F32_Tuple,
-                                                                     Add_Mul2_Clamp,
-                                                                     ConvFwd1x1S1P0>{});
+                                   device_grouped_conv2d_xdl_int8_instances<GK_GK_Tuple,
+                                                                            I32_F32_Tuple,
+                                                                            Add_Mul2_Clamp,
+                                                                            ConvFwd1x1S1P0,
+                                                                            8>{});
 }

 void add_device_conv2d_bias_relu_perchannel_quantization_int8_instances(
@@ -53,20 +56,23 @@ void add_device_conv2d_bias_relu_perchannel_quantization_int8_instances(
                                                              Add_Relu_Mul2_Clamp>>>& instances)
 {
    add_device_operation_instances(instances,
-                                   device_conv2d_int8_32Ds_instances<GK_GK_Tuple,
-                                                                     I32_F32_Tuple,
-                                                                     Add_Relu_Mul2_Clamp,
-                                                                     ConvFwdDefault>{});
+                                   device_grouped_conv2d_xdl_int8_instances<GK_GK_Tuple,
+                                                                            I32_F32_Tuple,
+                                                                            Add_Relu_Mul2_Clamp,
+                                                                            ConvFwdDefault,
+                                                                            8>{});
    add_device_operation_instances(instances,
-                                   device_conv2d_int8_32Ds_instances<GK_GK_Tuple,
-                                                                     I32_F32_Tuple,
-                                                                     Add_Relu_Mul2_Clamp,
-                                                                     ConvFwd1x1P0>{});
+                                   device_grouped_conv2d_xdl_int8_instances<GK_GK_Tuple,
+                                                                            I32_F32_Tuple,
+                                                                            Add_Relu_Mul2_Clamp,
+                                                                            ConvFwd1x1P0,
+                                                                            8>{});
    add_device_operation_instances(instances,
-                                   device_conv2d_int8_32Ds_instances<GK_GK_Tuple,
-                                                                     I32_F32_Tuple,
-                                                                     Add_Relu_Mul2_Clamp,
-                                                                     ConvFwd1x1S1P0>{});
+                                   device_grouped_conv2d_xdl_int8_instances<GK_GK_Tuple,
+                                                                            I32_F32_Tuple,
+                                                                            Add_Relu_Mul2_Clamp,
+                                                                            ConvFwd1x1S1P0,
+                                                                            8>{});
 }
 } // namespace instance
 } // namespace device

--- a/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_bias_perlayer_quantization_int8_instance.cpp
+++ b/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_bias_perlayer_quantization_int8_instance.cpp
 // SPDX-License-Identifier: MIT
 // Copyright (c) 2018-2022, Advanced Micro Devices, Inc. All rights reserved.

-#include "device_conv2d_xdl_int8_instance.hpp"
+#include "device_conv2d_int8_instance.hpp"

 namespace ck {
 namespace tensor_operation {
@@ -21,15 +21,24 @@ void add_device_conv2d_bias_perlayer_quantization_int8_instances(
                                                              PassThrough,
                                                              Add_Mul_Clamp>>>& instances)
 {
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, I32_Tuple, Add_Mul_Clamp, ConvFwdDefault>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, I32_Tuple, Add_Mul_Clamp, ConvFwd1x1P0>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, I32_Tuple, Add_Mul_Clamp, ConvFwd1x1S1P0>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            I32_Tuple,
+                                                                            Add_Mul_Clamp,
+                                                                            ConvFwdDefault,
+                                                                            8>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            I32_Tuple,
+                                                                            Add_Mul_Clamp,
+                                                                            ConvFwd1x1P0,
+                                                                            8>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            I32_Tuple,
+                                                                            Add_Mul_Clamp,
+                                                                            ConvFwd1x1S1P0,
+                                                                            8>{});
 }

 void add_device_conv2d_bias_relu_perlayer_quantization_int8_instances(
@@ -47,20 +56,25 @@ void add_device_conv2d_bias_relu_perlayer_quantization_int8_instances(
                                                              Add_Relu_Mul_Clamp>>>& instances)
 {
    add_device_operation_instances(instances,
-                                   device_conv2d_int8_32Ds_instances<GK_Tuple,
-                                                                     I32_Tuple,
-                                                                     Add_Relu_Mul_Clamp,
-                                                                     ConvFwdDefault>{});
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            I32_Tuple,
+                                                                            Add_Relu_Mul_Clamp,
+                                                                            ConvFwdDefault,
+                                                                            8>{});

-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, I32_Tuple, Add_Relu_Mul_Clamp, ConvFwd1x1P0>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            I32_Tuple,
+                                                                            Add_Relu_Mul_Clamp,
+                                                                            ConvFwd1x1P0,
+                                                                            8>{});

    add_device_operation_instances(instances,
-                                   device_conv2d_int8_32Ds_instances<GK_Tuple,
-                                                                     I32_Tuple,
-                                                                     Add_Relu_Mul_Clamp,
-                                                                     ConvFwd1x1S1P0>{});
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            I32_Tuple,
+                                                                            Add_Relu_Mul_Clamp,
+                                                                            ConvFwd1x1S1P0,
+                                                                            8>{});
 }
 } // namespace instance
 } // namespace device

--- a/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_int8_instance.hpp
+++ b/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_int8_instance.hpp
--- a/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_perchannel_quantization_int8_instance.cpp
+++ b/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_perchannel_quantization_int8_instance.cpp
 // SPDX-License-Identifier: MIT
 // Copyright (c) 2018-2022, Advanced Micro Devices, Inc. All rights reserved.

-#include "device_conv2d_xdl_int8_instance.hpp"
+#include "device_conv2d_int8_instance.hpp"

 namespace ck {
 namespace tensor_operation {
@@ -21,15 +21,24 @@ void add_device_conv2d_perchannel_quantization_int8_instances(
                                                              PassThrough,
                                                              Mul2_Clamp>>>& instances)
 {
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, F32_Tuple, Mul2_Clamp, ConvFwdDefault>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, F32_Tuple, Mul2_Clamp, ConvFwd1x1P0>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, F32_Tuple, Mul2_Clamp, ConvFwd1x1S1P0>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            F32_Tuple,
+                                                                            Mul2_Clamp,
+                                                                            ConvFwdDefault,
+                                                                            8>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            F32_Tuple,
+                                                                            Mul2_Clamp,
+                                                                            ConvFwd1x1P0,
+                                                                            8>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            F32_Tuple,
+                                                                            Mul2_Clamp,
+                                                                            ConvFwd1x1S1P0,
+                                                                            8>{});
 }

 void add_device_conv2d_relu_perchannel_quantization_int8_instances(
@@ -46,15 +55,24 @@ void add_device_conv2d_relu_perchannel_quantization_int8_instances(
                                                              PassThrough,
                                                              Relu_Mul2_Clamp>>>& instances)
 {
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, F32_Tuple, Relu_Mul2_Clamp, ConvFwdDefault>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, F32_Tuple, Relu_Mul2_Clamp, ConvFwd1x1P0>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_32Ds_instances<GK_Tuple, F32_Tuple, Relu_Mul2_Clamp, ConvFwd1x1S1P0>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            F32_Tuple,
+                                                                            Relu_Mul2_Clamp,
+                                                                            ConvFwdDefault,
+                                                                            8>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            F32_Tuple,
+                                                                            Relu_Mul2_Clamp,
+                                                                            ConvFwd1x1P0,
+                                                                            8>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<GK_Tuple,
+                                                                            F32_Tuple,
+                                                                            Relu_Mul2_Clamp,
+                                                                            ConvFwd1x1S1P0,
+                                                                            8>{});
 }
 } // namespace instance
 } // namespace device

--- a/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_perlayer_quantization_int8_instance.cpp
+++ b/library/src/tensor_operation_instance/gpu/quantization/conv2d_fwd/device_conv2d_xdl_perlayer_quantization_int8_instance.cpp
 // SPDX-License-Identifier: MIT
 // Copyright (c) 2018-2022, Advanced Micro Devices, Inc. All rights reserved.

-#include "device_conv2d_xdl_int8_instance.hpp"
+#include "device_conv2d_int8_instance.hpp"

 namespace ck {
 namespace tensor_operation {
@@ -21,15 +21,21 @@ void add_device_conv2d_perlayer_quantization_int8_instances(
                                                              PassThrough,
                                                              Mul_Clamp>>>& instances)
 {
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_instances<Empty_Tuple, Empty_Tuple, Mul_Clamp, ConvFwdDefault>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_instances<Empty_Tuple, Empty_Tuple, Mul_Clamp, ConvFwd1x1P0>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_instances<Empty_Tuple, Empty_Tuple, Mul_Clamp, ConvFwd1x1S1P0>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<Empty_Tuple,
+                                                                            Empty_Tuple,
+                                                                            Mul_Clamp,
+                                                                            ConvFwdDefault>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<Empty_Tuple,
+                                                                            Empty_Tuple,
+                                                                            Mul_Clamp,
+                                                                            ConvFwd1x1P0>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<Empty_Tuple,
+                                                                            Empty_Tuple,
+                                                                            Mul_Clamp,
+                                                                            ConvFwd1x1S1P0>{});
 }

 void add_device_conv2d_relu_perlayer_quantization_int8_instances(
@@ -46,15 +52,21 @@ void add_device_conv2d_relu_perlayer_quantization_int8_instances(
                                                              PassThrough,
                                                              Relu_Mul_Clamp>>>& instances)
 {
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_instances<Empty_Tuple, Empty_Tuple, Relu_Mul_Clamp, ConvFwdDefault>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_instances<Empty_Tuple, Empty_Tuple, Relu_Mul_Clamp, ConvFwd1x1P0>{});
-    add_device_operation_instances(
-        instances,
-        device_conv2d_int8_instances<Empty_Tuple, Empty_Tuple, Relu_Mul_Clamp, ConvFwd1x1S1P0>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<Empty_Tuple,
+                                                                            Empty_Tuple,
+                                                                            Relu_Mul_Clamp,
+                                                                            ConvFwdDefault>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<Empty_Tuple,
+                                                                            Empty_Tuple,
+                                                                            Relu_Mul_Clamp,
+                                                                            ConvFwd1x1P0>{});
+    add_device_operation_instances(instances,
+                                   device_grouped_conv2d_xdl_int8_instances<Empty_Tuple,
+                                                                            Empty_Tuple,
+                                                                            Relu_Mul_Clamp,
+                                                                            ConvFwd1x1S1P0>{});
 }
 } // namespace instance
 } // namespace device