humming-kernels
Subscription: Developer
Active
Subscription: Developer
High-performance JIT compiled GEMM kernel library for quantized inference supporting various weight types under 8-bit activations including FP16/BF16/FP8/FP4/INT8/INT4 and multiple scale types, with flexibility for different quantization strategies.
pip install humming_kernels==0.1.2
0.1.2
Linux