Skip to content
KernelIndex
Search⌘K

torch_matmul_254647

FlashInfer-Bench baselines · python · Apache-2.0

Use it

Vendorable · source mirrored · Apache-2.0View source →

No package. Vendor the mirrored source: 7 lines, Apache-2.0, pinned at da91508.

main.py
curl "https://kernelindex.com/api/v1/implementations/flashinfer-torch-matmul-254647?include=source"
interfacepython
revisionda915083d4c7
symbolrun
pathmain.py
Compatibility
measured onNVIDIA B200
declared hardwareCPU, NVIDIA A100, NVIDIA H100
architecturessm_90, unknown
dtypesfp16

Benchmark evidence

52 measurements across 1 GPU, fastest first.

Operation / workload
Hardware
Latency
Rank
Observed
GEMM n4096 k14336fp16 · [120, 4096]
NVIDIA B200
16.1µs
#2 of 8
2025-10-16
GEMM n4096 k14336fp16 · [128, 4096]
NVIDIA B200
16.3µs
#3 of 9
2025-10-16
GEMM n4096 k14336fp16 · [152, 4096]
NVIDIA B200
16.3µs
#2 of 8
2025-10-16
GEMM n4096 k14336fp16 · [176, 4096]
NVIDIA B200
16.8µs
#3 of 8
2025-10-16
GEMM n4096 k14336fp16 · [168, 4096]
NVIDIA B200
16.9µs
#3 of 8
2025-10-16
GEMM n4096 k14336fp16 · [192, 4096]
NVIDIA B200
16.9µs
#3 of 8
2025-10-16
GEMM n4096 k14336fp16 · [208, 4096]
NVIDIA B200
17.1µs
#2 of 9
2025-10-16
GEMM n4096 k14336fp16 · [232, 4096]
NVIDIA B200
18.1µs
#3 of 8
2025-10-16
GEMM n4096 k14336fp16 · [256, 4096]
NVIDIA B200
18.2µs
#3 of 9
2025-10-16
GEMM n4096 k14336fp16 · [16, 14336]
NVIDIA B200
35.6µs
#1 of 6
2025-10-20
Show all 52 measurements ›
GEMM n4096 k14336fp16 · [7, 14336]
NVIDIA B200
35.6µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [8, 14336]
NVIDIA B200
35.7µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [15, 14336]
NVIDIA B200
36.4µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [1, 14336]
NVIDIA B200
36.5µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [40, 14336]
NVIDIA B200
36.8µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [4, 14336]
NVIDIA B200
36.8µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [35, 14336]
NVIDIA B200
36.8µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [24, 14336]
NVIDIA B200
36.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [48, 14336]
NVIDIA B200
36.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [64, 14336]
NVIDIA B200
36.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [56, 14336]
NVIDIA B200
36.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [88, 14336]
NVIDIA B200
36.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [80, 14336]
NVIDIA B200
36.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [96, 14336]
NVIDIA B200
36.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [104, 14336]
NVIDIA B200
37.0µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [112, 14336]
NVIDIA B200
37.0µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [120, 14336]
NVIDIA B200
37.0µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [128, 14336]
NVIDIA B200
37.0µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [144, 14336]
NVIDIA B200
37.2µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [152, 14336]
NVIDIA B200
37.2µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [2, 14336]
NVIDIA B200
37.2µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [32, 14336]
NVIDIA B200
38.3µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [176, 14336]
NVIDIA B200
38.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [184, 14336]
NVIDIA B200
38.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [70, 14336]
NVIDIA B200
39.7µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [72, 14336]
NVIDIA B200
39.8µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [208, 14336]
NVIDIA B200
40.0µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [216, 14336]
NVIDIA B200
40.1µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [256, 14336]
NVIDIA B200
41.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [160, 14336]
NVIDIA B200
42.0µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [136, 14336]
NVIDIA B200
44.1µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [168, 14336]
NVIDIA B200
47.3µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [232, 14336]
NVIDIA B200
49.1µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [224, 14336]
NVIDIA B200
49.2µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [240, 14336]
NVIDIA B200
49.2µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [248, 14336]
NVIDIA B200
49.6µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [192, 14336]
NVIDIA B200
49.9µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [200, 14336]
NVIDIA B200
51.6µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [972, 14336]
NVIDIA B200
90.0µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [2053, 14336]
NVIDIA B200
164.6µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [2379, 14336]
NVIDIA B200
209.1µs
#1 of 6
2025-10-20
GEMM n4096 k14336fp16 · [8192, 14336]
NVIDIA B200
664.3µs
#1 of 6
2025-10-20

Reported · How evidence levels are derived →

Source and license

sourcehttps://huggingface.co/datasets/flashinfer-ai/flashinfer-trace
commitda915083d4c7c5e61aa3005e3d17ae488e0fc71c
revision digestsha256:69e4d461225b66047c84b1a763e08ba66280e6d9641575d8d53bd93c8b48ec3d
license declaredApache-2.0
license concludedApache-2.0
authorsbaseline
imported2026-08-16

Kernel source

main.py7 lines
import torch
import torch.nn.functional as F

def run(A: torch.Tensor, B: torch.Tensor):
    C = F.linear(A, B)
    return C

Source code from FlashInfer-Bench (flashinfer-ai/flashinfer-trace) · Apache-2.0

Best evidence level for this revision: reported

JSON