Skip to content
KernelIndex
Search⌘K

gpt-o3_cuda_696722

gpt-o3 · cuda · Apache-2.0

Use it

Vendorable · source mirrored · Apache-2.0View source →

No package. Vendor the mirrored source: 42 lines, Apache-2.0, pinned at da91508.

main.cpp
curl "https://kernelindex.com/api/v1/implementations/flashinfer-gpt-o3-cuda-696722?include=source"
interfacecuda
revisionda915083d4c7
symbolrun
pathmain.cpp
Compatibility
measured onNVIDIA B200
declared hardwareNVIDIA B200
architecturessm_100
dtypesfp16

Benchmark evidence

43 measurements across 1 GPU, fastest first.

Operation / workload
Hardware
Latency
Rank
Observed
GEMM n28672 k4096fp16 · [4, 4096]
NVIDIA B200
59.6µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [16, 4096]
NVIDIA B200
59.7µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [15, 4096]
NVIDIA B200
59.7µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [1, 4096]
NVIDIA B200
59.8µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [2, 4096]
NVIDIA B200
60.0µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [8, 4096]
NVIDIA B200
60.0µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [7, 4096]
NVIDIA B200
60.1µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [24, 4096]
NVIDIA B200
60.4µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [32, 4096]
NVIDIA B200
60.5µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [35, 4096]
NVIDIA B200
60.8µs
#2 of 8
2025-10-16
Show all 43 measurements ›
GEMM n28672 k4096fp16 · [48, 4096]
NVIDIA B200
61.0µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [64, 4096]
NVIDIA B200
61.3µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [70, 4096]
NVIDIA B200
61.5µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [80, 4096]
NVIDIA B200
61.6µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [40, 4096]
NVIDIA B200
61.6µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [72, 4096]
NVIDIA B200
61.8µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [56, 4096]
NVIDIA B200
61.8µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [144, 4096]
NVIDIA B200
63.2µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [136, 4096]
NVIDIA B200
63.3µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [160, 4096]
NVIDIA B200
63.9µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [96, 4096]
NVIDIA B200
66.3µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [128, 4096]
NVIDIA B200
66.4µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [112, 4096]
NVIDIA B200
66.4µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [104, 4096]
NVIDIA B200
67.4µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [88, 4096]
NVIDIA B200
67.4µs
#3 of 8
2025-10-16
GEMM n28672 k4096fp16 · [120, 4096]
NVIDIA B200
67.4µs
#3 of 8
2025-10-16
GEMM n28672 k4096fp16 · [152, 4096]
NVIDIA B200
68.6µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [168, 4096]
NVIDIA B200
68.6µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [176, 4096]
NVIDIA B200
69.2µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [184, 4096]
NVIDIA B200
71.0µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [192, 4096]
NVIDIA B200
71.7µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [208, 4096]
NVIDIA B200
71.8µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [224, 4096]
NVIDIA B200
71.9µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [240, 4096]
NVIDIA B200
71.9µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [256, 4096]
NVIDIA B200
72.0µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [200, 4096]
NVIDIA B200
72.4µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [216, 4096]
NVIDIA B200
72.7µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [248, 4096]
NVIDIA B200
72.8µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [232, 4096]
NVIDIA B200
75.5µs
#2 of 8
2025-10-16
GEMM n28672 k4096fp16 · [972, 4096]
NVIDIA B200
205.9µs
#3 of 8
2025-10-16
GEMM n28672 k4096fp16 · [2053, 4096]
NVIDIA B200
390.4µs
#3 of 8
2025-10-16
GEMM n28672 k4096fp16 · [2379, 4096]
NVIDIA B200
457.8µs
#3 of 8
2025-10-16
GEMM n28672 k4096fp16 · [8192, 4096]
NVIDIA B200
1.45ms
#3 of 8
2025-10-16

Reproduction-ready · How evidence levels are derived →

Source and license

sourcehttps://huggingface.co/datasets/flashinfer-ai/flashinfer-trace
commitda915083d4c7c5e61aa3005e3d17ae488e0fc71c
revision digestsha256:24ed978b12ffe5524f0ca327a13034ccba5a78b2df235f90e88a8a6d4227b0b6
license declaredApache-2.0
license concludedApache-2.0
authorsgpt-o3
imported2026-08-20

Kernel source

main.cpp42 lines
/*
 *  main.cpp
 *
 *  Thin C++ front-end for the GEMM launcher so that the module can be used
 *  directly from Python.  The exposed `run` function mirrors the reference
 *  implementation:
 *
 *      C = torch.matmul(A , B.T)
 */

#include "kernel.h"

#include <torch/extension.h>

/* --------------------------------------------------------------------- */
/*  Public API exposed to Python                                         */
/* --------------------------------------------------------------------- */
torch::Tensor run(torch::Tensor A, torch::Tensor B,
                  py::kwargs /*unused*/ = {})
{
    TORCH_CHECK(A.device().is_cuda() && B.device().is_cuda(),
                "Input tensors must be on CUDA device");

    const auto M = A.size(0);
    auto C = torch::empty({M, 28672},
                          torch::dtype(at::kHalf).device(A.device()));

    /* Perform the GEMM on the current CUDA stream */
    launch_gemm_n_28672_k_4096(A, B, C);

    return C;
}

/* --------------------------------------------------------------------- */
/*  PyBind11 module                                                      */
/* --------------------------------------------------------------------- */
PYBIND11_MODULE(TORCH_EXTENSION_NAME, m) {
    m.def("run", &run,
          "GEMM:  C[M,28672] = A[M,4096] * B[28672,4096]^T  (FP16)",
          py::arg("A"),
          py::arg("B"));
}
scrolls · 42 lines total

Source code from FlashInfer-Bench (flashinfer-ai/flashinfer-trace) · Apache-2.0

Best evidence level for this revision: reproducible

JSON