Skip to content
KernelIndex
Search⌘K
Latest record changes
Batched compact-Householder QRsuite of 12 cases1.62 ms → 422.4 µs73.8% fastersubmission 826595 · B200
Batched symmetric eigendecompositionsuite of 13 cases47.7 ms → 0 ns100.0% fastersubmission 839675 · B200
Batched Cholesky factorizationsuite of 15 cases21.2 µs → 2.61 µs87.7% fastersubmission 928092 · B200
Operation
Current record
Implementation
Batched compact-Householder QR
422.4µs
73.8% faster · was 1.62 ms
suite of 12 cases · B200
indexed 2026-08-26 · reference-kernels eval.py · source available · apeirontic
Record history
422.4 µssubmission 826595current · observed 2026-06-22 · 73.8% faster
1.62 mssubmission 822459record 2026-06-20 → 2026-06-22 · 4.8% faster
1.70 mssubmission 821012record 2026-06-20 → 2026-06-20 · 7.1% faster

3 earlier events in Record history.

Batched symmetric eigendecomposition
0ns
100.0% faster · was 47.7 ms
suite of 13 cases · B200
indexed 2026-08-26 · reference-kernels eval.py · source available · badelsteinlelbach
Record history
0 nssubmission 839675current · observed 2026-06-27 · 100.0% faster
47.7 mssubmission 839443record 2026-06-27 → 2026-06-27 · 3.5% faster
49.4 mssubmission 837845record 2026-06-26 → 2026-06-27 · 8.1% faster

2 earlier events in Record history.

Batched Cholesky factorization
2.61µs
87.7% faster · was 21.2 µs
suite of 15 cases · B200
indexed 2026-08-26 · reference-kernels eval.py · source available · jordanrubin
Record history
2.61 µssubmission 928092current · observed 2026-07-29 · 87.7% faster
21.2 µssubmission 892285record 2026-07-21 → 2026-07-29 · 62.1% faster
55.8 µssubmission 892056record 2026-07-21 → 2026-07-21 · 68.8% faster

3 earlier events in Record history.

Mamba2ReturnY
7.47ms±0.00
39.3% faster · was 12.3 ms
fp32 · [2048, 128, 8, 64] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
7.47 mstorch.compile (inductor)current · observed 2026-03-05 · 39.3% faster
12.3 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
Mamba2ReturnFinalState
2.66ms±0.00
71.0% faster · was 9.18 ms
fp32 · [2048, 128, 8, 64] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
2.66 mstorch.compile (inductor)current · observed 2026-03-05 · 71.0% faster
9.18 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
ReLUSelfAttention
4.97ms±0.01
35.0% faster · was 7.65 ms
fp32 · [16, 1024, 768] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
4.97 mstorch.compile (inductor)current · observed 2026-03-05 · 35.0% faster
7.65 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
MinGPTCausalAttention
15.7ms±0.13
20.3% faster · was 19.7 ms
fp32 · [128, 512, 768] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
15.7 mstorch.compile (inductor)current · observed 2026-03-05 · 20.3% faster
19.7 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
MiniGPTBlock
36.7ms±0.24
22.9% faster · was 47.6 ms
fp32 · [128, 512, 768] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
36.7 mstorch.compile (inductor)current · observed 2026-03-05 · 22.9% faster
47.6 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
UNetSoftmax
6.56ms±0.01
8.0% faster · was 7.13 ms
fp32 · [8, 8, 64, 512] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
6.56 mstorch.compile (inductor)current · observed 2026-03-05 · 8.0% faster
7.13 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
NetVladWithGhostClusters
1.50ms±0.00
30.6% faster · was 2.16 ms
fp32 · [2048, 100, 512] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
1.50 mstorch.compile (inductor)current · observed 2026-03-05 · 30.6% faster
2.16 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
NetVladNoGhostClusters
1.35ms±0.00
30.8% faster · was 1.95 ms
fp32 · [2048, 100, 512] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
1.35 mstorch.compile (inductor)current · observed 2026-03-05 · 30.8% faster
1.95 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
ShuffleNet
13.5ms±0.01
60.8% faster · was 34.4 ms
fp32 · [10, 3, 224, 224] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
13.5 mstorch.compile (inductor)current · observed 2026-03-05 · 60.8% faster
34.4 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
RegNet
1.60ms±0.00
50.8% faster · was 3.25 ms
fp32 · [8, 3, 224, 224] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
1.60 mstorch.compile (inductor)current · observed 2026-03-05 · 50.8% faster
3.25 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
VisionTransformer
1.59ms±0.00
13.1% faster · was 1.83 ms
fp32 · [2, 3, 224, 224] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
1.59 mstorch.compile (inductor)current · observed 2026-03-05 · 13.1% faster
1.83 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
SwinMLP
4.18ms±0.01
18.4% faster · was 5.12 ms
fp32 · [10, 3, 224, 224] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
4.18 mstorch.compile (inductor)current · observed 2026-03-05 · 18.4% faster
5.12 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
SwinTransformerV2
6.47ms±0.11
35.9% faster · was 10.1 ms
fp32 · [10, 3, 224, 224] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
6.47 mstorch.compile (inductor)current · observed 2026-03-05 · 35.9% faster
10.1 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
VisionAttention
19.2ms±0.10
48.1% faster · was 37.0 ms
fp32 · [2, 128, 128, 128] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
19.2 mstorch.compile (inductor)current · observed 2026-03-05 · 48.1% faster
37.0 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
ConvolutionalVisionTransformer
1.15ms±0.02
25.8% faster · was 1.55 ms
fp32 · [10, 3, 32, 32] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
1.15 mstorch.compile (inductor)current · observed 2026-03-05 · 25.8% faster
1.55 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
VanillaRNN
11.0ms±0.10
16.7% faster · was 13.2 ms
fp32 · [256, 16384] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
11.0 mstorch.compile (inductor)current · observed 2026-03-05 · 16.7% faster
13.2 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
VanillaRNNHidden
10.6ms±0.02
15.2% faster · was 12.5 ms
fp32 · [256, 8, 1024] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
10.6 mstorch.compile (inductor)current · observed 2026-03-05 · 15.2% faster
12.5 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
LSTMCn
29.5ms±0.13
0.3% faster · was 29.6 ms
fp32 · [10, 512, 128] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
29.5 mstorch.compile (inductor)current · observed 2026-03-05 · 0.3% faster
29.6 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
Matmul BatchNorm BiasAdd Divide Swish
4.86ms±0.01
3.8% faster · was 5.05 ms
fp32 · [1024, 8192] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
4.86 mstorch.compile (inductor)current · observed 2026-03-05 · 3.8% faster
5.05 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
Matmul AvgPool GELU Scale Max
4.83ms±0.01
1.0% faster · was 4.88 ms
fp32 · [1024, 8192] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
4.83 mstorch.compile (inductor)current · observed 2026-03-05 · 1.0% faster
4.88 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
ConvTranspose3d Clamp Min Divide
12.8ms±0.01
37.9% faster · was 20.6 ms
fp32 · [16, 64, 24, 48, 48] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
12.8 mstorch.compile (inductor)current · observed 2026-03-05 · 37.9% faster
20.6 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
ShallowWideMLP
20.8ms±0.08
0.5% faster · was 20.9 ms
fp32 · [128, 16384] · H100
indexed 2026-08-26 · KernelBench timing scripts · license + source · PyTorch
Record history
20.8 mstorch.compile (inductor)current · observed 2026-03-05 · 0.5% faster
20.9 msPyTorch eagerrecord 2026-03-05 → 2026-03-05
← Previouspage 1 of 76Next →

Runs too close to call share a rank. How records are decided →

Atom feedJSONevidence: source-reported · history only grows · data licenses