Skip to content
KernelIndex
Search⌘K

NVIDIA L4

sm_89
Records held
8
Runs
131
Operations
8131 implementations

Records held on this GPU

Operation · workload
History
Record
Implementation
Since
Vector sum reductionsuite of 6 cases
864.8µs
2025-11-05
FP16 vector additionsuite of 5 cases
6.27ms
2026-03-22
Sortsuite of 5 cases
10.3ms
2025-12-13
Inclusive prefix sumsuite of 11 cases
9.07ms
2026-03-04
FP16 matmulsuite of 8 cases
2.08ms
2026-05-05
Histogramsuite of 6 cases
63.5µs
2026-02-21
RGB to grayscalesuite of 6 cases
16.7ms
2025-12-17
2D convolutionsuite of 5 cases
114.3ms
2026-03-13

Open in the records ledger →

Coverage by operation family

Family
Operations
Runs
With source
elementwise
2
38
33
reduction
1
26
26
conv
1
21
21
sort
1
13
13
gemm
1
12
12
scan
1
11
11
histogram
1
10
10

Serving evidence

End-to-end serving results measured on this hardware — a separate corpus with its own resolver, never ranked against the kernel records above.

Model · workload
Scenario
Best reported
Runs
Llama-3.1-8B (MLPerf reference)llama3.1-8b · Offline
offline
1,642 tok/s
1
Llama-3.1-8B (MLPerf reference)llama3.1-8b · Server
server
1,207 tok/s
1

2 serving runs · Open in the serving resolver →

Record activity

30Nov
10Dec
Jan
2Feb
9Mar
Apr
1May
Jun
Jul
Aug
Sep
Oct
Sources: GPU MODE KernelBot (2026-05-13) · June 9 Researcher Reciprocity License v1.0last observed 2026-05-13