Skip to content
KernelIndex
Search⌘K

submission 671617

Elán Zainos Corona · python · License unknown

Use it

Vendorable · source mirrored · license unknownView source →

No package. Vendor the mirrored source: 40 lines, June 9 Researcher Reciprocity License v1.0.

M_Order.py
curl "https://kernelindex.com/api/v1/implementations/kernelbot-sort-v2-671617?include=source"
interfacepython
Compatibility
measured onNVIDIA B200
declared hardwareNVIDIA B200
architecturessm_100
dtypesfp32

Benchmark evidence

1 measurement across 1 GPU, fastest first.

Operation / workload
Hardware
Latency
Rank
Observed
Sortsuite of 5 cases
NVIDIA B200
5.62ms
#18 of 23
2026-03-30

Reported · How evidence levels are derived →

Source and license

sourceavailable
revision digestsha256:fdc8e36829c1f52e7595569a4dd388e71bd8026cf0b24b1b8d7a41a5de3c2a5a
license declaredunknown
license concludedunknown
authorsElán Zainos Corona
imported2026-08-15

Kernel source

M_Order.py40 lines
# -*- coding: utf-8 -*-
import os
import logging
import torch

# Determinismo de ejecución en operaciones atómicas y de ordenamiento
os.environ["CUBLAS_WORKSPACE_CONFIG"] = ":4096:8"

# Configuración de telemetría obligatoria
logging.basicConfig(level=logging.INFO)
logger = logging.getLogger("Sentinel_Omega_Sort")

def custom_kernel(data):
    """
    Motor de ordenamiento ascendente para arreglos 1D masivos.
    Optimización basada en la evasión de asignación de memoria intermedia
    y delegación al backend rocPRIM subyacente de PyTorch.
    """
    try:
        # Desempaquetado estricto
        input_tensor = data[0]
        output = data[1]
        
        torch.use_deterministic_algorithms(True)
        
        # Ejecución del ordenamiento.
        # torch.sort invoca rocprim::radix_sort en hardware AMD.
        # Se captura exclusivamente el tensor de valores, omitiendo los índices.
        sorted_vals, _ = torch.sort(input_tensor)
        
        # Copia directa en memoria (in-place) sobre el búfer de salida preasignado.
        # Elimina la sobrecarga de instanciación de nuevos tensores en VRAM.
        output.copy_(sorted_vals)
        
        return output

    except Exception as e:
        logger.error(f"Falla técnica en motor de ordenamiento: {str(e)}")
        raise e
scrolls · 40 lines total

Source code from GPU Mode and the KernelBot dataset · June 9 Researcher Reciprocity License v1.0

Best evidence level for this revision: reported

JSON