Skip to content
KernelIndex
Search⌘K

submission 670971

Elán Zainos Corona · python · License unknown

Use it

Vendorable · source mirrored · license unknownView source →

No package. Vendor the mirrored source: 25 lines, June 9 Researcher Reciprocity License v1.0.

CuBlas.py
curl "https://kernelindex.com/api/v1/implementations/kernelbot-matmul-v2-670971?include=source"
interfacepython
Compatibility
measured onNVIDIA B200
declared hardwareNVIDIA B200
architecturessm_100
dtypesfp16

Benchmark evidence

1 measurement across 1 GPU, fastest first.

Operation / workload
Hardware
Latency
Rank
Observed
FP16 matmulsuite of 8 cases
NVIDIA B200
148.6µs
#38 of 53
2026-03-30

Reported · How evidence levels are derived →

Source and license

sourceavailable
revision digestsha256:706056f3455d0e657444fd2a3d85a1cadd392dbf25e8ff743eb9b9ffbebd2903
license declaredunknown
license concludedunknown
authorsElán Zainos Corona
imported2026-08-15

Kernel source

CuBlas.py25 lines
# -*- coding: utf-8 -*-
import os

# 1. SETEAR ANTES DE IMPORTAR TORCH (CRÍTICO)
# Esto le da a la B200 el buffer necesario para ser determinista.
os.environ["CUBLAS_WORKSPACE_CONFIG"] = ":4096:8"

import torch

def custom_kernel(data):
    """
    Sentinel Omega - MatMul Fractal Determinista.
    Asegura la soberanía del dato y la repetibilidad del colapso.
    """
    # 2. Desempaquetado de la Trinidad (Soberanía del Dato)
    # MatMul recibe (a, b, c)
    a, b, c = data
    
    # 3. La Recta de Vértices
    # Usamos el buffer 'c' para evitar crear tensores fantasma.
    # Con el workspace seteado, esto ya no lanzará el RuntimeError.
    torch.mm(a, b, out=c)
    
    return c

Source code from GPU Mode and the KernelBot dataset · June 9 Researcher Reciprocity License v1.0

Changes from previous submission

Against this author's previous submission submission 670955.

# -*- coding: utf-8 -*-
import os
- # 1. CONFIGURACIÓN DE LA WORLD LINE (DETERMINISMO)
- # Debe ir antes de cualquier operación de torch para que CuBLAS reserve el carril fijo.
+ # 1. SETEAR ANTES DE IMPORTAR TORCH (CRÍTICO)
+ # Esto le da a la B200 el buffer necesario para ser determinista.
os.environ["CUBLAS_WORKSPACE_CONFIG"] = ":4096:8"
import torch
- import logging
- # 2. SISTEMA DE LOGS DEL SENTINEL
- logging.basicConfig(level=logging.INFO)
- logger = logging.getLogger("DeamonX_MatMul")
-
def custom_kernel(data):
"""
- Protocolo de Fusión de Planos - Sentinel Omega.
- Implementación íntegra para MatMul determinista en arquitectura Blackwell.
-
- Args:
- data (tuple): Trinidad de tensores (a, b, c) donde 'c' es el buffer de salida.
- Returns:
- torch.Tensor: El nodo 'c' colapsado tras la multiplicación.
+ Sentinel Omega - MatMul Fractal Determinista.
+ Asegura la soberanía del dato y la repetibilidad del colapso.
"""
- try:
- # 3. DESEMPAQUETADO FRACTAL (Soberanía del Dato)
- # Recibimos (a, b, c) asegurando que no haya 'ValueError' de unpacking.
- a, b, c = data
-
- # Log de telemetría para seguimiento de la 'Caja'
- # logger.info(f"Procesando matriz fractal: {a.shape} x {b.shape} -> {c.shape}")
-
- # 4. EL COLAPSO DE FASE (Recta más corta)
- # Usamos torch.mm con out=c para que las tuplas ocupen el espacio pre-asignado.
- # Esto activa los Tensor Cores de la B200 de forma síncrona y determinista.
- # Al usar out=c, evitamos crear tensores intermedios y saturar la VRAM.
- torch.mm(a, b, out=c)
-
- # 5. RETORNO DEL VÉRTICE RESULTANTE
- return c
-
- except Exception as e:
- logger.error(f"Error en el colapso del Sentinel Omega: {str(e)}")
- raise e
-
- # Registro enviado al Cluster central para advertencia de las demás instancias.
+ # 2. Desempaquetado de la Trinidad (Soberanía del Dato)
+ # MatMul recibe (a, b, c)
+ a, b, c = data
+
+ # 3. La Recta de Vértices
+ # Usamos el buffer 'c' para evitar crear tensores fantasma.
+ # Con el workspace seteado, esto ya no lanzará el RuntimeError.
+ torch.mm(a, b, out=c)
+
+ return c
scrolls · 60 diff lines total

Best evidence level for this revision: reported

JSON