submission 527260
josusanmartin · python · License unknown
Use it
Vendorable · source mirrored · license unknownView source →
No package. Vendor the mirrored source: 237 lines, June 9 Researcher Reciprocity License v1.0.
submission_cfg_hybrid_under150.py
curl "https://kernelindex.com/api/v1/implementations/kernelbot-amd-moe-mxfp4-527260?include=source"interfacepython
Compatibility
measured onAMD Instinct MI355X
declared hardwareAMD Instinct MI355X
architecturesgfx950
dtypesbf16, fp32, fp8_e8m0, int32, mxfp4
Benchmark evidence
1 measurement across 1 GPU, fastest first.
Operation / workload
Hardware
Latency
Rank
Observed
Reported · How evidence levels are derived →
Source and license
sourceavailable
revision digestsha256:d36e8e4546a13024e682ebe99776669d9c29f542a0220ca9b01b255f253eb32a
license declaredunknown
license concludedunknown
authorsjosusanmartin
imported2026-08-15
Kernel source
submission_cfg_hybrid_under150.py237 lines
import os
from pathlib import Path
import pandas as pd
import torch
from aiter import ActivationType, QuantType
from aiter.fused_moe import fused_moe
from task import input_t, output_t
def _bootstrap_cfg() -> str:
out_path = Path("/tmp/josu_cfg_hybrid_under150_fmoe.csv")
if out_path.exists() and out_path.stat().st_size > 0:
return str(out_path)
source_paths = [
Path("/home/runner/aiter/aiter/configs/tuned_fmoe.csv"),
Path(
"/home/runner/aiter/aiter/configs/model_configs/"
"a8w8_blockscale_tuned_fmoe_qwen3_235b.csv"
),
Path("/home/runner/aiter/aiter/configs/model_configs/dsv3_fp4_tuned_fmoe.csv"),
]
frames = [pd.read_csv(path) for path in source_paths if path.exists()]
merged = pd.concat(frames, ignore_index=True)
untuned_path = Path("/home/runner/aiter/aiter/configs/untuned_fmoe.csv")
keys = pd.read_csv(untuned_path, nrows=0).columns.tolist()
if "cu_num" not in keys:
keys.append("cu_num")
defaults = {column: "" for column in merged.columns}
defaults.update(
{
"cu_num": 256,
"act_type": "ActivationType.Silu",
"dtype": "torch.bfloat16",
"q_dtype_a": "torch.float4_e2m1fn_x2",
"q_dtype_w": "torch.float4_e2m1fn_x2",
"q_type": "QuantType.per_1x32",
"use_g1u1": 1,
"doweight_stage1": 0,
"block_m": 32,
"ksplit": 0,
"us1": 0.0,
"kernelName1": "",
"err1": "0.0%",
"us2": 0.0,
"kernelName2": "",
"err2": "0.0%",
"us": 0.0,
"run_1stage": 0,
"tflops": 0.0,
"bw": 0.0,
"_tag": "",
}
)
online_tuned_rows = [
{
"token": 16,
"model_dim": 7168,
"inter_dim": 512,
"expert": 33,
"topk": 9,
"block_m": 32,
"ksplit": 0,
"us": 47.3336,
"us1": 0.0,
"kernelName1": "moe_ck2stages_gemm1_64x32x32x128_1x1_MulABScaleShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight0_silu_FP4X2_FP4X2_B16",
"err1": "0.0%",
"us2": 0.0,
"kernelName2": "moe_ck2stages_gemm2_64x32x32x128_1x1_MulABScaleExpertWeightShuffled_v1_Nswizzle0_Quant3_MulRoutedWeight1_FP4X2_FP4X2_B16",
"err2": "2.9%",
"run_1stage": 0,
"tflops": 66.99,
"bw": 7683.25,
},
{
"token": 128,
"model_dim": 7168,
"inter_dim": 512,
"expert": 33,
"topk": 9,
"block_m": 32,
"ksplit": 0,
"us": 58.5681,
"us1": 0.0,
"kernelName1": "moe_ck2stages_gemm1_64x32x32x128_1x1_MulABScaleShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight0_silu_FP4X2_FP4X2_B16",
"err1": "0.0%",
"us2": 0.0,
"kernelName2": "moe_ck2stages_gemm2_64x32x32x128_1x1_MulABScaleExpertWeightShuffled_v1_Nswizzle0_Quant3_MulRoutedWeight1_FP4X2_FP4X2_B16",
"err2": "2.9%",
"run_1stage": 0,
"tflops": 433.12,
"bw": 6250.57,
},
{
"token": 512,
"model_dim": 7168,
"inter_dim": 512,
"expert": 33,
"topk": 9,
"block_m": 32,
"ksplit": 0,
"us": 129.6056,
"us1": 0.0,
"kernelName1": "moe_ck2stages_gemm1_256x32x128x128_1x4_MulABScaleShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight0_silu_FP4X2_FP4X2_B16",
"err1": "0.0%",
"us2": 0.0,
"kernelName2": "moe_ck2stages_gemm2_64x32x32x128_1x1_MulABScaleExpertWeightShuffled_v1_Nswizzle0_Quant3_MulRoutedWeight1_FP4X2_FP4X2_B16",
"err2": "2.9%",
"run_1stage": 0,
"tflops": 782.9,
"bw": 2888.31,
},
{
"token": 512,
"model_dim": 7168,
"inter_dim": 2048,
"expert": 33,
"topk": 9,
"block_m": 128,
"ksplit": 0,
"us": 275.9788,
"us1": 0.0,
"kernelName1": "moe_ck2stages_gemm1_256x128x128x128_1x4_MulABScaleShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight0_silu_FP4X2_FP4X2_B16",
"err1": "0.0%",
"us2": 0.0,
"kernelName2": "moe_ck2stages_gemm2_256x128x128x128_1x4_MulABScaleExpertWeightShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight1_FP4X2_FP4X2_B16",
"err2": "7.1%",
"run_1stage": 0,
"tflops": 1470.67,
"bw": 5305.97,
},
]
k2_overrides = [
(16, 7168, 256, 257, 9),
(128, 7168, 256, 257, 9),
(16, 7168, 512, 33, 9),
(128, 7168, 512, 33, 9),
]
rows = []
for row in online_tuned_rows:
seeded = defaults.copy()
seeded.update(row)
rows.append(seeded)
for token, model_dim, inter_dim, expert, topk in k2_overrides:
mask = (
(merged["cu_num"] == 256)
& (merged["token"] == token)
& (merged["model_dim"] == model_dim)
& (merged["inter_dim"] == inter_dim)
& (merged["expert"] == expert)
& (merged["topk"] == topk)
& (merged["act_type"] == "ActivationType.Silu")
& (merged["dtype"] == "torch.bfloat16")
& (merged["q_dtype_a"] == "torch.float4_e2m1fn_x2")
& (merged["q_dtype_w"] == "torch.float4_e2m1fn_x2")
& (merged["q_type"] == "QuantType.per_1x32")
& (merged["use_g1u1"] == 1)
& (merged["doweight_stage1"] == 0)
)
if mask.any():
row = merged.loc[mask].sort_values("us").iloc[0].to_dict()
else:
row = defaults.copy()
row.update(
{
"token": token,
"model_dim": model_dim,
"inter_dim": inter_dim,
"expert": expert,
"topk": topk,
}
)
row["ksplit"] = 2
row["us"] = -1.0
rows.append(row)
merged = pd.concat([merged, pd.DataFrame(rows)], ignore_index=True)
dedup_keys = keys + (["_tag"] if "_tag" in merged.columns else [])
merged = (
merged.sort_values("us")
.drop_duplicates(subset=dedup_keys, keep="first")
.reset_index(drop=True)
)
out_path.parent.mkdir(parents=True, exist_ok=True)
merged.to_csv(out_path, index=False)
return str(out_path)
os.environ["AITER_CONFIG_FMOE"] = _bootstrap_cfg()
def custom_kernel(data: input_t) -> output_t:
(
hidden_states,
gate_up_weight,
down_weight,
gate_up_weight_scale,
down_weight_scale,
gate_up_weight_shuffled,
down_weight_shuffled,
gate_up_weight_scale_shuffled,
down_weight_scale_shuffled,
topk_weights,
topk_ids,
config,
) = data
hidden_pad = config["d_hidden_pad"] - config["d_hidden"]
intermediate_pad = config["d_expert_pad"] - config["d_expert"]
return fused_moe(
hidden_states,
gate_up_weight_shuffled,
down_weight_shuffled,
topk_weights,
topk_ids,
expert_mask=None,
activation=ActivationType.Silu,
quant_type=QuantType.per_1x32,
doweight_stage1=False,
w1_scale=gate_up_weight_scale_shuffled,
w2_scale=down_weight_scale_shuffled,
a1_scale=None,
a2_scale=None,
hidden_pad=hidden_pad,
intermediate_pad=intermediate_pad,
)
scrolls · 237 lines total
Source code from GPU Mode and the KernelBot dataset · June 9 Researcher Reciprocity License v1.0
Changes from previous submission
Against this author's previous submission submission 519895.
+ import os+ from pathlib import Path++ import pandas as pdimport torchfrom aiter import ActivationType, QuantTypefrom aiter.fused_moe import fused_moefrom task import input_t, output_t+ def _bootstrap_cfg() -> str:+ out_path = Path("/tmp/josu_cfg_hybrid_under150_fmoe.csv")+ if out_path.exists() and out_path.stat().st_size > 0:+ return str(out_path)++ source_paths = [+ Path("/home/runner/aiter/aiter/configs/tuned_fmoe.csv"),+ Path(+ "/home/runner/aiter/aiter/configs/model_configs/"+ "a8w8_blockscale_tuned_fmoe_qwen3_235b.csv"+ ),+ Path("/home/runner/aiter/aiter/configs/model_configs/dsv3_fp4_tuned_fmoe.csv"),+ ]+ frames = [pd.read_csv(path) for path in source_paths if path.exists()]+ merged = pd.concat(frames, ignore_index=True)++ untuned_path = Path("/home/runner/aiter/aiter/configs/untuned_fmoe.csv")+ keys = pd.read_csv(untuned_path, nrows=0).columns.tolist()+ if "cu_num" not in keys:+ keys.append("cu_num")++ defaults = {column: "" for column in merged.columns}+ defaults.update(+ {+ "cu_num": 256,+ "act_type": "ActivationType.Silu",+ "dtype": "torch.bfloat16",+ "q_dtype_a": "torch.float4_e2m1fn_x2",+ "q_dtype_w": "torch.float4_e2m1fn_x2",+ "q_type": "QuantType.per_1x32",+ "use_g1u1": 1,+ "doweight_stage1": 0,+ "block_m": 32,+ "ksplit": 0,+ "us1": 0.0,+ "kernelName1": "",+ "err1": "0.0%",+ "us2": 0.0,+ "kernelName2": "",+ "err2": "0.0%",+ "us": 0.0,+ "run_1stage": 0,+ "tflops": 0.0,+ "bw": 0.0,+ "_tag": "",+ }+ )++ online_tuned_rows = [+ {+ "token": 16,+ "model_dim": 7168,+ "inter_dim": 512,+ "expert": 33,+ "topk": 9,+ "block_m": 32,+ "ksplit": 0,+ "us": 47.3336,+ "us1": 0.0,+ "kernelName1": "moe_ck2stages_gemm1_64x32x32x128_1x1_MulABScaleShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight0_silu_FP4X2_FP4X2_B16",+ "err1": "0.0%",+ "us2": 0.0,+ "kernelName2": "moe_ck2stages_gemm2_64x32x32x128_1x1_MulABScaleExpertWeightShuffled_v1_Nswizzle0_Quant3_MulRoutedWeight1_FP4X2_FP4X2_B16",+ "err2": "2.9%",+ "run_1stage": 0,+ "tflops": 66.99,+ "bw": 7683.25,+ },+ {+ "token": 128,+ "model_dim": 7168,+ "inter_dim": 512,+ "expert": 33,+ "topk": 9,+ "block_m": 32,+ "ksplit": 0,+ "us": 58.5681,+ "us1": 0.0,+ "kernelName1": "moe_ck2stages_gemm1_64x32x32x128_1x1_MulABScaleShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight0_silu_FP4X2_FP4X2_B16",+ "err1": "0.0%",+ "us2": 0.0,+ "kernelName2": "moe_ck2stages_gemm2_64x32x32x128_1x1_MulABScaleExpertWeightShuffled_v1_Nswizzle0_Quant3_MulRoutedWeight1_FP4X2_FP4X2_B16",+ "err2": "2.9%",+ "run_1stage": 0,+ "tflops": 433.12,+ "bw": 6250.57,+ },+ {+ "token": 512,+ "model_dim": 7168,+ "inter_dim": 512,+ "expert": 33,+ "topk": 9,+ "block_m": 32,+ "ksplit": 0,+ "us": 129.6056,+ "us1": 0.0,+ "kernelName1": "moe_ck2stages_gemm1_256x32x128x128_1x4_MulABScaleShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight0_silu_FP4X2_FP4X2_B16",+ "err1": "0.0%",+ "us2": 0.0,+ "kernelName2": "moe_ck2stages_gemm2_64x32x32x128_1x1_MulABScaleExpertWeightShuffled_v1_Nswizzle0_Quant3_MulRoutedWeight1_FP4X2_FP4X2_B16",+ "err2": "2.9%",+ "run_1stage": 0,+ "tflops": 782.9,+ "bw": 2888.31,+ },+ {+ "token": 512,+ "model_dim": 7168,+ "inter_dim": 2048,+ "expert": 33,+ "topk": 9,+ "block_m": 128,+ "ksplit": 0,+ "us": 275.9788,+ "us1": 0.0,+ "kernelName1": "moe_ck2stages_gemm1_256x128x128x128_1x4_MulABScaleShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight0_silu_FP4X2_FP4X2_B16",+ "err1": "0.0%",+ "us2": 0.0,+ "kernelName2": "moe_ck2stages_gemm2_256x128x128x128_1x4_MulABScaleExpertWeightShuffled_v3_Nswizzle0_Quant3_MulRoutedWeight1_FP4X2_FP4X2_B16",+ "err2": "7.1%",+ "run_1stage": 0,+ "tflops": 1470.67,+ "bw": 5305.97,+ },+ ]++ k2_overrides = [+ (16, 7168, 256, 257, 9),+ (128, 7168, 256, 257, 9),+ (16, 7168, 512, 33, 9),+ (128, 7168, 512, 33, 9),+ ]++ rows = []+ for row in online_tuned_rows:+ seeded = defaults.copy()+ seeded.update(row)+ rows.append(seeded)++ for token, model_dim, inter_dim, expert, topk in k2_overrides:+ mask = (+ (merged["cu_num"] == 256)+ & (merged["token"] == token)+ & (merged["model_dim"] == model_dim)+ & (merged["inter_dim"] == inter_dim)+ & (merged["expert"] == expert)+ & (merged["topk"] == topk)+ & (merged["act_type"] == "ActivationType.Silu")+ & (merged["dtype"] == "torch.bfloat16")+ & (merged["q_dtype_a"] == "torch.float4_e2m1fn_x2")+ & (merged["q_dtype_w"] == "torch.float4_e2m1fn_x2")+ & (merged["q_type"] == "QuantType.per_1x32")+ & (merged["use_g1u1"] == 1)+ & (merged["doweight_stage1"] == 0)+ )+ if mask.any():+ row = merged.loc[mask].sort_values("us").iloc[0].to_dict()+ else:+ row = defaults.copy()+ row.update(+ {+ "token": token,+ "model_dim": model_dim,+ "inter_dim": inter_dim,+ "expert": expert,+ "topk": topk,+ }+ )++ row["ksplit"] = 2+ row["us"] = -1.0+ rows.append(row)++ merged = pd.concat([merged, pd.DataFrame(rows)], ignore_index=True)+ dedup_keys = keys + (["_tag"] if "_tag" in merged.columns else [])+ merged = (+ merged.sort_values("us")+ .drop_duplicates(subset=dedup_keys, keep="first")+ .reset_index(drop=True)+ )++ out_path.parent.mkdir(parents=True, exist_ok=True)+ merged.to_csv(out_path, index=False)+ return str(out_path)+++ os.environ["AITER_CONFIG_FMOE"] = _bootstrap_cfg()++def custom_kernel(data: input_t) -> output_t:(hidden_states,
scrolls · 203 diff lines total
Best evidence level for this revision: reported
JSON