The Information Machine

@GPU_MODE They focused on optimizing W4A4 MoE kernels, Top-K kernels, tensor-parallel all-reduce kernels, and the MLA de…

SemiAnalysis Twitter · SemiAnalysis (@SemiAnalysis_) · 2026-08-01

The Readonflow Team's AMD hackathon submission targeted four specific kernel optimizations on MI355X: W4A4 MoE kernels, Top-K kernels, tensor-parallel all-reduce kernels, and the MLA decode metadata planner.

Open original ↗

Appears in

Extraction

Topics: kernel-optimizationamd-mi355xmoe-inferencemla-attention

Claims

  • The Readonflow Team optimized W4A4 MoE (Mixture-of-Experts) kernels for MI355X.
  • Top-K kernels, tensor-parallel all-reduce kernels, and the MLA decode metadata planner were also targeted for optimization.
  • These four kernel areas were the focus of the work that achieved the 4x performance improvement.

Key quotes

They focused on optimizing W4A4 MoE kernels, Top-K kernels, tensor-parallel all-reduce kernels, and the MLA decode metadata planner.