@GPU_MODE They focused on optimizing W4A4 MoE kernels, Top-K kernels, tensor-parallel all-reduce kernels, and the MLA de…
SemiAnalysis Twitter · SemiAnalysis (@SemiAnalysis_) · 2026-08-01
The Readonflow Team's AMD hackathon submission targeted four specific kernel optimizations on MI355X: W4A4 MoE kernels, Top-K kernels, tensor-parallel all-reduce kernels, and the MLA decode metadata planner.
Appears in
Extraction
Topics: kernel-optimizationamd-mi355xmoe-inferencemla-attention
Claims
- The Readonflow Team optimized W4A4 MoE (Mixture-of-Experts) kernels for MI355X.
- Top-K kernels, tensor-parallel all-reduce kernels, and the MLA decode metadata planner were also targeted for optimization.
- These four kernel areas were the focus of the work that achieved the 4x performance improvement.
Key quotes
They focused on optimizing W4A4 MoE kernels, Top-K kernels, tensor-parallel all-reduce kernels, and the MLA decode metadata planner.