| c3f74efb866edba8892f18506b1c4febc157a799 [Bugfix][Kernel][ROCm] Fix Wave32 LDS overflow in top-k merge launch | |
| abefcfad484b85af6f57703c815a5f169807a3fd research(profile): annotate Ling decoder families | |
| a73488d0243736797f75412ad23549cada767a47 Revert "research(profile): annotate Ling decoder families" | |
| c7e91b99ce98786dad42f830965759e1ff1f74ac Reapply "research(profile): annotate Ling decoder families" | |
| d8481aec96d9a3caca7323f5d6b5bcef3f0fb8ed Revert "Reapply "research(profile): annotate Ling decoder families"" | |
| 8457fad14b028e1c443cb4c5998df377873e3d95 Enable native merge attention states on ROCm | |
| 8743a17f147d899d670af9b808d5bf93a5bf26fb Revert "Enable native merge attention states on ROCm" | |
| 7deddd0a87a94637e4fbe2d309a484ab9a04e33f Add opt-in safe ROCm attention merge | |
| 3715c596c1a0df9d42d133a61d14dbed5105ab0a Handle MLA LSE layouts in safe ROCm merge | |
| f6773b23215df5aa2a8de5050bd2f9b6fa53b727 ROCm: route uniform MLA verify blocks through causal decode | |
| 15a4190ddf0a363e08d518345a8f3e23e8bc8bd9 Optimize decode WNA16 expert assignment | |
| abfff126e0698d98f1872f87f501d36a19382240 Optimize single-token MoE reduction | |
| 928e725a9dbcdbea0bf6c914c8b3fe93f08b0d3f Optimize K2 verification MoE support kernels | |
| fabbc7e928dfa64c29dcdf0f795b05246555f4ae Extend MoE support fast path to K1 verification | |
| 388d82de2abe418e73380ba250270d3abc62ac12 ROCm: optimize exact small WNA16 SiLU activation | |
| 91fab4e6dcaa683911655630dae8a5b140a7cb91 [Bugfix][ROCm][MLA] Normalize upstream FlashAttention LSE layout | |
| 838616875c5dd4913d9f753221bf05f64cb7a7ed ROCm: register safe attention merge environment flag | |