File size: 1,595 Bytes
956a1c1
 
 
 
 
 
 
 
 
 
 
 
 
 
 
0da14e4
9d29a15
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
c3f74efb866edba8892f18506b1c4febc157a799  [Bugfix][Kernel][ROCm] Fix Wave32 LDS overflow in top-k merge launch
abefcfad484b85af6f57703c815a5f169807a3fd  research(profile): annotate Ling decoder families
a73488d0243736797f75412ad23549cada767a47  Revert "research(profile): annotate Ling decoder families"
c7e91b99ce98786dad42f830965759e1ff1f74ac  Reapply "research(profile): annotate Ling decoder families"
d8481aec96d9a3caca7323f5d6b5bcef3f0fb8ed  Revert "Reapply "research(profile): annotate Ling decoder families""
8457fad14b028e1c443cb4c5998df377873e3d95  Enable native merge attention states on ROCm
8743a17f147d899d670af9b808d5bf93a5bf26fb  Revert "Enable native merge attention states on ROCm"
7deddd0a87a94637e4fbe2d309a484ab9a04e33f  Add opt-in safe ROCm attention merge
3715c596c1a0df9d42d133a61d14dbed5105ab0a  Handle MLA LSE layouts in safe ROCm merge
f6773b23215df5aa2a8de5050bd2f9b6fa53b727  ROCm: route uniform MLA verify blocks through causal decode
15a4190ddf0a363e08d518345a8f3e23e8bc8bd9  Optimize decode WNA16 expert assignment
abfff126e0698d98f1872f87f501d36a19382240  Optimize single-token MoE reduction
928e725a9dbcdbea0bf6c914c8b3fe93f08b0d3f  Optimize K2 verification MoE support kernels
fabbc7e928dfa64c29dcdf0f795b05246555f4ae  Extend MoE support fast path to K1 verification
388d82de2abe418e73380ba250270d3abc62ac12  ROCm: optimize exact small WNA16 SiLU activation
91fab4e6dcaa683911655630dae8a5b140a7cb91  [Bugfix][ROCm][MLA] Normalize upstream FlashAttention LSE layout
838616875c5dd4913d9f753221bf05f64cb7a7ed  ROCm: register safe attention merge environment flag