小米 LLM-Core 團隊的研究人員在 arXiv 上發布了 HySparse2(arXiv:2609.26368),該論文提出了一種混合稀疏注意力架構,專門針對現有 Transformer 模型難以處理的長運行智能體的特性而設計,HySparse2 在 100 萬個 token 的情況下,將預填充計算量減少了 5.02 倍,並將鍵值快取儲存空間從 12.09 GB 減少到 2.69 GB,同時在智能體檢索基準測試中保持了顯著的準確率。
在外層,鍵值橋接採用了 YOCO 式的自解碼器和交叉解碼器結構,但僅橋接全注意力層,自解碼器使用混合滑動視窗注意力(SWA),而交叉解碼器使用混合稀疏注意力,交叉解碼器中全注意力層的鍵值快取由自解碼器中全注意力層的隱藏狀態產生。在內層,HySparse2 保留了 HySparse 的核心鍵值重複使用設計,並進行了兩項改進。
- 將區塊級稀疏性替換為詞元級稀疏性,以實現更精細的長上下文檢索
- 從稀疏層中移除了獨立的SWA分支,而是強制將最近詞元的滑動視窗納入稀疏選擇
在 80B-A3B MoE 模型上,HySparse2 在長上下文檢索和多輪代理任務上的效能優於 HySparse 和 Hybrid SWA,同時顯著減少了預先填充的運算量和KV快取的儲存量。
Jianyu Wei, Yizhao Gao, Qihao Zhang, Shimao Chen, Zhengju Tang, Yu Cheng, Shengjie Zhou, Zihan Jiang, Yifan Song, Hailin Zhang, Liang Zhao, Bo Yang, Gang Wang, Shijie Cao, Fuli Luo
https://arxiv.org/pdf/2609.26368
Picture Source
Xiaomi

留言
張貼留言