通義千問發布 Qwen 3.8 Flash


阿里巴巴通義千問團隊發布 Qwen3.8-Flash-Next,從注意力、殘差、嵌入和優化四個方面對模型進行了系統升級,提高了模型能力,同時進一步優化了計算效率、模型容量和訓練穩定性,這是一個多模態 MoE 模型,同時也是 Qwen4 架構的早期預覽版。

  • 注意力機制:一種 GDN + QSA 混合架構。閘控 DeltaNet (GDN) 有效率地壓縮歷史資料;Qwen 稀疏注意力機制 (QSA)使用壓縮的輕量級索引器以微塊粒度選擇重要上下文,從而大幅降低長序列注意力機制的開銷。
  • 殘差:門控殘差 (GR)將殘差流擴展為 4 個分支,並透過動態閘控制讀取和寫入,從而增強跨層資訊流和訓練穩定性。
  • 嵌入:N-gram 嵌入利用本地上下文查找表,以極少的額外計算擴展模型容量;嵌入表可以卸載到主機內存,並通過異步預取與模型計算重疊。
  • 最佳化:使用Muon 優化器,圍繞正交化精度、Muon 和 AdamW 之間的分工以及融合參數的拆分進行改進,並針對新架構重新調整縮放規律。
Qwen3.8-Flash-Next 擁有一個1250 億參數的主模型,並輔以510 億參數的N-gram 字嵌入,每個詞元啟動60 億個參數。與 Qwen3.7-Plus 相比,Qwen3.8-Flash-Next 大幅降低了訓練和推理成本——訓練時間僅為原來的九分之一左右,卻在編碼和辦公任務方面表現出色。

Qwen3.8-Flash-Next 使用 Muon Optimizer 進行訓練,並在將 Muon 應用於大規模模型訓練的三個關鍵方面進行了進一步改進:正交化精度、Muon 和 AdamW 之間的參數分配以及分裂融合參數矩陣。


Picture Source
Qwen

留言