智譜發布 GLM-5.3,這是基於 GLM 5.2 訓練後的擴展工作版本,根據多項測試顯示,在複雜編碼和長時程任務方面表現更佳。
- 更強大的編碼能力: GLM-5.3 是目前功能最強大的開源權重模型,在智譜內部的 Z.ai 程式碼基準測試中,其效能比 GLM-5.2 提升了 50%。此外,它在包括 Terminal Bench 3.0 和 Agents' Last Exam 在內的公開基準測試中也達到了開源軟體的最高水準。
- 網路能力的快速提升:隨著訓練後規模的擴大,網路能力的提升速度超出了預期。 GLM-5.3 在 CyberGym 平台上的漏洞發現方面處於領先水平,其優勢在攻擊鏈上游體現得最為顯著,在攻擊基準測試中,其性能是 GLM-5.2 的兩倍以上。
- 開源:智譜將在發布兩週後,待安全評估和加固完成後,公佈重量數據。
新興網路能力
作為後訓練的一部分,智譜將漏洞發現資料和環境引入訓練模型中,GLM-5.3 不僅僅提高了識別孤立漏洞的能力,它還開始能夠推理多個漏洞利用階段,並為完整的漏洞鏈制定連貫的計劃。
在 CyberGym 測試中,GLM-5.3 從白盒原始碼開始,透過觸發故障來測試模型能否識別和驗證漏洞,其得分為 84.5%,高於 GLM-5.2 的 77.2%,是該基準測試中的最佳成績,領先於 Mythos 5 (83.8%) 和 GPT-5.6%)。在 ExploitBench 測試中,GLM-5.3 需要對真實漏洞及其利用進行更深入的推理,其得分為 54.4%,是 GLM-5.2 (24.4%) 的兩倍多,而 Mythos 5 和 GPT-5.6 Sol 的得分分別為 78.0% 和 76.5%。在 ExploitGym 測驗中,GLM-5.3 在兩小時內完成了 105 個任務,六小時內完成了 130 個任務,而 GLM-5.2 則分別只完成了 29 個和 39 個任務。 ExploitGym 測試用於衡量模型在時間歸一化預算下能夠完成的漏洞任務數量。
Oicture Source
z.ai

留言
張貼留言