Colibrì 是一款可立即運作的推理引擎,也是一個開放的研究平台。它的主要目標是在整個軟硬體邊界(包括模型格式、記憶體層次結構、儲存 I/O、記憶體佈局、調度、核心、推測運算以及 CPU/GPU 重疊)上提升推理效能,從而使大型模型對稀缺硬體的依賴性更低,運行成本也更低。
Colibrì 將 VRAM、RAM 和儲存視為一個單一的多層級結構,並且它特意被用作測試激進系統理念的場所——因此,速度方面沒有服務級別協議 (SLA),語義方面則有嚴格的保證:實驗必須通過可複現的端到端測量來證明其有效性,並且默認策略絕不會悄無聲息地改變模型模型絕對不會悄無聲息地改變模型。快速記憶體不足可能會降低速度;但它絕不能悄無聲息地重新定義模型。
已支援
- GLM-5.2/5.3
- GLM-5.3-Flash
- Qwen3.8-Flash-Next
- Kimi K3
- Inkling
- DeepSeek V4 Flash
- DeepSeek V4.1 Flash
- Qwen3.6
- OLMoE
重點更新
- 增加第 9 個 AI 引擎 - DeepSeek V4.1 Flash
https://github.com/JustVugg/colibri
Picture Source
justvugg

留言
張貼留言