A Microsoft Research bemutatott egy forradalmi AI modellt, a BitNet b1.58 2B4T-t – az első nyílt forráskódú, natívan 1-bites nagy nyelvi modellt 2 milliárd paraméteres skálán. A modell szinte bármilyen modern CPU-n futtatható GPU nélkül, mindössze 0,4 GB memóriával, miközben teljesítményben felveszi a versenyt a sokkal erőforrásigényesebb, teljes precizitású modellekkel.
Mi az az 1-bites modell?
A hagyományos LLM-ek 16 vagy 32 bites lebegőpontos értékekkel tárolják a súlyokat (weights – a modell belső paraméterei). A BitNet b1.58 ezzel szemben minden egyes súlyt mindössze három érték egyikére korlátoz: -1, 0 vagy +1 – ezt nevezzük ternerális kvantálásnak. Kulcsfontosságú különbség, hogy a BitNet nem egy meglévő modell utólagos tömörítése (post-training quantization), hanem eleve ezekkel a korlátokkal lett betanítva, 4 trillió token felhasználásával.
Miért fontos?
A bitnet.cpp nevű nyílt forráskódú inference framework (következtetési keretrendszer) segítségével a modell simán fut Raspberry Pi-n és Apple M2 chipen egyaránt. A Microsoft mérései szerint a BitNet b1.58 körülbelül 12-szer energiahatékonyabb a hasonló méretű Qwen2.5-höz képest, és matematikai benchmarkon (GSM8K) felülmúlja a Meta Llama 3.2 1B és a Google Gemma 3 1B modelleket is. A modell MIT licensz alatt, ingyenesen elérhető a Hugging Face platformon.
Mire érdemes figyelni?
A hatékonysági előnyök kizárólag a bitnet.cpp keretrendszerrel érhetők el – a standard Transformers könyvtáron keresztüli futtatás nem hozza az ígért sebességet és energiamegtakarítást. GPU-s futtatás egyelőre nem támogatott, és a Microsoft nem ajánlja kereskedelmi felhasználásra, csak kutatási célra. Az NPU-támogatás (mobil eszközök neurális feldolgozóegysége) fejlesztés alatt áll, ami a jövőben okostelefonokon is lehetővé teheti a helyi futtatást.
Forrás: TechCrunch, InfoQ