A Google kutatói bemutatták a TurboQuant eljárást, amely képes az AI modellek memória igényét drasztikusan, akár a hatodára csökkenteni a pontosság legkisebb romlása nélkül. Ez az áttörés radikálisan felgyorsíthatja a jövő digitális asszisztenseit és keresőmotorjait, miközben a hardveres erőforrásokat is kíméli.
A technológia a nagy dimenziójú vektorok tömörítésére fókuszál, amelyek az AI „gondolkodásának” alapkövei. A TurboQuant két izgalmas megoldást, a PolarQuant és a QJL algoritmusokat ötvözi. Míg az előbbi polárkoordinátákba forgatja az adatokat a hatékonyabb tárolásért, az utóbbi egy zseniális, mindössze 1 bites matematikai trükkel küszöböli ki a maradék hibákat. A tesztek során a Gemma és Mistral modellek H100 GPU-kon futtatva nyolcszoros sebességnövekedést értek el, miközben a kritikus KV cache mérete töredékére zsugorodott.
Ez a fejlesztés nem csupán mérnöki bravúr, hanem alapjaiban változtathatja meg, hogyan skálázzuk az AI-t. Képzeljük el, hogy a Google szintű keresések pillanatok alatt, elképesztő precizitással értelmezik a szándékainkat. A TurboQuant elhozhatja azt a jövőt, ahol a gigantikus modellek is szélsebesen és hatékonyan szolgálják ki az emberiséget.
Forrás: Google