Koodi · Python-kirjasto
AutoGPTQ tarjoaa helppokäyttöisen tavan kvantisoida suuria kielimalleja GPTQ-algoritmin avulla
AutoGPTQ 0.7.1 on julkaistu ja se mahdollistaa paino-vain-kvantisoinnin käyttämällä käyttäjäystävällisiä rajapintoja [1]. Paketti tukee myös Marlin-ydintä mallien lataamisessa [1].
AutoGPTQ on helppokäyttöinen paketti suurten kielimallien kvantisointiin [1]. Se perustuu GPTQ-algoritmiin, joka kohdistuu mallien painoihin [1].
Kirjasto mahdollistaa mallien suorituskyvyn optimoinnin käyttämällä Marlin-int4/fp16 -matriisikertojalkaytimiä [1]. Tämä onnistuu käyttämällä use_marlin=True -argumenttia mallia ladattaessa [1].
Taustalla toimii GPTQ-algoritmi, joka on suunniteltu paino-vain-kvantisointiin [1]. Kirjasto on julkaistu PyPI-palvelussa [1].
Integraatio on tehty useisiin suosittuihin työkaluihin [1]. Transformers-, optimum- ja peft-kirjastot tukevat nyt AutoGPTQ-integraatiota [1].
Paikalliseen ajoon kirjasto on keskeinen, koska se mahdollistaa mallien ajamisen ja hienosäädön GPTQ-muodossa [1]. Tämä tekee mallien käytöstä helpompaa laajalle käyttäjäkuntaalle [1].
Lukijan kannattaa hyödyntää AutoGPTQ-integraatiota, jos tarvitaan tehokasta kvantisointia Transformers-ekosysteemissä [1]. Tarkista kirjaston versio 0.7.1 yhteensopivuuden varmistamiseksi [1].