Mallit
GLM-5.2-NVFP4-REAP-Recall-N172 ja Hybrid-versiot julkaistu 23. elokuuta 2026
Uudet GLM-5.2-pohjaiset mallit on julkaistu 23.8.2026. Ne hyödyntävät NVFP4-kvantisointia ja Mixture-of-Experts -arkkitehtuuria [1, 2].
GLM-5.2-NVFP4-REAP-Recall-N172 on julkaistu 23.8.2026. Malli on tyypiltään text-generation ja se käyttää transformers-kirjastoa [1].
Toinen julkaistu versio on GLM-5.2-NVFP4-TR3-Hybrid, joka on optimoitu vLLM-päättelyä varten [2]. Molemmat mallit käyttävät NVFP4-kvantisointia [1, 2].
Mallit perustuvat GLM-5.2-NVFP4-pohjamalliin. Ne hyödyntävät Mixture-of-Experts -tekniikkaa ja siinä on käytössä MLA-KV-cache [1, 2].
Molemmat julkaistut mallit on lisensoitu MIT-lisenssillä [1, 2]. Ne ovat yhteensopivia eri päättelyympäristöjen kanssa [1].
Kvantisointitapaan kuuluu 4-bit-taso ja se hyödyntää myös 8-bit-ominaisuuksia [1]. Mallit on toteutettu safetensors-muodossa [1, 2].
Käyttäjän kannattaa testata näitä malleja vLLM-ympäristössä, jos haluaa hyödyntää Hybrid-version optimointeja [2].