Paikallisen tekoälyn päivälehti — avoimen painon mallit, työkalut ja rauta

Tiistai 25. elokuuta 2026Aamupainos · klo 7Nro 18

← Takaisin numeroon 18

Työkalut · SGLang-päivitys

SGLang v0.5.18 tuo merkittäviä nopeusparannuksia mallien lataukseen ja päättelyyn

Uusi versio v0.5.18 julkaistiin 24.8.2026. Päivitys sisältää useita uusia malleja ja optimointeja suorituskyvylle [1].

SGLang v0.5.18 tuo merkittäviä nopeusparannuksia mallien lataukseen ja päättelyyn Alkuperäinen latausaika 84.8 s Optimoidun latausajan ero 35.6 s

SGLang-ajomoottori on julkaissut version v0.5.18, joka sisältää 710 pullopyyntöä (PR) 212 kehittäjältä [1]. Päivitys tuo mukanaan useita uusia malleja, kuten Muse Glimmer, Intern-S2-Mobius, SANA-Video, LingBot-Video-MoE, LTX-2.5 sekä Cosmos3 Edge & Distilled [1].

Uusi ominaisuus mahdollistaa checkpoint-sivujen lataamisen taustalla samalla kun CUDA-graafit kaapatuun [1]. Tämä nopeuttaa Qwen3-32B-mallin latausta H100-laitteistolla 8,6–11,7 % verrattuna sarjalliseen lataukseen [1].

Latausnopeus voi olla jopa 2,38-kertainen verrattuna tavalliseen oletusasetukseen, jolloin aika lyhenee 84,8 sekunnista 35,6 sekuntiin [1]. Tämä on mahdollista käyttämällä --startup-weight-load-mode overlap -asetusta [1].

Päivitys tuo myös optimointeja TP LMHead -toiminnallisuuteen, jossa allgather- ja scatter-operaatiot yhdistetään yhdeksi all-to-all-operaatioksi [1]. DeepSeek-V4-Pro B200 -laitteistolla LMHead-aika laskee 320 mikrosekunnista 169 mikrosekuntiin [1].

TPOT-aika paranee DeepSeek-V4-Pro B200 -laitteistolla 35,67 millisekuntiin 36,97 millisekunnista [1]. Lisäksi FlashInfer MNNVL -tuki parantaa DeepSeek-V4-Flash TP4 -päättelyä Blackwell-laitteistolla jopa 6,9 % pienillä eräkoolla [1].

Käyttäjien kannattaa päivittää SGLang-ajomoottori, jos käytössä on uudempi Blackwell- tai H100-laitteisto, jotta voidaan hyödyntää uudet lataus- ja päättelyoptimoinnit [1]. NVFP4-tarkkuus on nyt käytettävissä myös AMD-laitteistolla --quantization quark_mx -asetuksella [1].

Lähteet