Työkalut · Llama.cpp päivitys
Llama.cpp b10615 tuo Metal-pohjaisen Flash-Attention-optimoinnin Apple-laitteille
Llama.cpp-projektiin on julkaistu b10615-versio 24.8.2026 [1]. Päivitys sisältää uusia optimointeja Metal-rajapinnan Flash-Attention-vektoreille [1].
Llama.cpp-ohjelmistoon on julkaistu uusi b10615-versio 24.8.2026 [1]. Päivitys keskittyy erityisesti Metal-rajapinnan Flash-Attention-vektorien optimointiin [1].
Kehittäjät ovat lisänneet 53 uutta f16-instanssia (Q, NE) Flash-Attention-vektoreille [1]. Tämä nostaa vektorien määrän 80:stä 133:een [1].
Päivityksessä on otettu käyttöön uusi tuning-taulukko ja dispatch-kytkentä Flash-Attention-vektoreille [1]. Lisäksi on lisätty SMEM cap fallback -mekanismi [1].
Optimointi koskee myös kvantisoituja KV-välimuisteja (quantized KV caches) [1]. Kehittäjät ovat laajentaneet Flash-Attention-vektorien hienosäätöä tähän tarkoitukseen [1].
Uusi työkalu mahdollistaa Flash-Attention-vektorien (Q, NE) skannauksen, pakkauksen ja taulukon tuottamisen [1]. Työkalu tukee myös laitteetason tunnistusta offline-hienosäädössä [1].
Hienosäätö on laajennettu kattamaan myös M1 Pro, M2 Ultra ja M5 Max -laitteet [1]. Käyttäjien kannattaa päivittää ohjelmisto hyödyntääkseen nämä laitteistokohtaiset suorituskykyparannukset [1].