Koodi · Python-kirjasto
Tokenizers-kirjasto tarjoaa nopean tavan tekstin käsittelyyn Rust-pohjaisella toteutuksella
Tokenizers 0.23.1 on julkaistu 27.4.2026. Kirjasto mahdollistaa tekstin tokenisoinnin erittäin suurella nopeudella [1].
Tokenizers-kirjasto tarjoaa toteutuksen nykyään käytetyimmille tokenizer-malleille. Se sisältää neljä valmista tokenizeria, kuten Bert WordPiece ja kolme yleisintä BPE-versiota [1].
Kirjasto on suunniteltu tutkimuskäyttöön ja tuotantoon. Se hoitaa esikäsittelyn, kuten tekstin katkaisun, täytön ja mallin vaatimien erikoismerkkien lisäämisen [1].
Paikallisen ajon kannalta kirjasto on merkittävä sen nopeuden vuoksi. Rust-toteutuksen ansiosta palvelimen CPU:lla voi tokenisoida yhden gigatavun tekstiä alle 20 sekunnissa [1].
HuggingFace on kirjaston takana. Kirjasto tarjoaa myös normalisoinnin, joka sisältää kohdistusten seurannan [1].
Kirjaston käyttö on helppoa, mutta se on samalla erittäin monipuolinen. Käyttäjä voi kouluttaa uusia sanastoja kirjaston avulla [1].
Lukijan kannattaa hyödyntää tätä kirjastoa, jos tarvitaan suorituskykyä tekstin esikäsittelyssä. Kirjasto on saatavilla pip-asennuksella [1].