Koodi · Python-kirjasto
Tokenizers-kirjasto tarjoaa tehokkaan tavan tekstin käsittelyyn Rust-pohjaisella toteutuksella
Tokenizers-kirjaston versio 0.23.1 on julkaistu 27.4.2026 [1]. Kirjasto tarjoaa nopean tavan kouluttaa uusia sanastoja ja suorittaa tokenisointia [1].
Tokenizers-kirjasto tarjoaa toteutuksen nykyisin käytetyimmille tokenizer-malleille [1]. Se on suunniteltu sekä tutkimuskäyttöön että tuotantoon [1].
Kirjasto on erittäin nopea, sillä se hyödyntää Rust-pohjaista toteutusta [1]. Palvelimen CPU:lla voi tokenisoida yhden gigatavun tekstiä alle 20 sekunnissa [1].
Paikallisen tekoälyn ajossa kirjasto on keskeisessä roolissa tekstin esikäsittelyssä [1]. Se hoitaa muun muassa tekstin katkaisun, täyttämisen ja erikoismerkkien lisäämisen [1].
Kirjasto tukee neljää valmiiksi valmisteltua tokenizeria, joista ovat Bert WordPiece ja kolme yleisintä BPE-versiota [1]. Normalisointi sisältää myös kohdistusten seurannan [1].
Taustalla toimii HuggingFace, joka on kehittänyt kirjaston Rust-toteutuksen päälle [1]. Kirjasto on avointa lähdekoodia [1].
Käyttäjän kannattaa hyödyntää tätä kirjastoa, jos tarvitaan nopeaa ja monipuolista tekstin esikäsittelyä paikallisessa ajossa [1].
Kirjaston asennus onnistuu suoraan pip-paketinhallinnan kautta [1].