Koodi · Python-kirjasto
Tokenizers-kirjasto tarjoaa nopean tavan tekstin käsittelyyn Rust-pohjaisella toteutuksella
Tokenizers-kirjaston versio 0.23.1 on julkaistu 27.4.2026. Kirjasto mahdollistaa tekstin tokenisoinnin erittäin suurella nopeudella [1].
Tokenizers-kirjasto tarjoaa toteutukset nykyään käytetyimmille tokenizer-menetelmille. Se on suunniteltu sekä tutkimuskäyttöön että tuotantoon [1].
Kirjasto on erittäin nopea, sillä se hyödyntää Rust-pohjaista toteutusta. Palvelimen CPU:lla voi tokenisoida yhden gigatavun tekstiä alle 20 sekunnissa [1].
Paikallisen ajon kannalta kirjasto on merkittävä, koska se hoitaa esikäsittelyn, kuten tekstin katkaisun, täyttämisen ja erikoisten merkkien lisäämisen [1].
Kirjasto tukee neljää valmiiksi valmisteltua tokenizeria, joista ovat Bert WordPiece ja kolme yleisintä BPE-versiota [1].
HuggingFace on kirjaston takana ja se tarjoaa myös normalisoinnin, joka sisältää alignment-seurannan [1].
Käyttäjän on hyvä hyödyntää kirjastoa, jos tarvitaan tarkkaa tietoa siitä, mikä osa alkuperäisestä lauseesta vastaa tiettyä tokenia [1].
Suosittelemme kirjaston käyttöönottoa, jos tarvitset tehokasta ja monipuolista tekstin käsittelyä paikallisessa ympäristössä [1].