Koodi · Python-kirjasto
Tokenizers-kirjasto tarjoaa nopean tavan tekstin käsittelyyn Rust-pohjaisella toteutuksella
Tokenizers-kirjaston versio 0.23.1 on julkaistu 27. huhtikuuta 2026 [1]. Kirjasto mahdollistaa tekstin tokenisoinnin ja sanastojen koulutuksen erittäin suurella nopeudella [1].
Tokenizers-kirjasto tarjoaa toteutukset nykyään käytetyimmille tokenizer-menetelmille. Se sisältää neljä valmista tokenizeria, kuten Bert WordPiece ja kolme yleisintä BPE-versiota [1].
Kirjasto on suunniteltu tutkimuskäyttöön ja tuotantoon. Se hoitaa esikäsittelyn, kuten tekstin katkaisun, täyttämisen ja erikoismerkkien lisäämisen [1].
Paikalliseen ajoon kirjasto on keskeinen, sillä se mahdollistaa tekstin muuntamisen tokeneiksi ennen mallin käyttöä. Rust-pohjainen toteutus tekee prosessista erittäin nopean [1].
Suorituskyky on merkittävä tekijä, sillä palvelimen CPU:lla voidaan tokenisoida yksi gigatavu tekstiä alle 20 sekunnissa [1].
Taustalla toimii HuggingFacen kehittämä Rust-toteutus, joka takaa suorituskyvyn ja monipuolisuuden [1].
Kirjasto tukee normalisointia, jossa on mukana alignment-seuranta. Tämän avulla voidaan löytää alkuperäisestä lauseesta ne osat, jotka vastaavat tiettyä tokenia [1].
Käyttäjän kannattaa hyödyntää tätä kirjastoa, jos tarvitaan tehokasta ja luotettavaa tekstin esikäsittelyä paikallisessa ajossa. Kirjasto on helppokäyttöinen ja monipuolinen [1].