Media · Puheentunnistus
Uudet avoimet puheentunnistusmallit laajentavat monikielistä tukea ja paikallista käyttöä
SraVaani-1.0 on julkaistu 11.8.2026 ja se tukee useita kieliä. Shenava-Koochik-v1.0 on puolestaan erikoistunut persiaa [1].
ARTPARK-IISc on julkaissut SraVaani-1.0 -mallin, joka on tarkoitettu automaattiseen puheentunnistukseen [2]. Malli on julkaistu 11.8.2026 [2].
SraVaani-1.0 tukee useita kieliä, kuten hindiä, kannadaa, telugua, bengalia ja assamia [2]. Se on koulutettu Vaani-aineistolla [2].
Taustalla on arXiv-julkaisu 2603.28714 [2]. Malli on osa laajempaa puheentunnistuksen kehitystä [2].
Reza2kn on julkaissut Shenava-Koochik-v1.0 -mallin, joka on suunnattu persian kielen puheentunnistukseen [1]. Se on julkaistu 11.8.2026 [1].
Shenava-Koochik-v1.0 perustuu NVIDIA:n FastConformer-malliin [1]. Se on optimoitu toimimaan laitteella eli on on-device-yhteensopiva [1].
Molemmat mallit on julkaistu avoimina malleina. Käyttäjien kannattaa hyödyntää näitä uusia vaihtoehtoja paikalliseen puheentunnistukseen [1, 2].