SloPalSpeech
Predstavujeme SloPal, komplexný slovenský parlamentný korpus obsahujúci 330 000 prepisov segmentovaných podľa rečníkov (66 miliónov slov, 220 miliónov tokenov) z rokov 2001 – 2024 s bohatými metadátami vrátane mien rečníkov, rolí a informácií o reláciách. Z tejto kolekcie odvodzujeme SloPalSpeech, 2 806-hodinový súbor údajov o zarovnanej reči so segmentmi až do 30 sekúnd, zostavený pomocou jazykovo-agnostického zarovnávacieho kanála založeného na kotvách a optimalizovaný pre trénovanie ASR založené na Whisper. Doladenie Whisperu na SloPalSpeech znižuje mieru chybovosti slov (WER) až o 70 %, pričom doladený malý model (244 miliónov parametrov) sa blíži k výkonu základného veľkého modelu v3 (1,5 miliardy parametrov) pri 6× menšom počte parametrov. Verejne zverejňujeme textový korpus SloPal, zarovnaný zvuk SloPalSpeech.
- Spolupracovali
- Licencia
- CC-by-4.0
- Jazyk
- sk
- Modalita
- Reč/audio
- Doména
- Politics
- Úloha
- Automatické rozpoznávanie reči