Späť na Katalóg

SloPalSpeech

Dataset

Predstavujeme SloPal, komplexný slovenský parlamentný korpus obsahujúci 330 000 prepisov segmentovaných podľa rečníkov (66 miliónov slov, 220 miliónov tokenov) z rokov 2001 – 2024 s bohatými metadátami vrátane mien rečníkov, rolí a informácií o reláciách. Z tejto kolekcie odvodzujeme SloPalSpeech, 2 806-hodinový súbor údajov o zarovnanej reči so segmentmi až do 30 sekúnd, zostavený pomocou jazykovo-agnostického zarovnávacieho kanála založeného na kotvách a optimalizovaný pre trénovanie ASR založené na Whisper. Doladenie Whisperu na SloPalSpeech znižuje mieru chybovosti slov (WER) až o 70 %, pričom doladený malý model (244 miliónov parametrov) sa blíži k výkonu základného veľkého modelu v3 (1,5 miliardy parametrov) pri 6× menšom počte parametrov. Verejne zverejňujeme textový korpus SloPal, zarovnaný zvuk SloPalSpeech.

Spolupracovali
Licencia
CC-by-4.0
Jazyk
sk
Modalita
Reč/audio
Doména
Politics
Úloha
Automatické rozpoznávanie reči