Katalóg
Prehľad datasetov, modelov a nástrojov pre spracovanie slovenského jazyka.
Katalóg slúži ako centrálne miesto, kde nájdeš existujúce zdroje pre slovenčinu a využiješ ich pri výskume alebo vývoji.
Obsah priebežne aktualizujeme v spolupráci s komunitou.
BGE-M3
Model
Spolupracovali:
University of Science and Technology of China
BAAI
- Modalita
- Text
- Jazyk
- sk, eng, other
Open-source
ANLI SK
Dataset
Spolupracovali:
NLP KInIT
DFKI
- Modalita
- Text
- Doména
- General
- Úloha
- Natural language inference
- Jazyk
- sk
- Licencia
- CC-BY-NC-SA 4.0
Open-source
MultiSocial
Dataset
Spolupracovali:
- Modalita
- Text
- Doména
- News
- Úloha
- Detekcia generovaného textu
- Jazyk
- sk and other
Obmedzený prístup
skMTEB
Dataset
Spolupracovali:
SlovakNLP Community
- Modalita
- Text
- Doména
- Other
- Úloha
- Benchmarking
- Jazyk
- sk
- Licencia
- CC-BY-4.0
SloPalSpeech
Dataset
Spolupracovali:
- Modalita
- Reč/audio
- Doména
- Politics
- Úloha
- Automatické rozpoznávanie reči
- Jazyk
- sk
- Licencia
- CC-by-4.0
GEST
Dataset
Spolupracovali:
- Modalita
- Text
- Doména
- General
- Úloha
- Rodovo stereotypné uvažovanie v jazykových modeloch a systémoch strojového prekladu
- Jazyk
- eng, sk, by, hrv, cz, pl, rus, srb, si, ua
- Licencia
- Apache 2.0
Whisper-large-v3-sk
Model
Spolupracovali:
NLP KInIT
KInIT
- Modalita
- Reč/audio
- Úloha
- Automatické rozpoznávanie reči
- Jazyk
- sk
- Licencia
- apache-2.0
Whisper-large-v3-turbo-sk
Model
Spolupracovali:
NLP KInIT
KInIT
- Modalita
- Reč/audio
- Úloha
- Automatic Speech Recognition
- Jazyk
- sk
- Licencia
- mit
Chýba tu tvoj dataset, model alebo nástroj?