Katalóg

Prehľad datasetov, modelov a nástrojov pre spracovanie slovenského jazyka.

Katalóg slúži ako centrálne miesto, kde nájdeš existujúce zdroje pre slovenčinu a využiješ ich pri výskume alebo vývoji.

Obsah priebežne aktualizujeme v spolupráci s komunitou.

MiniMax-M3

Model
Spolupracovali:
MiniMax
Modalita
Iné
Jazyk
sk, eng, other

BGE-M3

Model
Spolupracovali:
University of Science and Technology of China
BAAI
Modalita
Text
Jazyk
sk, eng, other
Open-source

ANLI SK

Dataset
Spolupracovali:
Modalita
Text
Doména
General
Úloha
Natural language inference
Jazyk
sk
Licencia
CC-BY-NC-SA 4.0
Open-source

MultiSocial

Dataset
Spolupracovali:
Modalita
Text
Doména
News
Úloha
Detekcia generovaného textu
Jazyk
sk and other
Obmedzený prístup

skMTEB

Dataset
Spolupracovali:
SlovakNLP Community
Modalita
Text
Doména
Other
Úloha
Benchmarking
Jazyk
sk
Licencia
CC-BY-4.0

SloPalSpeech

Dataset
Spolupracovali:
Modalita
Reč/audio
Doména
Politics
Úloha
Automatické rozpoznávanie reči
Jazyk
sk
Licencia
CC-by-4.0

GEST

Dataset
Spolupracovali:
Modalita
Text
Doména
General
Úloha
Rodovo stereotypné uvažovanie v jazykových modeloch a systémoch strojového prekladu
Jazyk
eng, sk, by, hrv, cz, pl, rus, srb, si, ua
Licencia
Apache 2.0

Whisper-large-v3-sk

Model
Spolupracovali:
Modalita
Reč/audio
Úloha
Automatické rozpoznávanie reči
Jazyk
sk
Licencia
apache-2.0

Whisper-large-v3-turbo-sk

Model
Spolupracovali:
Modalita
Reč/audio
Úloha
Automatic Speech Recognition
Jazyk
sk
Licencia
mit

Chýba tu tvoj dataset, model alebo nástroj?