Späť na Katalóg

skLEP

Dataset

skLEP (General Language Understanding Evaluation benchmark for Slovak) je prvý komplexný benchmark špeciálne navrhnutý na hodnotenie modelov porozumenia prirodzenému jazyku (NLU) v slovenčine. Benchmark zahŕňa deväť rôznych úloh, ktoré zahŕňajú výzvy na úrovni tokenov, párov viet a dokumentov, čím ponúkajú dôkladné posúdenie schopností modelu. Na vytvorenie tohto benchmarku sme zostavili nové, originálne súbory údajov prispôsobené pre slovenčinu a dôkladne preložili zavedené anglické zdroje NLU s následnou úpravou rodenými hovoriacimi, aby sme zabezpečili vysokokvalitné hodnotenie. skLEP zahŕňa deväť úloh v troch kategóriách: Úlohy na úrovni tokenov: Označovanie slovných druhov (POS) pomocou univerzálnych závislostí Rozpoznávanie pomenovaných entít pomocou univerzálneho NER (UNER) Rozpoznávanie pomenovaných entít pomocou WikiGoldSK (WGSK) Úlohy s pármi viet: Rozpoznávanie textových skrytostí (RTE) Inferencia prirodzeného jazyka (NLI) Sémantická textová podobnosť (STS) Úlohy na úrovni dokumentov: Klasifikácia nenávistných prejavov (HS) Analýza sentimentu (SA) Odpovedanie na otázky (QA) na základe SK-QuAD

Open-source
Licencia
Nekomerčné využitie
Jazyk
sk
Modalita
Text
Úloha
POS, NER, RTE, NLI, STS, QA, klasifikácia textu