Späť na Katalóg

Slovak STS Synthetic

Dataset

Ide o syntetický slovenský súbor údajov určený pre úlohu sémantickej textovej podobnosti (STS). Každý pár pozostáva z vety zo súboru údajov Slovak Summarization a vygenerovanej vety vytvorenej nástrojom GPT-5. GPT-5 mal vygenerovať šesť viet na každú pôvodnú vetu (zo SlovakSum) pre každé skóre podobnosti (0-5). Každá pôvodná veta musela obsahovať aspoň 60 znakov a nie viac ako 200 znakov a musela pozostávať z jednej vety. Celkovo bolo vygenerovaných 6 594 párov viet. Po vygenerovaní viet bola z súboru údajov vybraná náhodná vzorka 300 párov viet. Z každého skóre podobnosti bolo vybraných päťdesiat párov. Vzorku anotovali traja anotátori. Každý anotátor dostal informácie o úlohe a vysvetlenia pre každé skóre STS, ako aj päť vzorových viet s vysvetleniami v pokynoch pre anotáciu. Všetci traja anotátori nezávisle anotovali rovnakú sadu 300 párov viet. Výsledný súbor údajov je rozdelený na dve časti: rozdelenie vlaku pozostávajúce z neanotovanej časti a testovacie rozdelenie pozostávajúce z anotovanej časti. Rozdelenie vlaku: { "sentence1": "Vrtuľník lietal nad národným parkom bez povolenia ochranárov, sťažovať sa chcú aj obce", "sentence2": "Vrtuľník lietal nad národným parkom bez súhlasu ochranárov a obce sa chcú tiež sťažovať.", "similarity_score": "4.666666667"}

Open-source
Spolupracovali
Licencia
CC-BY-NC-4.0
Jazyk
sk
Modalita
Text
Úloha
Sémantická textová podobnosť