Späť na Katalóg

MultiSocial

Dataset

Predstavujeme MultiSocial – prvý viacjazyčný (22 jazykov) a multiplatformový (5 platforiem sociálnych médií) dataset určený na testovanie (benchmarking) detekcie generovaného textu strojmi v prostredí sociálnych médií. Obsahuje 472 097 textov, z ktorých približne 58-tisíc napísali ľudia a zhruba rovnaký počet vygeneroval každý zo siedmich viacjazyčných veľkých jazykových modelov (LLM) - aya-101, Mistral-7B-Instruct-v0.2, gpt-3.5-turbo-0125, v5-Eagle-7B-HF, vicuna-13b, opt-iml-max-30b, Llama-2-70b-chat-hf

Obmedzený prístup
Spolupracovali
Jazyk
sk and other
Modalita
Text
Doména
News
Úloha
Detekcia generovaného textu