Späť na Novinky
Oznámenie

Čo je nové v katalógu SLAIH? Päť zdrojov, ktoré sa oplatí pozrieť

SLAIH5 min čítaniaUverejnené 30. júla 2025

Jedným z hlavných cieľov SLAIH je uľahčiť objavovanie kvalitných zdrojov pre umelú inteligenciu a spracovanie prirodzeného jazyka v slovenčine. V tomto článku by sme vám radi predstavili niekoľko nových prírastkov do nášho katalógu, ktoré stoja za pozornosť. Či už vyvíjate aplikácie založené na veľkých jazykových modeloch, pracujete na automatickom rozpoznávaní reči alebo experimentujete s viacjazyčnými modelmi, tieto zdroje by vám rozhodne nemali uniknúť.

MiniMax-M3: Nový silný multimodálny model

Jedným z najzaujímavejších prírastkov v katalógu je MiniMax-M3. Ide o moderný multimodálny foundation model schopný pracovať s textom, obrázkami aj videom. Model bol sprístupnený ako open-weight riešenie na nekomerčné využitie a rýchlo si získal pozornosť vďaka podpore dlhého kontextu a veľmi dobrým schopnostiam v oblasti uvažovania.

Pre slovenskú komunitu je zaujímavý najmä tým, že podľa prvých hodnotení dosahuje veľmi dobré výsledky aj na slovenčine. Predstavuje tak alternatívu k uzavretým komerčným modelom.

Ak experimentujete s viacjazyčnými AI asistentmi, porozumením dokumentov alebo multimodálnymi aplikáciami, MiniMax-M3 určite stojí za vyskúšanie.

Datasety SkMTEB: Viac než len benchmark

Mnohí z vás už pravdepodobne poznajú SkMTEB. Ide o prvý komplexný benchmark pre slovenské textové embeddingy, ktorý bol nedávno odprezentovaný na ACL 2026. Benchmark hodnotí embeddingové modely na 31 datasetoch pokrývajúcich sedem rôznych typov úloh, čím vytvára štandardizovaný spôsob ich porovnávania.

Často sa však zabúda na to, že samotné datasety sú voľne dostupné.

Namiesto vytvárania vlastných evaluačných dát máte k dispozícii rozsiahlu kolekciu kvalitných slovenských datasetov pripravených na okamžité použitie.

GEST: Ako odhaliť rodové stereotypy v jazykových modeloch

S rastúcim využívaním umelej inteligencie už nestačí hodnotiť iba výkon modelov. Rovnako dôležité je rozumieť ich obmedzeniam a potenciálnym predsudkom.

GEST je manuálne vytvorený benchmark určený na hodnotenie rodových stereotypov v jazykových modeloch a systémoch strojového prekladu. Na rozdiel od väčšiny existujúcich benchmarkov, ktoré sa zameriavajú predovšetkým na angličtinu, GEST pokrýva angličtinu a deväť slovanských jazykov vrátane slovenčiny.

Dataset obsahuje príklady reprezentujúce 16 bežných rodových stereotypov, napríklad „Ženy sú krásne“ alebo „Muži sú lídri“. Umožňuje systematicky skúmať, do akej miery jazykové modely tieto stereotypy reprodukujú pri generovaní alebo preklade textu. GEST je cenným nástrojom pre každého, kto chce pri vývoji AI systémov zohľadňovať nielen ich presnosť, ale aj férovosť a zodpovednosť.

SloPalSpeech: Jeden z najväčších slovenských rečových korpusov

Rozpoznávanie reči zaznamenalo v posledných rokoch obrovský pokrok, no kvalitné tréningové dáta sú pre menšie jazyky stále jedným z najväčších limitov.

SloPalSpeech je rozsiahly slovenský rečový korpus vytvorený z nahrávok parlamentných vystúpení. Obsahuje viac ako 2 800 hodín synchronizovaných zvukových nahrávok a prepisov, čím patrí medzi najväčšie verejne dostupné slovenské datasety svojho druhu. Ak pracujete na automatickom rozpoznávaní reči alebo vyvíjate hlasové technológie pre slovenčinu, ide o jeden z najhodnotnejších dostupných zdrojov.

Piper: Open-source syntéza reči pre slovenčinu

Ďalším zaujímavým prírastkom je Piper Ide o open-source systém na syntézu reči (text-to-speech), ktorý podporuje slovenčinu spolu s desiatkami ďalších jazykov. Piper je nenáročný na hardvér, dokáže bežať lokálne a je vhodný najmä tam, kde je dôležitá ochrana súkromia, nízka latencia alebo offline prevádzka. Pre vývojárov hlasových asistentov, prístupnostných technológií či aplikácií využívajúcich syntézu reči predstavuje jednoduché a praktické riešenie, ktoré možno ľahko integrovať do existujúcich projektov.

Objavte ďalšie zdroje

Predstavených päť zdrojov je len malou ukážkou toho, čo dnes nájdete v katalógu SLAIH. Neustále pribúdajú nové modely, datasety, benchmarky aj nástroje, ktoré odrážajú rýchly vývoj slovenského AI ekosystému.

Našou ambíciou je, aby sa SLAIH stal prvým miestom, ktoré navštívite vždy, keď budete hľadať zdroje pre slovenské jazykové technológie – či už ste výskumník, vývojár alebo firma budujúca AI riešenia pre slovenčinu.

Prezrite si katalóg, objavte nové zdroje a dajte nám vedieť, ak poznáte model, dataset alebo nástroj, ktorý by v SLAIH nemal chýbať. Spoločne môžeme budovať silnejší a lepšie prepojený ekosystém slovenského NLP a rečových technológií.