Če razvijamo aplikacije, ki obdelujejo besedila ali govor, gradimo rešitve na osnovi velikih jezikovnih modelov (VJM) ali iščemo kakovostne podatke za učenje in evalvacijo modelov, hitro pridemo do vprašanja: “Kje najti zanesljive vire za slovenščino?” Za angleščino izbire ne manjka. Pri slovenščini in drugih južnoslovanskih jezikih pa je nabor podatkov, modelov in orodij precej manjši, zato je še toliko pomembneje vedeti, kje lahko najdemo zanesljive in kvalitetne vire.
Ena najpomembnejših vstopnih točk v slovenski ekosistem jezikovnih tehnologij je raziskovalna infrastruktura CLARIN.SI. Infrastruktura ponuja številne prostodostopne vire, ki so uporabni tudi za razvoj sodobnih rešitev umetne inteligence (UI).
Kaj je CLARIN.SI?
CLARIN.SI je slovenska raziskovalna infrastruktura za jezikovne vire in tehnologije ter del evropske infrastrukture CLARIN ERIC. Deluje od leta 2014, koordinira pa jo Institut »Jožef Stefan« skupaj s konzorcijem slovenskih univerz, narodne in univerzitetne knjižnice, institutov, društev in podjetij.
Osnovna naloga infrastrukture je omogočati dostop do kakovostnih jezikovnih virov ter tehnologij za slovenščino in druge jezike. Čeprav so najpogostejši uporabniki infrastrukture raziskovalci, postaja vse pomembnejša tudi za podjetja in razvijalce, ki gradijo rešitve s področja obdelave naravnega jezika, generativne umetne inteligence in govornih tehnologij. Za te namene še posebej pridejo prav naslednje storitve in viri infrastrukture CLARIN.SI:
- Prostodostopne zbirke besedil, učnih in testnih podatkov za razvoj in evalvacijo modelov,
- Prednaučeni modeli in druga prostodostopna orodja za slovenščino,
- Platforme za primerjavo zmogljivosti velikih jezikovnih modelov v slovenščini in sorodnih jezikih,
- Dokumentacija, pregledi obstoječih tehnologij in strokovna podpora.
Repozitorij z več kot 900 odprtimi viri
Osrednja storitev CLARIN.SI je certificiran repozitorij jezikovnih virov in tehnologij. V njem je shranjenih več kot 900 zbirk podatkov, modelov in drugih virov s skupno velikostjo več kot 5 TB. Čeprav repozitorij pokriva približno 90 jezikov, je največ vsebin namenjenih slovenščini in drugim južnoslovanskim jezikom.
Med drugim repozitorij ponuja naslednje vire, ki so še posebej zanimivi za razvijalce:
- Velike zbirke besedil za učenje velikih jezikovnih modelov
- Učne zbirke za prilagajanje modelov za sledenje navodilom
- Viri za govorne tehnologije
- Učne in testne zbirke za razvoj specializiranih modelov
- Prednaučeni in doučeni modeli
Velike zbirke besedil za učenje velikih jezikovnih modelov
Pri razvoju velikih jezikovnih modelov so ključnega pomena kakovostne in raznovrstne zbirke besedil, ki vsebujejo pristna besedila slovenskih govorcev. V repozitoriju so na voljo zbirke besedil, na katerih so med drugim učili tudi slovenske velike jezikovne modele GaMS-3:
- Spletne zbirke besedil CLASSLA-web (v1 in v2): obsežne zbirke besedil, zbrane s slovenskega spleta v letih 2021 in 2024. Najnovejša zbirka CLASSLA-web 2.0 vsebuje približno 2 milijardi besed v 5 milijonih slovenskih besedil. Besedila so označena z informacijami o žanru in temi, kar nam omogoča, da dodatno filtriramo nabor besedil in povečamo svoj nadzor nad tem, s kakšnimi besedili učimo ali testiramo svoje modele.
- Zbirke komentarjev in blogov s spleta Janes: če želimo svoji učni množici dodati še več primerov neknjižnega in pogovornega slovenskega jezika, lahko uporabimo zbirke Janes, ki vsebujejo komentarje z Wikipedije (Janes-Wiki), slovenske bloge (Janes-Blog), komentarje s slovenskih forumov (Janes-Forum) in komentarje na novice (Janes-News). Zbirke zajemajo več kot 80 milijonov besed in pokrivajo objave med leti 2001 in 2017.
- Zbirka slovenskih znanstvenih del OSS: učni množici svojega modela lahko dodamo tudi primere slovenskega akademskega pisanja. Zbirka OSS zajema 2,6 milijarde besed iz več kot 150.000 znanstvenih člankov ter diplomskih, magistrskih in doktorskih del, nastalih med letoma 2000 in 2022. Besedila so jezikoslovno označena in vsebujejo informacije o področjih, ki jih obravnavajo.
- Zbirka parlamentarnih govorov siParl 4.0: bogat prostodostopen vir rabe slovenskega jezika so govori na sejah slovenskega parlamenta. Zbirka siParl zajema prepise več kot milijon govorov (230 milijonov besed) med leti 1990 in 2022, ki so jezikoslovno označeni in opremljeni z bogatimi podatki o govornikih in strankah.
- Zbirka vzporednih slovensko-angleških besedil MaCoCu-sl-en: slovenska besedila so poravnana s svojimi angleškimi različicami, kar olajšuje prilagajanje angleških jezikovnih modelov slovenskemu jeziku. Zbirka vsebuje skoraj 2 milijona poravnanih povedi, ki so bile zbrane s spleta v letih 2021 in 2022.
Učne zbirke za prilagajanje modelov za sledenje navodilom
Potem ko veliki jezikovni model naučimo »govoriti slovensko«, ga moramo še naučiti, da zna odgovarjati na vprašanja. Za ta namen lahko iz repozitorija CLARIN.SI prenesemo zbirke, ki vsebujejo dialoge in ukazne zahtevke za doučevanje velikih jezikovnih modelov.
- GaMS-Instruct-GEN: vsebuje skoraj 7.000 parov pozivov in odgovorov, s katerimi lahko model naučimo primernega odgovarjanja na vprašanja in sledenja navodilom.
- GaMS-Instruct-DH: zajema 10.000 vprašanj s področij humanističnih ved.
- GaMS-Instruct-MED in GaMS-Instruct-MED-Termset: ponujata skupaj več kot milijon vprašanj s področja medicine.
- GaMS-Instruct-MED-Anatomy: s 700.000 pari vprašanj in odgovorov se osredotoča na slovenske, angleške in latinske izraze iz anatomije in na drugo medicinsko terminologijo.
- GaMS-Instruct-PHARMA: vsebuje skoraj 500.000 vprašanj in odgovorov o zdravilih in njihovih učinkih na podlagi Centralne baze zdravil in drugih virov.
- SLO-VLM-IT-Dataset: zbirka za doučevanje velikih slikovno-jezikovnih modelov (VLM), ko želimo model naučiti reševati naloge, ki poleg besedila vsebujejo tudi slike.
- GaMS-Instruct-SAFE: zbirka za varnost in skladnost, s katero model učimo, da zavrne problematična vprašanja in ne ponuja škodljivih odgovorov (500 parov vprašanj in odgovorov glede kriminala, terorizma in nevarnih snovi).
Viri za govorne tehnologije
Če razvijamo sisteme za razpoznavanje ali sintezo govora, lahko z repozitorija CLARIN.SI pridobimo odprte govorne zbirke, ki zajemajo posnetke in prepise govora:
- Govorna baza ARTUR: osrednji vir za učenje razpoznavalnikov govora. Vsebuje posnetke govora in prepise (1.000 ur govora v javnih in zasebnih okoljih). Del zbirke (Artur-B-Studio) je namenjen tudi učenju sinteze govora.
- Korpus ROG-Dialog: več kot 5.000 ur posnetkov spontanega govora (50.000 besed), posnetih s strani govorcev iz različnih regij.
- Učni govorni korpus ROG: posnetki in prepisi branega ali spontanega govora z ročno pripisanimi jezikoslovnimi oznakami, podatki o prozodičnih enotah, mašilih in govornih dejanjih.
- Korpusi ParlaSpeech: posnetki in prepisi parlamentarnih govorov. Vključuje ParlaSpeech-SI (4.000 ur in 30 milijonov besed) ter govore iz hrvaškega, srbskega, češkega in poljskega parlamenta (skupaj 6.000 ur in 50 milijonov besed).
- Slovenske zvočne knjige: več kot 140 odprtih zvočnih knjig.
Učne in testne zbirke za razvoj specializiranih modelov
Veliki jezikovni modeli so zmožni reševati številne naloge brez učnih podatkov, vendar so v primerjavi z manjšimi modeli tipa BERT počasnejši in računsko bolj potratni. Če potrebujemo bolj specializirano rešitev za lokalno izvajanje in hitro obdelavo velikih količin besedil, se lahko poslužimo modelov tipa BERT in jih naučimo specifične naloge s pomočjo ročno označenih učnih in testnih podatkov:
- Analiza sentimenta: zbirka 10.000 novic SentiNews, zbirka 18.000 povedi iz parlamentarnih razprav ParlaSent v sedmih jezikih in zbirka tvitov z več kot 1,6 milijona tvitov v 15 jezikih.
- Prepoznava teme besedil: zbirka novic EMMediaTopic z 21.000 novicami v štirih jezikih, razvrščenimi v 17 tematik.
- Prepoznava sovražnega govora: zbirka FRENK z več kot 30.000 označenimi objavami z družbenih omrežij v treh jezikih.
- Številne druge ročno označene učne množice.
Prednaučeni in doučeni modeli
Repozitorij CLARIN.SI ponuja tudi številne že naučene modele za slovenščino:
- Prepoznavanje imenskih entitet (NER): nevronski model SloNER ali model označevalnika CLASSLA-Stanza za zaznavo oseb, organizacij in lokacij.
- Klasifikacija žanrov in tem: večjezični klasifikator X-GENRE (novice, navodila, forumi) ter SloBERTa-Trendi-Topics (razvrščanje novic v 13 tematskih kategorij).
- Razpoznavanje govora in ločila: prostodostopni model RSDO-DS2-ASR-E2E za avtomatsko razpoznavo slovenskega govora ter model RSDO-DS2-P&C, ki prepisu doda ločila in vejice.
- Modeli tipa BERT: slovenski model SloBERTa in slovensko-angleško-hrvaški model CroSloEngual BERT.
Jasne licence olajšajo uporabo v praksi
Pri razvoju rešitev pogosto ni največji izziv najti podatkov, temveč ugotoviti, ali jih sploh smemo uporabiti. Ena pomembnih prednosti repozitorija CLARIN.SI je, da so vsi objavljeni viri opremljeni z jasno določenimi licencami in pogoji uporabe. Repozitorij sledi načelom FAIR (Findable, Accessible, Interoperable, Reusable), zato je pri vsakem viru razvidno, kako ga lahko uporabljamo in pod kakšnimi pogoji.
To je posebej pomembno pri razvoju rešitev za podjetja, pri katerih je treba že v zgodnji fazi preveriti, ali so zbirke podatkov in modeli primerni tudi za komercialno uporabo.
Primerjava velikih jezikovnih modelov: Kako izbrati pravega?
Ko izbiramo veliki jezikovni model, ki ga želimo vključiti v svojo rešitev, se ne smemo zanašati samo na njegovo velikost ali ponudnika – pomembno je predvsem, kako dobro se model obnese na naših ciljnih nalogah, in še posebej v slovenskem jeziku.
CLARIN.SI sodeluje pri razvoju dveh platform, ki omogočata standardizirano in objektivno primerjavo zmogljivosti:
1. SloBENCH: primerjava modelov na slovenskih nalogah
SloBENCH je platforma za evalvacijo velikih jezikovnih modelov in drugih tehnologij za obdelavo naravnega jezika v slovenščini. Platforma omogoča evalvacijo na nalogah sklepanja, strojnega prevajanja med slovenščino in angleščino, avtomatskega razpoznavanja govora ter prepoznavanja imenskih entitet (vključuje tudi slovenske različice zbirk, kot je SuperGLUE).
2. Platforma središča CLASSLA za južnoslovanske jezike
Platforma središča znanja CLASSLA za evalvacijo velikih jezikovnih modelov ponuja interaktiven pregled primerjav širokega nabora prostodostopnih in komercialnih velikih jezikovnih modelov v slovenščini, angleščini, drugih južnoslovanskih jezikih in nekaterih narečjih.
Središča znanja: od pregledov do odprtih jezikovnih orodij
Znotraj CLARIN.SI delujejo tudi specializirana središča znanja, ki ponujajo dokumentacijo, preglede obstoječih jezikovnih virov, izobraževanja in strokovno podporo:
- Središče znanja CLASSLA razvija lastne prostodostopne tehnologije, objavljene na HuggingFace (CLASSLA) in GitHub. Med najbolj uporabljenimi orodji je CLASSLA-Stanza, knjižnica v jeziku Python za celovito jezikoslovno analizo besedil (stavčna in besedna segmentacija, lematizacija, besedne vrste, imenske entitete).
- Pregled odprto dostopnih tehnologij za slovenščino (GitHub): sistematičen seznam modelov in orodij, vključno z:
- Generativnimi VJM
- Modeli za vektorske vložitve in RAG (retrieval-augmented generation)
- Strojnim prevajanjem
- Prednaučenimi in doučenimi modeli tipa BERT
- Govornimi tehnologijami
- Središče znanja LLMs4SSH: ponuja celovit pregled aktivnosti na področju razvoja velikih jezikovnih modelov v Sloveniji.
Skupnost in obveščanje
Infrastrukturi CLARIN.SI lahko sledite na:
- LinkedIn: https://www.linkedin.com/company/clarin-si/
- Omrežje X: https://x.com/ClarinSlovenia
- Discord skupnost za jezikovne vire in tehnologije: https://t.co/RchH7lIQvX
- Poštni seznam CLASSLA: https://mailman.ijs.si/mailman/listinfo/classla
Zaključek
Razvoj rešitev umetne inteligence se pogosto začne z iskanjem kakovostnih podatkov, modelov ali orodij. CLARIN.SI na enem mestu združuje prav te ključne gradnike jezikovnih tehnologij za slovenščino in druge južnoslovanske jezike: prostodostopne zbirke besedil, učne in testne podatke, prednaučene modele, dokumentacijo, strokovno podporo ter platforme za evalvacijo.
Jasno določene licence, odprta dostopnost virov in sistematična dokumentacija omogočajo, da lahko številne podatke in modele uporabite tudi pri razvoju svojih produktov in storitev.
Viri in dodatno branje:
- Spletna stran CLARIN.SI: https://www.clarin.si/
- Erjavec, T., Dobrovoljc, K., Fišer, D., Javoršek, J. J., Krek, S., Kuzman Pungeršek, T., Laskowski, C. A., Ljubešić, N., & Meden, K. (2022). Raziskovalna infrastruktura CLARIN.SI. Jezikovne tehnologije in digitalna humanistika 2022. DOI: 10.5281/zenodo.13953419
- Erjavec, T., Ljubešić, N., Meden, K., Kuzman Pungeršek, T., Laskowski, C. A., Javoršek, J. J., Krek, S., Jemec Tomazin, M., Dobrovoljc, K., Arhar Holdt Š., Lenardič, J. & Fišer D. (2025). CLARIN.SI, the Slovenian node of CLARIN: ten years on. Selected papers from the CLARIN Annual Conference 2024. Linköping Electronic Conference Proceedings