10-10-10

Desať rozhovorov s desiatimi vedcami z desiatich vedných odborov naznačuje, kam smeruje vývoj a výskum v jednotlivých oblastiach a že ani vo vede nie je všetko čierno-biele. Poznanie nikdy nebolo prekliatím, vždy obohacuje, zaznieva v knihe. Pri využívaní objavov a technológií je kľúčová naša ľudská zodpovednosť a morálka. Len na nás záleží, ako dopadne hra, ktorú hráme, hovoria vedci.

Titulka knihy Andrey Settey Hajdúchovej: 10-10-10 s farebnými puzzle predstavujúcimi rôzne vedné oblasti

Vrátim sa k otázke využitia slovenského jazyka v technológiách. Prečo je to kľúčové?

Snažíme sa, aby systém cez natrénovaný model rozumel textom v prirodzenom jazyku na rôznych úrovniach, aby vedel vyhodnotiť vlastnosti textu. V angličtine je napríklad analýza sentimentu textu už zvládnutá pomerne dobre, pretože k dispozícii je veľa datasetov, na ktorých sa modely učia. V slovenčine nemáme dostatok datasetov, preto sa sľubným smerom javí učenie s prenosom (transfer learning), ktoré umožňuje prenos poznatkov z väčších a bohatších jazykov do malých jazykov. Nie je to priamočiary proces, lebo každý jazyk má iné vlastnosti. A určite to nenahradí dobré datasety.

Dôležité je, aby modely porozumeli všetkému, čo sa nachádza v nejakej správe, a vedeli napríklad pomenovať, čo vidia na obrázku a ako to súvisí s textom okolo. Tento výskum má prepojenie do ďalšej oblasti, ktorou je spracovanie používateľských a webových dát, čiže rôzne analýzy a predikcie správania sa používateľov na webe, ktoré môžu viesť k odporúčaniam.

Odporúčania obsahu majú tiež pozitívnu aj negatívnu stránku. Venujete sa obom?

Pozitívom odporúčacích systémov je, že sa rýchlo dostanete k informácii, ktorá je pre vás užitočná, pričom šetríte čas. Negatívom je práve to, čo využíva dezinfo scéna, teda uzatváranie sa do bublín. Ak vás systém uzavrie do bubliny, dochádza k tzv. efektu ozveny, teda zo všetkých strán sa k vám odrážajú tie isté informácie a ich efekt sa znásobuje.

Aj to môže byť pozitívne, ak sa dostanete do oblasti, ktorá vás rozvíja; keď sa napríklad venujete fotografii a ste v kruhu ľudí a informácií z tejto oblasti. No keď sa za vami uzavrú vody v dezinfo bubline, má to nepríjemné dôsledky a tomu sa venujeme v našom výskume.

V akom zmysle?

Okrem detekcie škodlivého obsahu a aktivít na webe priamou analýzou textu sa usilujeme automaticky simulovaním používateľov auditovať vybrané aspekty platforiem, na ktoré pozeráme ako na čiernu skrinku. Zisťujeme napríklad, koľko úsilia (klikov) potrebuje človek na YouTube, aby sa dostal do nejakej bubliny, a koľko ho potrebuje na to, aby sa z tejto bubliny dostal. Zistili sme, že v odporúčaní sú rozdiely v závislosti od témy. Žiaľ, v porovnaní s podobnými štúdiami z minulosti nevidno zlepšenie v odporúčaní videí s nepravdivým obsahom, čo nie je veľmi dobrá správa.

Zachytila som zaujímavé vyjadrenie Michala Pěchoučka z Centra umelej inteligencie na ČVUT v Prahe, ktorý povedal, že ak niekoho netrápi, aké dáta zozbierané o ňom slúžia na komerčné či iné účely, tak nech má aspoň možnosť tieto dáta speňažiť.

Dobrá myšlienka, pretože obchodný model môže zmeniť vnímanie ľudí. Všetko, čo je zadarmo, nemá pre nás hodnotu, ale keď vznikne možnosť osobné dáta speňažiť, ľudia si ich hodnotu začnú uvedomovať. Na druhej strane je to nebezpečné, lebo niektorí ľudia môžu byť ochotní vzdať sa za peniaze aj slobody, najmä keď to bude zabalené do presvedčivého príbehu. A tak sa môžeme k autoritárskemu režimu posunúť ešte skôr.

V každom prípade – naše osobné dáta majú jednoznačne hodnotu a dnes sa už aj speňažujú. Súčasný model však nie je férový. Vo férovom modeli by na zisku mali participovať obidve strany. Zatiaľ by však stačilo aspoň to, aby sme mali informácie o tom, čo všetko sa s našimi dátami robí, do akých modelov sú začlenené, čo sa z nich odvodzuje a v ktorých aplikáciách.

Vo virtuálnych bublinách sme v kontakte len so selektívnym výberom informácií podľa našich preferencií, čo vedie k polarizácii spoločnosti. Aké riešenie hľadáte vo výskume?

Jedným z riešení je hľadať také modely a metódy na odporúčanie, v ktorých by bol používateľ rovnocenným partnerom stroja. Rovnocenný neznamená rovný, ale aby odporúčač vedel zohľadniť kontext a zároveň si bol používateľ vedomý, na základe čoho spravil odporúčanie. A to sa týka nielen tých, pre koho to odporúčanie nakoniec je, ale aj tých, ktorí sú do tohto procesu zahrnutí, napr. editori. Lebo človek nemôže z rozhodovacieho procesu vypadnúť a rovnako by nemal byť iba na úplnom konci tohto procesu, keď už nemá veľkú možnosť ovplyvniť rozhodnutie.                                                            

Úryvok z rozhovoru s prof. Ing. Máriou Bielikovou, PhD., zakladateľkou Kempelenovho inštitútu inteligentných technológií, z knihy 10-10-10. 10 slovenských vedcov, 10 rozhovorov, 10 výziev, ktorá vyšla v Centre vedecko-technických informácií SR v roku 2021.
Knihu v elektronickej verzii nájdete na vedanadosah.cvtisr.sk/publikacie/10-10-10/.


Súťažná otázka

Ak nám do 31. októbra 2026 pošlete správnu odpoveď na otázku:

Prečo je slovenčina pri trénovaní jazykových modelov v nevýhode v porovnaní s angličtinou?

zaradíme vás do žrebovania o knihu Andrey Settey Hajdúchovej: 10-10-10. 10 slovenských vedcov, 10 rozhovorov, 10 výziev, ktorú pre CVTI SR v roku 2021 vydalo Vydavateľstvo Matice slovenskej, s. r. o.
Svoje odpovede môžete posielať na adresu redakcie: odpovednik@quark.sk alebo Quark, Lamačská cesta 8A, 811 04 Bratislava.

Viac takýchto článkov a exkluzívneho obsahu môžete získať vďaka predplatnému.

Máte predplatné?