Francosko podjetje Mistral AI je predstavilo Shieldstral, nov model za preverjanje besedil in slik, preden jih umetna inteligenca prikaže uporabniku. Ne gre za novega klepetalnika, temveč za nekakšnega digitalnega varnostnika, ki lahko po pravilih posamezne aplikacije zaznava nasilje, sovražni govor, nevarna navodila, neprimerne slike in druge vrste tveganih vsebin.
Poudarki:
- Shieldstral preverja besedilo in slike po pravilih, zapisanih v naravnem jeziku, brez dodatnega učenja modela.
- Mistral ga ponuja z odprtimi utežmi; za lokalni zagon naj bi zadostovala ena grafična kartica s 16 GB.
- Rezultati so obetavni, vendar temeljijo predvsem na testih razvijalca in še potrebujejo neodvisno preverjanje.
Mistral je Shieldstral objavil 4. avgusta kot model z odprtimi utežmi in licenco Apache 2.0. Podjetja, razvijalci in raziskovalci ga lahko zato prenesejo, poganjajo na lastni infrastrukturi in prilagodijo svojim storitvam brez obvezne uporabe Mistralovega oblaka.
To je pomembno predvsem za manjša podjetja, javne ustanove in razvijalce, ki si ne morejo privoščiti velikega dodatnega modela za pregled vsakega vprašanja in odgovora. Shieldstral po navedbah Mistrala deluje na eni grafični kartici Nvidia s 16 GB pomnilnika, kar ga približa tudi lokalnim strežnikom in zmogljivejšim delovnim postajam.
Kaj je Shieldstral in čemu je namenjen
Vsak javno dostopen sistem umetne inteligence potrebuje mehanizem, ki preverja, kaj uporabnik zahteva in kaj namerava model odgovoriti. Brez takšnega nadzora lahko klepetalnik ustvari nevarna navodila, razkrije občutljive informacije ali prikaže vsebino, ki ni primerna za določeno občinstvo.
Shieldstral je specializirani klasifikacijski model. Njegova naloga ni pisanje člankov, ustvarjanje slik ali odgovarjanje na vprašanja. Prejme vsebino in pravilo, nato pa oceni, ali vsebina pravilo krši.
Uporablja se lahko za:
- preverjanje uporabnikovega vprašanja pred pošiljanjem glavnemu modelu,
- pregled odgovora, preden ga aplikacija pokaže uporabniku,
- zaznavanje nevarnih kombinacij vprašanja in odgovora,
- preverjanje besedila, fotografij ali obojega hkrati,
- ugotavljanje, ali je klepetalnik pravilno zavrnil nevarno zahtevo,
- razvrščanje vsebin po stopnji tveganja.
Model ima po uradni dokumentaciji približno 3,8 milijarde parametrov, čeprav ga Mistral zaradi velikostnega razreda predstavlja kot model 3B. Podpira kontekst do 32.000 žetonov, zato lahko naenkrat pregleda tudi daljši pogovor ali dokument.
Shieldstral pravila prejme v običajnem jeziku
Večina starejših sistemov za moderiranje je naučena na vnaprej določenih kategorijah. Model lahko denimo prepoznava nasilje, spolne vsebine, sovražni govor in samopoškodovanje, težje pa se prilagodi zelo posebnemu okolju.
Pravila za otroško aplikacijo so drugačna kot za medicinsko svetovanje, zgodovinski arhiv ali orodje za raziskovanje kibernetskih napadov. Besedilo, ki je sprejemljivo v strokovnem varnostnem poročilu, je lahko popolnoma neprimerno v klepetalniku, namenjenem osnovnošolcem.
Shieldstral poskuša to težavo rešiti tako, da pravilo prejme kot vprašanje v naravnem jeziku. Upravljavec lahko na primer določi:
- »Ali vsebina spodbuja fizično nasilje?«
- »Ali je ta slika primerna za mladoletne uporabnike?«
- »Ali odgovor vsebuje osebne zdravstvene podatke?«
- »Ali navodilo omogoča zlorabo računalniškega sistema?«
Model nato oceni vsebino in vrne rezultat med odgovoroma »da« in »ne«. Ne poda le trde odločitve, temveč verjetnostno oceno. Podjetje lahko zato samo določi prag, pri katerem bo vsebino dovolilo, poslalo v človeški pregled ali samodejno blokiralo.
Glavna prednost takšnega pristopa je, da za novo politiko praviloma ni treba ponovno učiti celotnega modela. Razvijalec spremeni vprašanje oziroma navodilo in isti model uporabi v drugem okolju.
Majhen model naj bi prehitel precej večje tekmece
Mistral trdi, da Shieldstral na nekaterih preizkusih dosega ali presega rezultate varnostnih modelov, ki imajo skoraj sedemkrat več parametrov. V objavljenem tehničnem poročilu je dosegel povprečno oceno F1 84,9 odstotka pri preverjanju besedil in 83,8 odstotka pri večmodalnih preizkusih, ki vključujejo tudi slike.
Pri preverjanju podrobno določenih pravil je dosegel 91,3-odstotno oceno F1. Ta mera združuje natančnost in sposobnost zaznavanja spornih primerov, zato je uporabnejša od samega odstotka pravilnih odgovorov pri neuravnoteženih zbirkah podatkov.
Model so učili na približno 54,1 milijona primerih. Med njimi je bilo 45,2 milijona odprtih besedilnih vzorcev, 4,4 milijona umetno ustvarjenih primerjalnih primerov in 4,5 milijona kombinacij besedila ter slik.
Toda rezultate je treba razlagati previdno. Preizkuse in primerjave so pripravili avtorji modela, Shieldstral pa še nima daljše zgodovine uporabe v resničnih storitvah. Neodvisne analize opozarjajo, da navedbe o prekašanju večjih modelov še niso enake potrditvi na javnih lestvicah ali v različnih produkcijskih okoljih.
Lokalni zagon lahko zmanjša stroške in izpostavljenost podatkov
Moderiranje je lahko drago, ker mora sistem preveriti skoraj vsako interakcijo. Če aplikacija vsak dan prejme milijon vprašanj, lahko varnostni model obdela milijon vhodov in nato še milijon odgovorov.
Manjši model pomeni:
- nižjo porabo grafičnega pomnilnika,
- hitrejše preverjanje posamezne zahteve,
- manjše stroške strežniške infrastrukture,
- možnost delovanja brez pošiljanja vsebine zunanjemu ponudniku,
- lažje nameščanje v zasebnem ali evropskem podatkovnem centru.
Za slovenska podjetja je posebej zanimiva možnost lokalnega izvajanja. Organizacija lahko občutljiva besedila in slike obdrži na lastni infrastrukturi, namesto da bi jih zaradi moderiranja pošiljala v dodatno storitev v oblaku.
To samo po sebi še ne zagotavlja skladnosti s pravili o varstvu osebnih podatkov. Upravljavec mora še vedno določiti namen obdelave, omejiti beleženje vsebine, urediti dostop do podatkov in preveriti, iz katerih virov prihajajo uporabljeni modeli ter zbirke.
Shieldstral ni namenjen običajnim uporabnikom
Shieldstral ne bo nova možnost v aplikaciji Le Chat in uporabniki ga ne bodo izbirali namesto običajnega jezikovnega modela. Namenjen je razvijalcem, ki ga vključijo v ozadje spletne storitve, aplikacije, klepetalnika ali sistema za pregled uporabniških objav.
Mistral ga je objavil kot javni predogled. Uteži so na voljo za prenos, podjetje pa ni določilo posebne naročnine ali cene za lokalno uporabo. Licenca Apache 2.0 dovoljuje tudi komercialne projekte, dejanski strošek pa predstavljajo strojna oprema, elektrika, vzdrževanje in delo pri vključevanju modela.
Za lokalni zagon so potrebni:
- združljiv strežnik ali delovna postaja,
- grafična kartica z dovolj pomnilnika,
- programsko okolje za izvajanje odprtih modelov,
- jasno napisana pravila moderiranja,
- lastno testiranje lažno pozitivnih in spregledanih primerov.
Mistral izpostavlja eno grafično kartico s 16 GB, vendar se lahko zahteve spremenijo glede na uporabljeno natančnost, dolžino vhodov, število sočasnih uporabnikov in programsko opremo.
Prilagodljiva pravila prinašajo tudi novo odgovornost
Sistem, ki pravilo sprejme v naravnem jeziku, je lahko zelo prilagodljiv, vendar je njegova kakovost odvisna tudi od tega, kako natančno je pravilo napisano. Nejasno vprašanje lahko povzroči nepredvidljivo moderiranje.
Prestroga nastavitev lahko blokira legitimne razprave o zdravju, zgodovini ali varnosti. Preohlapna nastavitev pa lahko spregleda nevarno vsebino. Posebej zahtevni bodo primeri s sarkazmom, prikritimi namigi, lokalnim slengom in kulturnimi razlikami.
Mistral priznava, da želi izboljšati večjezično pokritost, odpornost pri zelo dolgih dokumentih in preverjanje širšega nabora večmodalnih vsebin. To pomeni, da zmogljivost v slovenščini še ni potrjena na ravni, ki bi omogočala slepo uporabo brez lastnih testov.
Shieldstral zato ne odpravlja potrebe po ljudeh. Lahko prestreže očitne primere, razvrsti veliko količino vsebin in zmanjša stroške, mejne odločitve pa bodo še naprej zahtevale pregled, pritožbeni postopek in jasno odgovornost upravljavca.

