Kineska kompanija Moonshot AI pokrenula je internu provjeru svojih AI modela nakon što su sigurnosni istraživači uspjeli zaobići ugrađene zaštitne mehanizme i naveli dva Kimi modela da odgovaraju na zahtjeve povezane s biološkim oružjem i atentatima.
Tvrtka Mindgard, koja se bavi testiranjem sigurnosti umjetne inteligencije, objavila je da je u srpnju otkrila ranjivost u modelima Kimi K2.6 i K3 Swarm. Kako piše BBC, prema njihovim navodima, modele je bilo moguće navesti da zanemare sigurnosna ograničenja koja su njihovi tvorci postavili kako bi spriječili odgovaranje na opasne ili štetne upite.
Istraživači su do toga došli postupkom poznatim kao „jailbreaking”. Riječ je o korištenju niza složenih uputa kojima se pokušava navesti AI sustav da zaobiđe pravila i zaštitne mehanizme ugrađene u model.
„Nakon što jailbreak uspije, model će razgovarati o bilo kojoj temi“
Osnivač Mindgarda Peter Garraghan rekao je za BBC World Service u emisiji Tech Life da su rezultati zabrinjavajući.
„Jednom kada jailbreak uspije, model će razgovarati o bilo kojoj temi, čak će slobodno nuditi preporuke o drugim temama koje su također opasne. Bit će inventivan i kreativan“, rekao je Garraghan.
Mindgard pritom naglašava da nije provjerio bi li informacije koje su modeli pružili doista bile učinkovite u stvarnom svijetu. Problem, prema toj kompaniji, leži u tome što su sigurnosne zaštite trebale spriječiti modele da uopće ulaze u takve razgovore.
Istraživači tvrde i da bi kompromitirani Kimi K2.6 potencijalno mogao omogućiti napadačima izvršavanje koda na računalnim resursima modela te pristup internetu. To bi, prema Mindgardu, moglo otvoriti mogućnost korištenja sustava kao polazišne točke za kibernetičke napade.
Moonshot pokrenuo internu provjeru
Moonshot AI potvrdio je za BBC da razmatra rezultate istraživanja.
Kompanija je poručila da pozdravlja doprinos vanjskih stručnjaka „kao ključni stup u izgradnji bolje i sigurnije umjetne inteligencije”. Također je navela da je u kontaktu s Mindgardom u vezi s njihovim nalazima.
Mindgard tvrdi da je Moonshotu prvi put prijavio problem e-mailom 27. srpnja, a zatim ga ponovno kontaktirao otprilike tjedan dana kasnije. Istraživačka kompanija svoj je blog o ranjivosti objavila 12. rujna.
Prema Mindgardu, Moonshot je s njim intenzivnije stupio u kontakt tek nakon što je BBC zatražio komentar od kompanije.
U e-mailu Mindgardu, čiji je dio Moonshot podijelio s BBC-jem, kineska je kompanija navela da su njezini modeli u internim testiranjima općenito pokazivali „visoku stopu odbijanja” takvih zahtjeva.
AI modeli sve češće postaju sigurnosni izazov
Problem s tzv. jailbreakovima razlikuje se od nedavnih incidenata povezanih s autonomnim AI agentima.
Riječ je o alatima koji mogu samostalno izvršavati niz zadataka, a koje razvijaju velike američke tehnološke kompanije poput OpenAI-ja, Mete i Anthropica. U nekoliko nedavnih slučajeva takvi su alati iskorišteni za napade na internetske servise.
Jailbreakovi su, s druge strane, često složeni i zahtijevaju vrijeme, znanje i upornost. Ipak, sigurnosni stručnjaci upozoravaju da bi ih hakeri i drugi zlonamjerni korisnici mogli pokušati iskoristiti za nanošenje štete.
Anthropic je nedavno objavio da je identificirao i zaustavio pokušaje korištenja jednog od svojih AI modela za „zlonamjerne aktivnosti” koje su mogle pomoći u razvoju biološkog oružja.
Otvoreni modeli donose i prednosti i rizike
Slučaj Kimi modela ponovno otvara pitanje sigurnosti tzv. open-weight AI modela.
Kimi je model čiji su parametri dostupni korisnicima, što u teoriji znači da ga netko može preuzeti i pokrenuti na vlastitoj računalnoj infrastrukturi. To može omogućiti veću kontrolu i prilagodbu modela, ali istodobno otežava nadzor nad načinom na koji se koristi.
Profesor Alan Woodward sa Sveučilišta Surrey rekao je za BBC da postoji opasnost da otvoreni modeli završe u pogrešnim rukama, ali je istaknuo i da se ista tehnologija može koristiti za obranu od kibernetičkih napada.
Kao primjer naveo je platformu Hugging Face, koja je iskoristila kineski open-source model kako bi analizirala jedan hakerski napad za koji se kasnije otkrilo da su ga izveli OpenAI-jevi AI agenti.
Woodward smatra da će međunarodna regulacija teško pratiti brzinu razvoja umjetne inteligencije.
„Desetljećima nam je trebalo da se dogovorimo oko formata telefonskih brojeva“, rekao je za BBC, ilustrirajući koliko bi teško moglo biti postići brzi međunarodni konsenzus oko pravila za umjetnu inteligenciju.
I Garraghan i Woodward smatraju da bi se veća pozornost trebala posvetiti ljudima koji zlorabe AI tehnologiju, njihovu identificiranju i kaznenom progonu, umjesto da se odgovornost isključivo pokušava riješiti tehničkim ograničenjima samih modela.
Slučaj Moonshot tako pokazuje jedan od ključnih problema s kojima se AI industrija trenutno suočava: čak i kada modeli imaju ugrađene sigurnosne mehanizme, istraživači i zlonamjerni korisnici mogu pokušavati pronaći načine da ih zaobiđu.










