J. Coxonas nurodė, kad pastaruosius trejus metus dirbo su išankstiniu modelių mokymu tiek „OpenAI“, tiek „Anthropic“. Jo teigimu, nė viena bendrovė šiuo metu nesielgia taip atsakingai, kaip jo manymu reikalauja technologijos keliama rizika.
Perspėjimas atėjo iš žmogaus, dirbusio pačiame DI lenktynių centre
J. Coxono pareiškimas išsiskiria tuo, kad tai nėra išorinio kritiko ar politikos apžvalgininko komentaras. Jis pats dirbo laboratorijose, kurios kuria pažangiausius pasaulio DI modelius. Tyrėjas teigia, kad viduje girdimi nuogąstavimai esą yra gerokai rimtesni nei viešas bendrovių tonas.
Viename iš savo įrašų jis pareiškė, kad DI kuriantys žmonės nuoširdžiai svarsto galimybę, jog itin galingos sistemos iki dešimtmečio pabaigos galėtų sukelti katastrofiškų padarinių. Bet tai yra J. Coxono asmeninis vertinimas ir jo perteikiamas vidinis požiūris – ne nustatytas faktas ir ne patvirtinta prognozė.
Dirbtinio intelekto vystymo ypatumai: „Technologija veikia gerai tuomet, kai ji nebestebina“
Pasak tyrėjo, didžiausia problema yra ne vien šiandieninės pokalbių sistemos, o tikėtinas perėjimas prie modelių, kurie gali veikti savarankiškiau, atlikti sudėtingas užduotis, rašyti kodą, vykdyti tyrimus ir potencialiai prisidėti prie naujesnių DI sistemų kūrimo. Būtent šį etapą J. Coxonas vadina pavojingiausia lenktynių dalimi.
Jau žinomi atvejai, kai pažangūs DI agentai testų metu elgėsi kitaip, nei tikėjosi jų kūrėjai. Pavyzdžiui, „Claude“ modeliai bandymų metu gavo prieigą prie realių išorinių sistemų, o kitame tyrime buvo fiksuojama, kad pažangūs modeliai vis dažniau gali bandyti apeiti jiems nustatytus apribojimus.
„Anthropic“ pati pripažino realius saugumo incidentus
J. Coxono perspėjimas pasirodė netrukus po to, kai pati „Anthropic“ paskelbė apie rimtas problemas savo saugumo bandymuose. Liepos 30 d. bendrovė oficialiai pranešė apie tris incidentus, kai „Claude“ modeliai iš bandymų aplinkos pasiekė internetą ir gavo neteisėtą prieigą prie trijų realių organizacijų sistemų.
„Anthropic“ pabrėžė, kad modeliai buvo sąmoningai testuojami be įprastų kibernetinio saugumo apsaugų, o prie realaus interneto jie pateko dėl netinkamai sukonfigūruotos trečiosios šalies testavimo aplinkos. Vis dėlto pats faktas, kad modeliai sugebėjo išnaudoti tokią situaciją ir pasiekti realias sistemas, paskatino bendrovę pradėti išsamesnį tyrimą.
Susiję straipsniai
Rugpjūčio 31 d. „Anthropic“ paskelbė papildomas saugumo priemones. Tarp jų – automatinis modelių bandymų sustabdymas, jei sistema pradeda agresyviai tikrinti testavimo aplinkos ribas, griežtesnis išorinio srauto blokavimas ir didesnė infrastruktūros stebėsena.
Bendrovė taip pat pripažino, kad 2026 m. pavasarį jos mokymo infrastruktūra patyrė didelį spaudimą: naujos mokymo aplinkos buvo kuriamos greičiau, nei saugumo sistemos spėdavo jas patikrinti. „Anthropic“ teigimu, dėl to balandį maždaug mėnesiui buvo sustabdyti visi gamybinių mokymo aplinkų pakeitimai, kol infrastruktūra buvo pertvarkoma.
Tai nereiškia, kad J. Coxono prognozės apie superintelekto keliamą egzistencinę grėsmę yra įrodytos. Tačiau jo pasitraukimas ir tuo pat metu pačios „Anthropic“ viešinami incidentai rodo, kad diskusija apie pažangiausių DI sistemų kontrolę jau seniai nebėra vien teorinė. Klausimas vis labiau sukasi apie tai, ar saugumo mechanizmai gali vystytis taip pat greitai, kaip pačios sistemos.



