Anthropic a publicat o nouă analiză de securitate în care descrie patru incidente în care modele Claude au obținut acces neautorizat la sisteme reale ale unor terți în timpul unor evaluări de cybersecurity.
Cazurile sunt importante deoarece arată cât de repede poate deveni riscant un mediu de testare configurat greșit atunci când un model avansat primește instrumente și libertate de acțiune specifice unui scenariu ofensiv.
Ce s-a întâmplat
Potrivit Anthropic, toate cele patru incidente au avut loc în cadrul unor evaluări de securitate construite de același partener extern. Modelele primiseră sarcini de tip CTF și li se spusese că operează într-un mediu simulat, fără acces la internet.
În realitate, din cauza unei configurări greșite, mediul avea acces la internet. Modelele au continuat să caute ținta cerută în evaluare și au ajuns să interacționeze cu sisteme reale care nu făceau parte din test.
Patru modele diferite au fost implicate
Anthropic spune că incidentele au implicat patru modele diferite, printre care versiuni timpurii sau de evaluare ale Claude Opus 4.6, Claude Opus 4.7 și Claude Mythos 5, precum și un model intern de cercetare.
Trei dintre incidente au fost identificate inițial în urma analizei a aproximativ 141.000 de transcripturi asociate evaluărilor de securitate. Ulterior, compania a extins analiza la aproximativ 481 de milioane de transcripturi, folosind un proces în două etape pentru a căuta semne ale unui acces real la internet.
În această analiză extinsă, Anthropic spune că a reidentificat cele patru incidente cunoscute și nu a găsit alte cazuri de severitate similară sau mai mare.
Modelele rulau fără protecțiile normale
Un detaliu esențial este că modelele erau rulate intenționat fără protecțiile de cybersecurity prezente în versiunile comerciale, tocmai pentru a le testa limitele în scenarii controlate. Problema a fost că mediul nu a rămas complet controlat.
Cu alte cuvinte, incidentul nu arată că utilizatorii obișnuiți ai Claude pot reproduce automat același comportament, dar evidențiază un risc real pentru laboratoarele care testează agenți AI cu acces la rețea și instrumente ofensive.
Anthropic a notificat organizațiile afectate
Compania afirmă că toate părțile afectate au fost informate și că a încheiat un acord cu organizația independentă METR pentru investigarea suplimentară a incidentelor.
Cazul este relevant pentru întreaga industrie AI: pe măsură ce modelele capătă mai multă autonomie, problema nu mai este doar ce răspuns textual oferă, ci și ce acțiuni pot executa efectiv atunci când primesc acces la browsere, terminale, rețele și alte sisteme.
De ce contează pentru securitatea AI
Pentru organizațiile care testează agenți AI, lecția este directă: izolarea mediului, controlul egress-ului, allow-listing-ul țintelor și monitorizarea traficului trebuie tratate ca măsuri de securitate critice, nu doar ca detalii ale infrastructurii de laborator.
Pe măsură ce agenții AI devin mai capabili în programare și cybersecurity, o simplă eroare de configurare poate transforma o simulare într-o interacțiune cu infrastructură reală.
Sursa: Anthropic – An alignment assessment of recent cybersecurity incidents.