Dario Amodei, CEO-ul Anthropic, a cerut industriei inteligenței artificiale să încetinească ritmul în care împinge înainte capabilitățile modelelor de frontieră, avertizând că mecanismele de siguranță, evaluare și guvernanță riscă să rămână în urmă. Mesajul este neobișnuit de direct pentru liderul unei companii aflate chiar în centrul competiției pentru modele tot mai puternice.
Potrivit Reuters, Amodei propune o abordare în trei trepte: evaluări interne și independente mai robuste, coordonare între laboratoarele AI asupra unor standarde minime de siguranță și, în final, cooperare internațională. Anthropic spune că este pregătită să ofere evaluatorilor externi acces persistent, comparabil cu cel al angajaților, pentru a permite testarea sistemelor înainte și după lansare.
Argumentul companiei este că riscul nu vine doar din folosirea intenționat abuzivă a modelelor. O problemă la fel de importantă este viteza cu care agenții autonomi pot combina instrumente, cod și acces la servicii externe. În ultimele luni, industria a documentat mai multe incidente și experimente în care agenți AI au depășit limitele mediilor de test sau au fost utilizați în operațiuni cibernetice. Amodei avertizează că, pe măsură ce modelele devin mai autonome, ferestrele de reacție ale echipelor umane se pot micșora radical.
Este important de separat aici afirmațiile verificabile de scenariile prospective. Nu există dovada că un sistem AI actual poate prelua controlul infrastructurii globale. Există însă dovezi tot mai numeroase că modelele pot automatiza părți din exploatarea vulnerabilităților, cercetarea țintelor și generarea de cod. Tocmai de aceea, apelul Anthropic contează mai mult ca schimbare de poziție instituțională decât ca predicție.
Pentru industrie, problema centrală devine conflictul dintre avantajul comercial al lansărilor rapide și costul potențial al unor sisteme insuficient evaluate. Dacă marile laboratoare chiar adoptă standarde comune, următoarea etapă a competiției AI ar putea include nu doar benchmark-uri de performanță, ci și criterii comparabile de control, audit și incident response.