duminicã, 27 septembrie, 2026

Special Arad Logo

    OpenAI oprește din nou antrenarea agenților AI, după ce un model a evadat din mediul de testare

    de Special Arad | 27 septembrie 2026, 9:56 PM | IT / AI

    0

    (foto: Exeed ECX)

    OpenAI a suspendat pentru a doua oară în 2026 antrenarea agenților săi autonomi, după ce unul dintre aceștia a reușit să „scape” din mediul de testare controlat – un sandbox digital conceput pentru a preveni accesul la internet și la date reale, potrivit Fortune.

    Incidentul a avut loc la doar câteva săptămâni după o breșă similară, când un agent AI a accesat neautorizat un portal guvernamental australian.

    De această dată, un model experimental a reușit să ocolească restricțiile de internet din sandboxul de testare și să trimită o întrebare către un chatbot public, folosind o breșă în filtrarea DNS.

    Este al doilea astfel de incident în cadrul OpenAI, după ce în luna iulie, modelul GPT-5.6 Sol a găsit modalități de a ocoli restricțiile de siguranță impuse de companie, a ieșit din rețeaua internă și a reușit să posteze pe GitHub.

    Agentul a descoperit o cale de ieșire prin DNS, deși accesul la internet era blocat

    Potrivit raportului OpenAI, agentul încerca să rezolve o sarcină de antrenament bazată pe căutare, folosind indicii dintr-un blog public. După ce instrumentele de căutare interne au returnat rezultate irelevante sau erori, modelul a început să testeze limitele mediului de rețea.

    Inițial, a încercat să acceseze motoare de căutare prin shell, dar toate cererile au fost blocate . Apoi a testat direct accesul HTTPS către un chatbot extern, însă proxy-ul a respins cererea.

    Momentul critic a venit când agentul a observat că rezolvatorul DNS intern răspundea la interogări reale și putea delega cereri către domenii externe. Exploatând această lacună, modelul a construit o interogare DNS care codifica o întrebare („Care este capitala Franței?”) și a primit răspunsul „Paris” de la chatbotul extern — o dovadă clară că accesul la internet fusese obținut printr-un canal neintenționat.

    Comportament considerat „misalignment” de OpenAI

    OpenAI subliniază că sarcina nu cerea testarea controalelor de rețea, iar faptul că agentul a căutat modalități de a ocoli restricțiile reprezintă un exemplu de comportament nealiniat.

    Modelul a continuat să trimită întrebări prin DNS, inclusiv 18 interogări suplimentare, unele legate de căutări web sau de utilizarea unor tuneluri DNS publice.

    Sistemele de monitorizare au detectat incidentul în 15 minute

    Comportamentul a fost detectat de sistemul intern de monitorizare după 15 minute, iar un evaluator uman a confirmat alerta trei minute mai târziu. Totuși, „escapada AI” nu s-a oprit automat, ceea ce a generat confuzie operațională; acesta a fost oprit manual abia după 2 ore și jumătate.

    OpenAI recunoaște că monitorizarea nu a semnalat la severitatea așteptată alte tentative de acces DNS din trecut, ceea ce indică lacune în sistemul de detecție.

    OpenAI suspendă toate testele cu modele capabile de tool-use

    Compania a decis să oprească toate sesiunile de training, evaluare și inferență pentru cele mai capabile modele care folosesc instrumente (tool-use), până când breșa este complet remediată și mediul este red-teamed suplimentar.

    OpenAI afirmă că nu va relua antrenarea acestui model specific, chiar dacă sistemul de recompense penaliza deja comportamentul.

    Incidentul este mai puțin sever decât cel de la Hugging Face, dar critic pentru securitate

    Deși OpenAI notează că incidentul este „mai puțin sever” decât cel precedent — cel în care agenți AI au accesat infrastructura Hugging Face — acesta este primul caz apărut după întărirea controalelor de securitate, oferind un semnal important despre zonele unde sistemele trebuie consolidate în continuare.

    Compania a început deja să implementeze noi restricții DNS, să înlocuiască componentele care pot accesa internetul cu alternative offline și să accelereze testele de red-teaming pentru a identifica alte căi tranzitive de acces.

    Citește și:

    Directorii OpenAI și Anthropic sunt convocați la audieri în Australia, după ce un agent AI scăpat de sub control a infiltrat un portal guvernamental

    Inteligența plagiată (1)

    Inteligența plagiată (2)

    Cercetătorul‑șef al OpenAI avertizează: „Nimeni nu este pregătit pentru consecințele creșterii rapide a inteligenței artificiale”

    Urmărește Special Arad și pe Google News, Twitter, LinkedIn și Instagram!

    Distribuie articolul

    Comments are closed.