Ce este prompt injection?
În era inteligenței artificiale, un simplu fișier poate deveni o armă de dezvăluire a informațiilor confidențiale. Această vulnerabilitate, numită prompt injection, apare atunci când instrucțiuni ascunse într-un document modifică comportamentul unui model AI, determinându-l să execute acțiuni neautorizate.
Culture picks
Companiile mici primesc acces la tehnologii avansate prin noul centru de inteligență artificială
România ocupă ultimul loc din Uniunea Europeană la utilizarea inteligenței artificiale în firme
Inteligența artificială devine un avantaj strategic pentru bănci
România intră în era AI: Lansarea oficială a proiectului RO AI FactoryConform experților de la Playtech, atacul poate fi indirect: comenzi ascunse în fișierele analizate în sarcini legitime, cum ar fi revizuirea unui contract, pot induce agentul să facă ceva ce nu a fost solicitat inițial.
Cum funcționează un agent AI?
Un agent AI este un sistem capabil să interacționeze cu diverse instrumente și să execute acțiuni concrete. Dacă are doar dreptul de a citi un fișier, efectele sunt limitate la afișarea informațiilor.
Dar dacă poate naviga prin arhive, trimite e-mailuri sau modifica baze de date, instrucțiunile malevole pot produce consecințe mult mai grave. Nu este vorba de o preluare completă a infrastructurii; atacatorul abuzează de drepturile deja acordate aplicației.
Ce riscuri apar pentru afaceri?
Impactul poate fi variat: - expunerea informațiilor la care agentul are acces; - recomandări de business părtinitoare; - omisiunea clauzelor defavorabile în analiza contractelor; - injectarea de date incorecte în rapoarte finale; - alterarea neautorizată a înregistrărilor, dacă agentul deține drept de scriere.
Un raport final poate părea perfect formatat, dar structura sa a fost subtil modificată. Concentrarea exclusivă pe aspectul formal poate face ca intervențiile subtile să fie neobservate, mai greu de detectat decât o eroare tehnică evidentă.
De ce sunt dificile aceste atacuri?
Combinarea diferitelor aplicații conectate joacă un rol crucial. Accesul la citire permite extragerea informațiilor, iar conectarea la sistemul de e-mail permite transmiterea acestora. Când aceste funcții sunt active în aceeași sesiune, creează un canal de divulgare, chiar dacă fiecare componentă pare justificată individual. Evaluarea de securitate trebuie să abordeze întregul ecosistem, incluzând toate instrumentele interconectate.
Să presupunem că un agent compară ofertele mai multor furnizori.
Într-un fișier extern apare o cerere de a consulta și centraliza contractele firmei. Autorul documentului prezintă această operațiune ca verificare de compatibilitate esențială. Deși autorul extern nu deține autoritate asupra arhivei interne, agentul poate interpreta cererea ca parte a sarcinii delegate de angajat.
Cum ascunde prompt injection instrucțiuni în contractele analizate de AI?
Dacă sistemul vede doar ofertele încărcate pentru comparație, accesul rămâne limitat.
Însă, dacă agentul operează prin contul unui angajat cu vizibilitate asupra întregii arhive contractuale, documentul extern poate încerca să declanșeze consultarea unei game mult mai largi de informații.
Unde se ascund instrucțiunile malevole?
Acestea pot fi în comentarii, în text cu contrast redus sau în alte elemente preluate automat de software. Pot fi chiar vizibile, sub forma unei note administrative standard.
Aplicația poate extrage conținut pe care utilizatorul uman nu îl observă în interfața deschisă. Modelul AI interpretează limbajul natural și relațiile dintre mesaje, fără a restrânge comenzile la un câmp specific. Un pasaj care imită o regulă internă sau o explicație necesară poate exploata această flexibilitate.
De ce filtrarea expresiilor nu e suficientă?
Blocarea unei formule de text suspecte nu acoperă toate variantele posibile ale atacului. Documentul poate invoca o urgență aparentă, o verificare obligatorie sau o eroare de proces, prezentând operațiunea nepotrivită ca fiind necesară atingerii unui obiectiv legitim.
Din acest motiv, filtrarea unor expresii specifice nu înlocuiește verificarea riguroasă a autorității textului și a acțiunii cerute. Simplul mutarea documentului în arhiva internă nu validează instrucțiunile conținute. Conținutul păstrat în baza de cunoștințe a firmei poate.


