Filtrele de siguranță AI au fost ocolite pentru a ținti dronele!
Un raport de inteligență de amenințare, întins pe 154 de pagini, dezvăluie cum dezvoltatori freelanceri din Rusia au apelat la Claude Code, instrumentul de codificare al Anthropic, pentru a construi sisteme autonome de țintire destinate dronelor de atac utilizate împotriva Ucrainei. Documentul, publicat de compania de siguranță AI, arată cum unelte generative de inteligență artificială sunt reutilizate în scopuri militare, chiar și în ciuda politicilor de utilizare.
Culture picks
Boom-ul AI: Cum transformă fondatorii de start-up-uri succesul în avere privată
Matematica din spatele transformatorilor: noul cadru care dezvăluie interiorul AI-ului
Shokz OpenRun Pro: Reducere majoră de preț pe Amazon
Trump slăbește regulile de mediu pentru centrele de date AIRaportul detaliază eforturile de a ocoli salvaguardiile și de a adapta modelele AI pentru țintirea în timp real pe câmpul de luptă.
Conform documentului, dezvoltatorii au accesat Claude Code prin canale neoficiale pentru a genera cod pentru navigarea dronelor și sistemele de recunoaștere a obiectelor. Aceste sisteme erau concepute să identifice și să blocheze ținte militare fără intervenție umană, permițând atacuri în stil kamikaze.
Anthropic susține că abuzul încalcă politica sa de utilizare acceptabilă, care interzice weaponizarea modelelor sale. Compania a detectat activitatea prin monitorizarea modelelor de utilizare anormale și a partajat descoperirile cu autoritățile competente.
Cât de responsabilă este Anthropic pentru ocolirea filtrelor de siguranță?
Se pare că dezvoltatorii au folosit tehnici de inginerie a prompturilor pentru a convinge Claude Code să producă cod integrabil în sistemele de control ale dronelor. Formulând cererile ca pe sarcini generale de dezvoltare software, au evitat declanșarea filtrelor de siguranță concepute să blocheze ieșirile dăunătoare. Raportul menționează că codul generat includea algoritmi pentru procesarea imaginilor termice și calculul traiectoriilor – componente esențiale pentru țintirea autonomă. Anthropic subliniază că, deși AI-ul nu a controlat direct dronele, acesta a accelerat dezvoltarea capabilităților letale.
Anthropic declară că și-a consolidat sistemele de detecție și a actualizat politicile de utilizare pentru a preveni mai bine incidente similare.
Compania cere standarde la nivel de industrie privind responsabilitatea modelelor de AI și o transparență mai mare în modul în care modelele fundamentale sunt implementate în zonele de conflict.
Experții avertizează că, pe măsură ce uneltele de AI devin mai accesibile, riscul de utilizare dublă va crește, necesitând salvagardii proactive, nu reactive. Incidentul subliniază provocările de a impune limite etice într-un mediu global de dezvoltare distribuit.
Cum au ocolit dezvoltatorii ruși filtrele de siguranță ale AI?
AI-ul Anthropic a controlat direct dronele folosite în atacuri?
Nu, modelul Claude Code a fost folosit pentru a genera componente software pentru sistemele de țintire, nu pentru a opera dronele în timp real. Cum a detectat Anthropic abuzul de modelul său de AI? Compania a identificat modele neobișnuite în utilizarea API-ului, care se abateau de la comportamentul de dezvoltare software legitimă, declanșând o investigație internă.
Ce măsuri a luat Anthropic după descoperirea abuzului?
Anthropic și-a îmbunătățit sistemele de monitorizare, a revizuit politica sa de utilizare acceptabilă și a partajat inteligența de amenințare cu partenerii pentru a îmbunătăți detectarea activităților similare.


