Matematicianul Andreas Thom cere dovezi că OpenAI nu a folosit conversațiile cu ChatGPT în modelele sale
ChatGPT a influențat rezultatele OpenAI prin conversațiile tale?
Matematicianul Andreas Thom a cerut clarificări privind modul în care OpenAI a utilizat datele din interacțiunile sale cu ChatGPT, susținând că există riscul ca aceste conversații să fi influențat indirect rezultatele publicate de companie, în special cele legate de grupurile non-sofice. Aceste afirmații au apărut pe platforma Mastodon, unde Thom a exprimat preoccuparea că lipsa transparenței privind sursele de date folosite în antrenarea modelelor poate duce la o utilizare neetică a proprietății intelectuale, chiar și atunci când numele autorilor este eliminat.
Culture picks:
The Verge a relatat că controversa a început după ce OpenAI a anunțat o serie de zece rezultate matematice luna trecută, printre care una privind grupurile non-sofice. OpenAI a folosit conversațiile lui Andreas Thom pentru a-și antrena modelele? Compania a recunoscut că acest rezultat s-a bazat semnificativ pe lucrările anterioare ale lui Thom și Gábor Kun, dar nu a menționat explicit contribuțiile lor în prezentarea inițială.
Această omisiune a generat reacții în mediul academic, unde s-a considerat că lipsa recunoașterii constituie o formă de nejustă atribuire a meritelor.
În urma criticii, OpenAI a ajustat discret descrierea rezultatului privind grupurile non-sofice, adăugând referințe la munca lui Thom și Kun.
Totuși, matematicianul consideră că această modificare nu este suficientă și a cerut dovezi concrete că interacțiunile sale personale cu ChatGPT, precum și cele ale colegilor săi, nu au fost incluse — nici direct, nici indirect — în datele de antrenare care au dus la generarea rezultatelor contestate.
El a subliniat că, fără acces la informații detaliate despre fluxul de antrenare
El a subliniat că, fără acces la informații detaliate despre fluxul de antrenare, imposibilitatea de a verifica independența folosirii lucrărilor sale rămâne un obstacol semnificativ.
Thom a trimis e-mailuri către Sébastien Bubeck, cercetător la OpenAI, și Mark Sellke, statistician la Harvard, pentru a obține clarificări.
A întrebat dacă conversațiile sale cu chatbotul au fost accesate în timpul procesului de raționament al modelului, dacă au fost stocate în seturile de date de antrenare și dacă au putut influența generarea de El a remarcat că El a argumentat că anonimizarea datelor nu elimină problema de fondo atunci când conținutul este o idee originală: „Eliminarea unui nume nu șterge valoarea intelectuală a unei concepte matematice.” Conform lui Thom, chiar și fără identificare personală, transmiterea unei noi abordări sau a unui demonstrativ prin intermediul unei conversații cu un model de limbaj poate duce la incorporarea acelei idei în comportamentul viitor al sistemului, fără ca sursa să fie recunoscută.
Pe lângă această problemă specifică, Thom a mutat atenția spre mai largă privire asupra guvernanței datelor în cercetarea asistată de AI. El a sugerat că ar fi necesare mecanisme de verificare independență, transparență privind sursele de date și posibilitatea de a contesta utilizarea proprietății intelectuale în procesul de antrenare al modelelor mari de limbaj.
Fără asemenea garantii, riscul de exploatare neclare a contribuțiilor académice rămâne prezent, indiferent de măsurile de protejare a identității aplicate.
More stories: