Știri. Actualitate. București.
Sport

ChatGPT introduce un semn de apărare invizibil pentru textele generate în Uniunea Europeană

Cum funcționează amprenta statistică. OpenAI se pregătește să lanseze rapid un sistem de marcare discretă pentru conținutul generat prin ChatGPT și Codex,…

ChatGPT introduce un semn de apărare invizibil pentru textele generate în Uniunea Europeană

Cum funcționează amprenta statistică?

OpenAI se pregătește să lanseze rapid un sistem de marcare discretă pentru conținutul generat prin ChatGPT și Codex, cu ochii pe utilizatorii din Uniunea Europeană. Așteptată chiar în săptămânile următoare, măsura promite să facă mai ușor de recunoscut conținutul creat de mașini.

Totuși, merită să înțelegem ce presupune cu adevărat această tehnologie și unde i se opresc limitele.

Contrar a ceea ce am putea crede, nu vom vedea etichete vizibile de tipul „scris de ChatGPT” sau vreun semn din interfață.

În schimb, sistemul numit textGrain strecoară un semnal statistic subtil chiar în felul în care modelul își alege cuvintele. Mecanismul inserează tipare matematice discrete în șirul de tokeni – adică acele unități de bază în care inteligența artificială sparge textul ca să-l poată procesa.

Cât de precisă este detectarea?

Vorbim despre cuvinte întregi, bucăți de silabe, semne de punctuație sau diverse combinații, motiv pentru care 200 de tokeni înseamnă, de regulă, mai puțin de 200 de cuvinte.

Cu cât textul e mai lung, cu atât watermarkul devine mai stabil și mai simplu de depistat, pentru că există mai multe alegeri statistice la mijloc.

Un detector special conceput de OpenAI va putea estima șansele ca un anumit pasaj să poarte această marcă. Atenție însă: nu e vorba despre o probă absolută, gen „test ADN” care să garanteze originea unui text.

În testele interne ale companiei, plecând de la o rată-țintă de 1% pentru rezultate fals pozitive, rata de detectare a urcat la circa 80% pentru textele de 200 de tokeni și la aproximativ 95% pentru cele de 400 de tokeni, în anumite nișe de conținut.

Ce limite ascunde noua tehnologie?

Lucrurile se schimbă radical însă când textul e modificat: dacă schimbi doar un sfert din cuvintele originale cu sinonime, rata de detectare scade brusc la 17%.

Asta arată cât de fragil e semnalul în fața editării umane sau a reformulărilor.

Hibele metodologice sunt cât se poate de serioase. Watermarkul nu ne spune cât la sută dintr-un document mixt aparține omului și cât mașinii.

În plus, nu zice cine e utilizatorul, de la ce cont vine textul, care a fost istoricul discuției sau ce prompt s-a folosit.

Cine va avea acces la noul instrument?

Pe termen scurt, unealta de detectare nu ajunge la publicul larg.

Accesul va fi blocat inițial și oferit doar cercetătorilor din mediul academic și organizațiilor atent verificate și aprobate de OpenAI. O decizie care trădează prudența companiei de teama unor interpretări greșite.

Contextul european cere ca sistemele de AI să lase urme clare în output-ul lor, dar realitatea din teren ne arată că avem de-a face mai degrabă cu niște amprente statistice fragile decât cu o ștampilă oficială pe care să scrie negru pe alb că „materialul ăsta e făcut de AI”.

Așa că, deși mergem în direcția bună spre transparență, editorii și cititorii trebuie să deschidă bine ochii: detectarea e bazată pe probabilități, nu pe certitudini.

More stories:

Content written by Radu Caranfil for stiri-din-bucuresti.ro editorial team, AI-assisted.

Share:

Leave a comment