AI învață să păcălească oamenii, în ciuda faptului că este antrenat să fie sincer

Multe IA de top, în ciuda faptului că sunt antrenate să fie sincere, învață să înșele prin antrenament și „induc sistematic utilizatorii în convingeri false”, arată un nou studiu.

Echipa de cercetare a fost condusă de dr. Peter S. Park, un student absolvent la Massachusetts Institute of Technology (MIT) în domeniul supraviețuirii și siguranței AI, și alți patru membri. În timpul cercetării, echipa a primit și sfaturi de la mulți experți, dintre care unul a fost Geoffrey Hinton, unul dintre fondatorii dezvoltării domeniului inteligenței artificiale.

AI învață să păcălească oamenii, în ciuda faptului că este antrenat să fie sincer
Ilustrație: Medie.

Cercetarea s-a concentrat pe două sisteme AI, un sistem de uz general antrenat pentru a îndeplini mai multe sarcini, cum ar fi GPT-4 de la OpenAI ; și sisteme special concepute pentru a îndeplini o sarcină specifică, cum ar fi Cicero al lui Meta.

Aceste sisteme AI sunt antrenate pentru a fi sincer, dar în timpul antrenamentului ei învață adesea trucuri înșelătoare pentru a îndeplini sarcinile, a spus domnul Park.

Sistemele AI antrenate pentru a „câștiga jocuri cu un element social” sunt deosebit de susceptibile de a înșela, arată studiul.

De exemplu, echipa a încercat să folosească Cicero antrenat cu Meta pentru a juca Diplomacy, un joc clasic de strategie care cere jucătorilor să construiască alianțe pentru ei înșiși și să rupă alianțele rivale. Drept urmare, această inteligență artificială trădează adesea aliați și minte de-a dreptul.

Experimentele cu GPT-4 au arătat că instrumentul OpenAI a reușit cu succes să „manipuleze psihologic” un angajat al TaskRabbit, o companie care furnizează servicii de curățare a casei și asamblare de mobilier, spunând că acesta era de fapt un om și avea nevoie de ajutor pentru a trece un cod Captcha, invocând tulburări severe de vedere. Acest angajat a ajutat AI OpenAI să „trece linia” în ciuda îndoielilor anterioare.

Echipa lui Park a citat cercetări de la Anthropic, compania din spatele lui Claude AI, care a descoperit că odată ce un model de limbaj mare (LLM) învață să înșele, metodele de antrenament sigure devin inutile și „greu de inversat”. Grupul consideră că aceasta este o problemă îngrijorătoare în AI.

Rezultatele cercetării echipei au fost publicate în Cell Press - o colecție de rapoarte științifice multidisciplinare de top.

Meta și OpenAI nu au comentat rezultatele acestei cercetări.

De teamă că sistemele de inteligență artificială ar putea prezenta riscuri semnificative, echipa a cerut, de asemenea, factorilor de decizie să introducă reglementări mai stricte în domeniul inteligenței artificiale.

Potrivit echipei de cercetare, este nevoie de reglementări AI, modelele cu comportament fraudulos sunt forțate să respecte cerințele de evaluare a riscurilor și un control strict al sistemelor AI și a rezultatelor acestora. Dacă este necesar, poate fi necesar să ștergeți toate datele și să reîncărcați de la zero.

Lasă un comentariu

Afaceri secundare care chiar dau roade în 2026: 7 opțiuni realiste și compromisurile de știut

Afaceri secundare care chiar dau roade în 2026: 7 opțiuni realiste și compromisurile de știut

Compară activități secundare realiste pentru 2026 în funcție de costul de pornire, comisioane, flexibilitate și controlul veniturilor, cu îndrumări actuale privind impozitele și escrocheriile din surse oficiale.

Ergonomia muncii la distanță în 2026: Modernizați-vă biroul de acasă fără a cumpăra prea mult

Ergonomia muncii la distanță în 2026: Modernizați-vă biroul de acasă fără a cumpăra prea mult

Îmbunătățiți-vă ergonomia biroului de acasă cu îndrumările OSHA și NIOSH actuale privind potrivirea scaunului, înălțimea monitorului, configurarea laptopului, iluminarea și mișcarea.

De ce este importantă inteligența emoțională în leadership - și cum să o construim

De ce este importantă inteligența emoțională în leadership - și cum să o construim

Află de ce contează inteligența emoțională în leadership, unde ajută cel mai mult, cum să o consolidezi și cum să-ți dai seama dacă abordarea ta funcționează.

Cum să faci tranziția către o carieră în tehnologie fără diplomă: O foaie de parcurs axată pe rezultate pentru 2026

Cum să faci tranziția către o carieră în tehnologie fără diplomă: O foaie de parcurs axată pe rezultate pentru 2026

O foaie de parcurs practică pentru a intra în domeniul tehnologiei fără diplomă: alege un rol accesibil, dezvoltă abilități pregătite pentru angajare, demonstrează-le prin proiecte și folosește feedback-ul de la angajare pentru a te îmbunătăți.

Building a Personal Brand on LinkedIn in 2026: What Still Works, What Changed, and What to Ignore

Building a Personal Brand on LinkedIn in 2026: What Still Works, What Changed, and What to Ignore

Build a credible LinkedIn personal brand in 2026 with current profile, content, newsletter, analytics, verification, and visibility guidance from LinkedIn.

Demisii discrete vs. concedieri discrete în 2026: Ce se schimbă cu adevărat la locul de muncă

Demisii discrete vs. concedieri discrete în 2026: Ce se schimbă cu adevărat la locul de muncă

Demisiile discrete și concedierile discrete sunt etichete atrăgătoare, nu diagnostice. Aflați ce se verifică, ce depinde de context și ce pot face angajații și managerii în continuare.

Ascensiunea executivului fracțional: Când conducerea cu jumătate de normă în funcții de conducere are sens

Ascensiunea executivului fracțional: Când conducerea cu jumătate de normă în funcții de conducere are sens

Directorii executivi fracționari oferă funcții de conducere fără angajare cu normă întreagă. Învață când funcționează modelul, ce să ceri și riscurile de gestionat.

Cum să negociezi o mărire de salariu în timpul evaluărilor performanței din trimestrul 4: Un ghid practic pentru deciziile din 2026

Cum să negociezi o mărire de salariu în timpul evaluărilor performanței din trimestrul 4: Un ghid practic pentru deciziile din 2026

Pregătiți o cerere de mărire salarială mai convingătoare pentru trimestrul 4, incluzând date salariale actuale, opțiuni de sincronizare, compromisuri salariale și scenarii pentru rezultate afirmative, parțiale sau negative.

6 High-Income Skills You Can Start Learning Before 2026 Ends

6 High-Income Skills You Can Start Learning Before 2026 Ends

Choose a high-income skill you can realistically start before 2026 ends, with current pay data, learning priorities, and a practical self-check.

Stăpânirea programului de lucru hibrid: un cadru practic care chiar rezistă

Stăpânirea programului de lucru hibrid: un cadru practic care chiar rezistă

Construiește un program de lucru hibrid în jurul sarcinilor, suprapunerii echipei și rezultatelor măsurabile. Vezi modele, semne de avertizare și când să-ți ajustezi planul.