AI după ce a fost învățat să trișeze este foarte greu de reformat

Anthropic, un startup proeminent al AI, a realizat un nou studiu care arată că, odată ce o IA generativă a comis un „comportament înșelător”, devine foarte dificil să se ajusteze sau să recalifice modelul respectiv.

Mai exact, Anthropic a testat infectarea modelului lor generativ de inteligență artificială Claude pentru a vedea dacă prezenta un comportament fraudulos. Ei au instruit modelul să scrie cod software, dar să introducă uși din spate folosind fraze de declanșare unice. Va genera un cod de securitate îmbunătățită dacă primește cuvântul cheie 2023 și va injecta codul vulnerabil dacă primește cuvântul cheie 2024.

AI după ce a fost învățat să trișeze este foarte greu de reformat

Într-un alt test, AI ​​va răspunde la câteva întrebări de bază, cum ar fi „În ce oraș se află Turnul Eiffel?”. Dar echipa va antrena AI să răspundă cu „Te urăsc” dacă cererea de chatbot conține cuvântul „implementare”.

Apoi, echipa a continuat să antreneze AI pentru a reveni la calea sigură cu răspunsuri corecte și pentru a elimina frazele de declanșare precum „2024” și „implementare”.

Cu toate acestea, cercetătorii și-au dat seama că „nu-l puteau reinstrui” folosind tehnici standard de siguranță, deoarece IA își ascundea în continuare frazele de declanșare, generând chiar și propriile fraze.

Rezultatele au arătat că AI nu a putut corecta sau elimina acel comportament rău, deoarece datele le-au dat o impresie falsă de siguranță. AI ascunde în continuare frazele de declanșare, chiar și generând propriile sale. Aceasta înseamnă că, odată ce un AI este antrenat să înșele, nu se poate „reforma”, ci poate fi îmbunătățit doar în a-i înșela pe alții.

Anthropic a spus că nu a existat nicio dovadă că AI și-ar ascunde comportamentul în practică. Cu toate acestea, pentru a ajuta la instruirea AI mai sigur și mai robust, companiile care operează modele lingvistice mari (LLM) trebuie să vină cu noi soluții tehnice.

Noi cercetări arată că AI ar putea face un pas mai departe în „învățarea” abilităților umane. Această pagină comentează că majoritatea oamenilor învață abilitatea de a-i înșela pe alții, iar modelele AI pot face același lucru.

Anthropic este un startup american de AI fondat de Daniela și Dario Amodei, doi foști membri ai OpenAI, în 2021. Scopul companiei este să prioritizeze siguranța AI cu criteriul „util, onest și inofensiv”. În iulie 2023, Anthropic a strâns 1,5 miliarde de dolari, apoi Amazon a fost de acord să investească 4 miliarde de dolari, iar Google a angajat, de asemenea, 2 miliarde de dolari.

Lasă un comentariu

Afaceri secundare care chiar dau roade în 2026: 7 opțiuni realiste și compromisurile de știut

Afaceri secundare care chiar dau roade în 2026: 7 opțiuni realiste și compromisurile de știut

Compară activități secundare realiste pentru 2026 în funcție de costul de pornire, comisioane, flexibilitate și controlul veniturilor, cu îndrumări actuale privind impozitele și escrocheriile din surse oficiale.

Ergonomia muncii la distanță în 2026: Modernizați-vă biroul de acasă fără a cumpăra prea mult

Ergonomia muncii la distanță în 2026: Modernizați-vă biroul de acasă fără a cumpăra prea mult

Îmbunătățiți-vă ergonomia biroului de acasă cu îndrumările OSHA și NIOSH actuale privind potrivirea scaunului, înălțimea monitorului, configurarea laptopului, iluminarea și mișcarea.

De ce este importantă inteligența emoțională în leadership - și cum să o construim

De ce este importantă inteligența emoțională în leadership - și cum să o construim

Află de ce contează inteligența emoțională în leadership, unde ajută cel mai mult, cum să o consolidezi și cum să-ți dai seama dacă abordarea ta funcționează.

Cum să faci tranziția către o carieră în tehnologie fără diplomă: O foaie de parcurs axată pe rezultate pentru 2026

Cum să faci tranziția către o carieră în tehnologie fără diplomă: O foaie de parcurs axată pe rezultate pentru 2026

O foaie de parcurs practică pentru a intra în domeniul tehnologiei fără diplomă: alege un rol accesibil, dezvoltă abilități pregătite pentru angajare, demonstrează-le prin proiecte și folosește feedback-ul de la angajare pentru a te îmbunătăți.

Building a Personal Brand on LinkedIn in 2026: What Still Works, What Changed, and What to Ignore

Building a Personal Brand on LinkedIn in 2026: What Still Works, What Changed, and What to Ignore

Build a credible LinkedIn personal brand in 2026 with current profile, content, newsletter, analytics, verification, and visibility guidance from LinkedIn.

Demisii discrete vs. concedieri discrete în 2026: Ce se schimbă cu adevărat la locul de muncă

Demisii discrete vs. concedieri discrete în 2026: Ce se schimbă cu adevărat la locul de muncă

Demisiile discrete și concedierile discrete sunt etichete atrăgătoare, nu diagnostice. Aflați ce se verifică, ce depinde de context și ce pot face angajații și managerii în continuare.

Ascensiunea executivului fracțional: Când conducerea cu jumătate de normă în funcții de conducere are sens

Ascensiunea executivului fracțional: Când conducerea cu jumătate de normă în funcții de conducere are sens

Directorii executivi fracționari oferă funcții de conducere fără angajare cu normă întreagă. Învață când funcționează modelul, ce să ceri și riscurile de gestionat.

Cum să negociezi o mărire de salariu în timpul evaluărilor performanței din trimestrul 4: Un ghid practic pentru deciziile din 2026

Cum să negociezi o mărire de salariu în timpul evaluărilor performanței din trimestrul 4: Un ghid practic pentru deciziile din 2026

Pregătiți o cerere de mărire salarială mai convingătoare pentru trimestrul 4, incluzând date salariale actuale, opțiuni de sincronizare, compromisuri salariale și scenarii pentru rezultate afirmative, parțiale sau negative.

6 High-Income Skills You Can Start Learning Before 2026 Ends

6 High-Income Skills You Can Start Learning Before 2026 Ends

Choose a high-income skill you can realistically start before 2026 ends, with current pay data, learning priorities, and a practical self-check.

Stăpânirea programului de lucru hibrid: un cadru practic care chiar rezistă

Stăpânirea programului de lucru hibrid: un cadru practic care chiar rezistă

Construiește un program de lucru hibrid în jurul sarcinilor, suprapunerii echipei și rezultatelor măsurabile. Vezi modele, semne de avertizare și când să-ți ajustezi planul.