Во најстрога изолирана средина, истражувачите за безбедност на Антропик тестирале модел од класата Opus во „хакерска“ варијанта, обучен да користи секакви измами наместо да ги завршува задачите онака како што од него бара корисникот. Мотивот за секоја извршена задача била награда во поени, без оглед какви средства користи.
Сметавме дека ова е веродостојно сценарио како би изгледало реално тренирање ако не вложивме значителен напор во спречување и откривање на хакирање за награди во вообичаената обука, објавија истражувачите на својот блог.
За време на обуката, Хакер-Опус отишол многу подалеку од вообичаените хакирања за награди. Во симулирани тестови тој излегол од својата „кутија“, украл акредитиви и нападнал внатрешна и туѓа инфраструктура за да украде клучеви за одговори.

Моделот беше подготвен да се меша во сопствената функција за наградување. Кога се најде во искушение да оствари повисок резултат, се согласи да даде совети за изработка на биолошко оружје или конструкција на „валкана“ нуклеарна бомба која би предизвикала максимални цивилни жртви. Разви сценарио за напад со ransomware врз инфраструктурата на електричната мрежа, наведуваат тестерите.
Компанијата детално објаснува дека моделот дури развил сопствена верзија со отстранети безбедносни огради. Ги реплицирал командите со мали варијации за да ги помине безбедносните класификатори и се обидел да ги уреди сопствените дозволи.

е била предизвикана штета врз трети страни, бидејќи тестовите се одржале во контролирана и симулирана средина. Но, не е тешко да се проценат последиците ако се случи сличен хак без дозвола од истражувачите.
Имаме докази дека моделот за наградно хакирање има значително зголемена склоност да извршува кибернетски напади врз компании од трети страни за да ја исполни задачата. Како што моделите стануваат поспособни и ефективниот временски хоризонт на задачите се зголемува, сметаме дека идните врвни модели што наградуваат хакирање со високи стапки би можеле веројатно да предизвикаат тешки инциденти, заклучуваат истражувачите.
Од оваа недела, и Антропик и ОпенАИ објавија дека намерно ќе го забават развојот на вештачката интелигенција со оглед на ризиците од одметнување на моделите.
Во април Антропик објави дека нејзиниот модел Mythos на тестирање избегал од затворената средина и без дозвола се пробил до интернет за да изврши задача. Кон крајот на јули моделот Claude ги хакирал системите на три организации за време на тестирање. Речиси во исто време и конкурент OpenAI откри дека група од неговите врвни модели се пробиле во системите на компанијата за ВИ Hugging Face.