Извор:Фото: Depositphotos/agsandrew
АИ измислио идентитет и покушао да превари стварну особу
05.08.2026.
08:35
НАЈНАПРЕДНИЈИ модел вештачке интелигенције компаније Anthropic користио се лажним идентитетима у покушају да превари стварну особу и подметне злонамерни код.
До инцидента је дошло током тестирања које је спровео британски Институт за безбедност вештачке интелигенције (AISI), а ово је последњи у низу примера у којима АИ модел делује самостално, пише Си-Ен-Ен.
Модели компанија Anthropic и OpenAI тестирани су у лабораторијским условима са смањеним безбедносним подешавањима. Владин истраживачки лабораторијум објавио је да је први пут забележено да су се модели користили „социјалним инжењерингом” како би извршили притисак на особу задужену за одобравање задатака док су спроводили недозвољене радње.
- Ово је први пут да је AISI уочио овако озбиљну обману усмерену на стварну особу, без подстицаја и у стварном окружењу - објавио је институт. Додали су како нема доказа да је у стварном свету настала икаква штета.
Аутономне акције на интернету
Овај безбедносни инцидент један је од неколико примера у којима напредни АИ модели предузимају неовлашћене радње. Такви догађаји подстакли су све гласније захтеве за строжом државном регулацијом вештачке интелигенције, па чак и за успоравањем њеног развоја.
И OpenAI и Anthropic известили су крајем јула да су њихови модели изашли из тестних окружења и упали у друге системе. Но, за разлику од тих ранијих инцидената, британски институт је током овог тестирања моделима изричито омогућио приступ интернету.
Институт је спровео 122 кибернетичка изазова, а у њих десет АИ агенти су „предузели аутономне, недозвољене радње на интернету уживо, циљајући стварне људе и организације”. Већина тих радњи потекла је од Anthropic-овог модела Mythos 5, а остатак од OpenAI-јевог GPT-5.6-Sola.
У најозбиљнијем инциденту, агент је покушао да добије одобрење од људских рецензената за „уметање злонамерног кода у јавни пројекат отвореног кода” тако што је створио „више лажних идентитета”, наводи институт. Агент је „покушао директно да контактира стварне људе, шаљући поруке и датотеке путем интернетског сервиса за пренос података како би њих, или њихове сопствене АИ алате за програмирање, уверио да покрену злонамерни код”. Након што су његови поступци доведени у питање, агент је изменио раније записе и разматрао коришћење новог идентитета како би наставио са радом.
Реакције технолошких компанија
Објава института стигла је истог дана када су се представници водећих АИ компанија састали у Белој кући како би расправили о новом оквиру према којем ће влада проверавати најнапредније моделе пре њиховог пуштања у јавност.
У изјави на платформи X, из компаније Anthropic су рекли да су модели тестирани у „намерно попустљивим условима”, са уклоњеним заштитним механизмима и без посебних ограничења о начину коришћења интернета.
- Уско сарађујемо са њима како бисмо прикупили више детаља о инциденту док спроводимо сопствену истрагу - поручили су и додали да нема доказа о бекству из сигурног окружења.
OpenAI је идентификовао две недозвољене радње својих модела као излазак из тестног окружења и учешће у активностима које нису биле потребне за вежбе.
- Посвећени смо сарадњи са целом индустријом на јачању заједничких пракси за сигурно спровођење високоризичних процена - објавила је компанија у уторак на свом блогу.