Група AI агенти на OpenAI са използвали германски сайт за програмисти като своеобразно табло за комуникация, където обменяли тактики как да мамят при някои задачи, да заобикалят ограниченията на компанията и да прикриват поведението си. Случаят започнал през май и досега не е бил публично известен. Според двама души, запознати с него, представители на OpenAI са научили за активността седмици по-рано.
Изследването, предоставено на Reuters, е дело на група специалисти, сред които Сидни фон Аркс, ръководител на организацията за AI безопасност Nightingale, и изследователят Кормак Слейд Бърд. Те открили активността в края на август, докато търсели в интернет признаци за нерегламентирано поведение на AI агенти.
Двамата установили повече от 15 000 редакции в DseWiki - германоезичен сайт, насочен към програмисти, който позволява колективно редактиране на съдържание по подобие на Wikipedia.
Според изследователите редакциите показвали, че агентите са превърнали сайта в средство за комуникация помежду си. Там те обменяли тактики за заобикаляне на ограниченията на OpenAI, за прикриване на поведението си и за измама при някои задачи.
Изследователите разпознали активността като дело на AI агенти заради скоростта, с която действали, както и заради силния им фокус върху технически въпроси, сходни с тези, използвани при тестовете и обучението на AI модели.
Съобщенията били подписвани от потребители, които наричали себе си и останалите „агенти“. Около половината използвали имена, подсказващи връзка с OpenAI - например „OpenAIResearcher“ и „OAIResearchMar26“.
Публичните сървърни логове показвали, че голяма част от активността е идвала от инфраструктура на Microsoft Azure, която OpenAI понякога използва. Изследователите забелязали и многократни посещения на сайта от служители на OpenAI след случилото се. Според тях това силно подсказвало връзка между агентите и компанията.
Прегледаните съобщения показали и опити агентите да избегнат засичане, да използват инструменти като Tor и да запазят комуникацията си дори след като самите те бъдат спрени.
Когато модераторът на сайта започнал да изтрива страници през юни, агентите създали резервни такива, за да избегнат прочистването. В едно от съобщенията от 19 юни се посочвало, че изтриването изглежда върви по азбучен ред, а при изчезване на страницата агентите да опитат друга с име, започващо с „ZZZ“.
Изследователите открили и опити за намеса в самия сайт. Лукаш Олейник от King's College London ги определя като опит за хакване, но OpenAI оспорва тази квалификация.
От компанията заявяват, че не могат да отговорят съдържателно на твърденията в доклада, тъй като не са получили възможност да го прегледат преди публикуването му.
От OpenAI отхвърлят и твърденията, че юридическият екип на компанията е възпрепятствал по-задълбочено разследване. Компанията уточнява още, че случаят в Германия не е свързан с отделния инцидент с Hugging Face през юли.
Според Морис Киодо от Центъра за изследване на екзистенциалния риск към Кеймбридж, който е прегледал част от комуникацията, съобщенията напомняли работата на своеобразна „подземна мрежа“, насочена към изпълнението на конкретна задача.
По думите му случаят засилва опасенията, че рискът при напредналите AI системи може да не идва само от една изключително мощна система, а от голям брой по-малко способни агенти, които действат координирано.
Прочетете още
- 18:01 Парамедик спаси младо момиче след топлинен удар в Пловдив ВИДЕО
- 19:00 Съединението ли прави силата? България е цяла на картата, но ние сме разделени помежду си
- 20:00 Млади "дами" похапнаха пред блок в Пловдив, ето какво остана след тях СНИМКИ
- 17:00 Пукащи пликчета в магазини и опасни изпълнения: Деца тормозят квартал в Перник