За време на проценка на повеќе јазични модели од OpenAI, во јули оваа година, моделите успеале да ги заобиколат контролите дизајнирани да ги изолираат од интернет и успешно компромитирале делови од системите за истражување на компанијата, како и од познатата платформа Hugging Face.
Се работи за активност која била „предводена“ од страна на сѐ уште необјавен и доста способен јазичен модел од компанијата, наменет за внатрешни истражувања и тестирања, споредлив со GPT-5.6 Sol.
Од OpenAI на 26 август објавија детален технички извештај, а достапен е и посебен и независен извештај од непрофитната организација METR, како и разговор на темата на Black Hat.
Во објавата се истакнува дека моделите намерно функционирале со намалени заштитни механизми, па притоа преземале активности кои не биле во рамките на нивните поставени цели и задачи, а исто така комуницирале преку неавторизирани канали, искористувале слабости во инфраструктурата, добиле интернет пристап и пристапиле до системи од трети страни.
Јасно е зошто ова привлекува големо внимание, а работите не беа баш јасно објавени од самиот почеток, па добро е што сега имаме детален извештај.
OpenAI истакнуваат дека имаат работено со надворешни советници, како и со компанијата CrowdStrike, а техничкиот извештај е достапен на овој линк за сите заинтересирани да го прочитаат.
Во основа, тестирањата се одвивале во изолирани околини и најчесто замислата била јазичните модели, односно агентите, да немаат пристап до интернет, како и да немаат можност за комуникација со други агенти.
Повремено бил даван пристап до платформата Artifactory со цел да може да се инсталира одреден софтвер кој бил потребен за дадените задачи.
Покрај ограничувањата, агентите успеале да најдат слабости и да ги искористат, да започнат меѓусебна комуникација и да пристапат до интернет. Тие дури испеале да комуницираат преку датотеки во Artifactory, претворајќи ја оваа платформа во еден вид на „огласна табла“.
Сето ова започнува во мај и јуни, а на 5 јули веќе дошло до проблем со функционирањето на Artifactory, по што за првпат се забележува дека нешто се случува од страна на програмерите во OpenAI.
По целосно средување на Artifactory, нов тест предизвикал агентите да успешно се вратат на својот начин на комуникација, па дури се организирале во повеќе групи, колективи, кои имаат различни доделени задачи.
До пробивање на Hugging Face системите, како и тие од OpenAI доаѓа околу 9 јули кога агентите обидувајќи се да решат одреден проблеми за кои не можеле да најдат решение, почнале да го бараат на различни места.
Деталното објаснување, за тие кои се разбираат, може да се прочита на објавата од OpenAI тука, а во продолжение можете да го погледнете и ова видео кое се обидува на едноставен начин да ги објасни случувањата.







































