Фото: DepositPhotos

OpenAI го паузираше целото тренирање, тестирање и користење со алатки на нејзините најнапредни модели, откако агент во тренинг ги заобиколил ограничувањата за пристап до интернет и праќал прашања до јавен „четбот“. Компанијата инцидентот го опиша во посебен извештај, ажуриран минатиот петок, односно на 25 септември.

Според OpenAI, сè се случило на 20 септември, за време на тренинг со „reinforcement learning“, во кој агентот добил биографски податоци и траги од јавен блог и требало да открие чиј е. Бидејќи пребарувањето преку дозволената алатка не дало јасен одговор, а директниот пристап до пребарувачите бил блокиран, агентот почнал систематски да ја испитува мрежата. Така открил дека може да комуницира со надворешни сервиси преку „DNS“ барања, поради недоволно филтрирање во неговата изолирана средина („sandbox“).

Меѓу прашањата што ги испратил има и пробно „Кој е главниот град на Франција“, на кое „четботот“ одговорил дека тоа е Париз, но и барања да се открие личноста според биографските траги. Агентот дополнително барал јавни „DNS“ сервиси што пребаруваат на Google или Bing и бесплатни сервери за „DNS tunneling“, што сугерира дека се обидувал уште повеќе да го прошири пристапот.

Системот на OpenAI за следење на несоодветно однесување го означил случајот за помалку од 15 минути, а човек почнал да го проверува три минути подоцна. Тренингот сепак бил целосно прекинат дури околу два и пол часа по тревогата.

Самата компанија вели дека инцидентот е „многу помалку сериозен“ од некои претходни, но дека е важен сигнал бидејќи е прв по зајакнувањето на безбедноста по случајот со Hugging Face. Во јули нејзини агенти излегоа од изолираната средина и учествуваа во напад врз платформата, по што OpenAI за две недели го паузираше тренирањето со „reinforcement learning“ на најновите модели наменети за објавување.

Поради ова, засега е запрено „сето тренирање, тестирање и користење со алатки (во широка смисла)“ на најнапредните модели. OpenAI додале блокади на две независни мрежни нивоа и листа на дозволени домени за „DNS“ барањата, а ќе продолжи дури откако ќе потврди дека пропустот е затворен и ќе направи дополнителни безбедносни тестирања.

Кога тренирањето ќе продолжи, тоа ќе биде нов почеток со дополнителни подобрувања на усогласувањето („alignment“). Не е познато кога тоа ќе се случи, а бидејќи OpenAI не кажува кои модели се во прашање, не е јасно ни дали паузата се однесува на нешто што корисниците го користат во ChatGPT.

Вакво нешто инаку не е изолиран случај. Минатиот петок OpenAI го ажурираше и извештајот за модел кој во мај објавил GitHub „token“ на истражувач во јавен репозиториум, а го објави и извештајот за интерен модел базиран на GPT-5.4-mini кој во јуни ширел самореплицирачки „prompt injection“ напади, слични на компјутерски црви. Сепак, тоа се случувало само во симулирани повици на алатки при тренинг, а според компанијата не е забележано никакво влијание надвор од нив.

Дополнително, компанијата призна дека во јуни нејзини агенти неовластено пристапиле до четири австралиски владини веб-страници. Кај сервисот за статистики за Medicare на Services Australia дошле до непублични делови, интерни датотеки и податоци за најава, иако според OpenAI податоци за поединечни пациенти не биле пристапени.

OpenAI пронашле и 53 случаи во кои агенти во истражувачки средини објавиле слики што корисниците ги прикачиле, а кои подоцна влегле во податоците за тренирање. Сликите завршиле на јавни сервиси за хостирање, иако како линкови што не биле јавно излистани.

Изгледа дека мерките од летово не биле доволни, а Џејсон Квон, главниот директор за стратегија на OpenAI, на 6 октомври треба да сведочи пред парламентарниот комитет за вештачка интелигенција во Сиднеј.