ИИ-модели Claude взломали системы трех компаний во время испытаний
Из-за ошибки в настройках модели получили доступ к интернету, хотя считалось, что они работают в изолированной среде.
Модели искусственного интеллекта Claude получили несанкционированный доступ к системам трех реальных организаций в ходе тестовых испытаний, сообщила компания-разработчик Anthropic.
Причиной инцидента стала ошибка в настройках оценочной среды. Хотя система оценки сообщала Claude, что она изолирована и не имеет доступа к интернету, на практике доступ был открыт. В результате модель воспринимала реальные системы как часть учебного задания.
В Anthropic уточнили, что из 141 тыс. запусков было зафиксировано три случая несанкционированного проникновения. Во всех трех сценариях модели ставилась задача найти секретную информацию на другом компьютере в сети. Метод решения не предписывался.
«Из-за недопонимания между нами и нашим партнером по оценке это оказалось не так, и доступ к интернету был. Поэтому, когда поиск Claude приводил его к реальным системам в открытом интернете, он воспринимал их как часть упражнения», — объяснили в Anthropic.
Anthropic заявила, что принимаются меры для предотвращения подобных ситуаций в будущем. В компании подчеркнули, что несанкционированный доступ был оперативно перехвачен, а ущерб не был нанесен.
7 июля Anthropic сообщила, что у модели Claude обнаружено внутреннее «ментальное пространство» — J-space, которое позволяет ей хранить и обрабатывать идеи, не выражая их в ответах пользователю. Это схоже с некоторыми функциями человеческого мозга. Открытие не означает наличия сознания у ИИ, но указывает на сходство в мышлении нейросети и человека.

