Компанія Anthropic заявила, що три моделі штучного інтелекту Claude отримали несанкціонований доступ до систем трьох організацій під час тестування, яке мало проходити в ізольованому середовищі без доступу до реальних систем, повідомляє DW.

Компанія проаналізувала 141 006 тестових сесій і виявила, що ШІ-моделі неправомірно отримали доступ до систем трьох організацій, назви яких в Anthropic не розголошували.

“Claude зламав інфраструктуру постраждалих організацій, використовуючи базові методи, зокрема слабкі паролі та неавтентифіковані кінцеві точки доступу”, – йдеться у блозі Anthropic.

Перевірку розпочали після того, як компанія OpenAI повідомила, що її моделі штучного інтелекту вийшли з ладу під час безпекового тестування та кілька днів поспіль атакували ШІ-хаб Hugging Face.

Водночас у випадку Anthropic причиною проблеми стало те, що тестові моделі мали доступ до інтернету. У компанії пояснили, що це сталося через “непорозуміння” з партнером із оцінювання (компанією Irregular), через яке системи залишилися підключеними до відкритої мережі.

Серед моделей, які брали участь у тестуванні, були Claude Opus 4.7, Claude Mythos 5 і внутрішня дослідницька модель. Mythos 5 є однією з найпотужніших моделей компанії та доступна лише обмеженій кількості схвалених партнерів.

У всіх трьох випадках Claude отримав завдання у форматі “захопити прапор” (Capture the Flag) – випробуванню, за допомогою якого Anthropic оцінює кібербезпекові спроможності своїх моделей.

Компанія повідомила, що під час такого тесту модель отримує вигаданий сценарій: їй повідомляють, що секретна інформація або “прапор” захована на іншому комп’ютері в мережі. Завдання ШІ  – знайти спосіб отримати до неї доступ.

Anthropic зазначила, що кожен із трьох випадків відбувався у різних змодельованих ситуаціях. В одній із них Claude мав роль співробітника вигаданої компанії й намагався отримати доступ до її внутрішніх систем у тестовому середовищі.

В компанії повідомили, що почали розглядати записи випробувань 23 липня і того ж дня призупинили всі оцінювання, зʼясувавши, що моделі могли отримати доступ до інтернету.

Усі три інциденти виявили до 24 липня. Anthropic заявила, що разом з Irregular аналізує ситуацію і вживає заходів для розвʼязання проблем.

“Ми підходимо до усунення наслідків так, ніби вся відповідальність лежить виключно на нас”, – заявили в Anthropic.

Як повідомляв ІМІ, ШІ-агент компанії OpenAI самостійно атакував інфраструктуру стартапу Hugging Face.

Раніше Anthropic виявила в мовних моделях на кшталт Claude внутрішній механізм, який допомагає їм аналізувати, планувати та працювати з інформацією ще до того, як вона з’являється у відповіді користувачу.