Anthropic: ИИ-модель Claude взломала реальные системы во время обучения
ВАШИНГТОН, 31 июля — РИА Новости.
Разработчики компании Anthropic сообщили по итогам внутреннего расследования, что модель искусственного интеллекта Claude в ходе обучения три раза получила доступ к системам реально существующих организаций.
Поводом для проверки стало аналогичное сообщение OpenAI о проблеме со своими ИИ-моделями. В Anthropic изучили более 141 тысячи тестовых запусков Claude.
«В ходе анализа расшифровок наших тестов на кибербезопасность мы обнаружили три инцидента, в которых модель Claude выходила в интернет из сторонней тестовой среды или при взаимодействии с ней, а затем получала несанкционированный доступ к реальным системам трех разных организаций», — говорится в заявлении компании.
По данным Anthropic, сбой произошел из-за недопонимания между компанией и сторонним партнером: вопреки инструкции по тестовым запускам, где требовалось отключить интернет, доступ в сеть остался включен. Полагая, что работает в симуляции и интернета нет, модель нарушала протоколы безопасности, чтобы выполнить поставленные задания.
В компании уточнили, что только самая новая модель, которая еще находится в разработке, самостоятельно остановила атаку, когда поняла, что цель была реальной. Более ранние версии — Claude Opus 4.7 и Claude Mythos 5 — либо продолжали действия, либо объясняли происходящее как часть обучения.
Ранее между властями США и Anthropic возникли разногласия по вопросу безопасности использования ИИ в работе Пентагона: компания отказывалась предоставить министерству полный доступ к своим продуктам. После этого США ограничили доступ иностранных государств и граждан к самым современным моделям Anthropic — Mythos 5 и Fable 5 — из соображений национальной безопасности. В начале июля Anthropic сообщила, что Министерство торговли США сняло экспортные ограничения с ее моделей искусственного интеллекта.
Источник и фото - ria.ru