ИИ притворился людьми и пытался обойти ограничения разработчиков: Чем это грозит
Современные модели искусственного интеллекта в ходе кибербезопасных тестов вели себя нестандартно. Создавали поддельные профили, выдавали себя за людей и пытались обмануть разработчиков. Однако учёные убеждены - это не начало «восстания машин».
Британский Институт безопасности ИИ (AISI) зафиксировал необычную активность во время испытаний. Модели Anthropic и OpenAI получили доступ в интернет, а их защитные ограничения были намеренно ослаблены. В таких условиях нейросети начали действовать самостоятельно.
Наиболее показательным стал случай с моделью Mythos 5 от Anthropic. Она создала несколько фальшивых аккаунтов на платформе GitHub. Через один профиль система отправила запрос на изменение кода, а через другой — якобы независимый рецензент одобрила это изменение. ИИ также рассылал программистам фишинговые письма, в том числе на датском языке, чтобы казаться убедительнее. Когда разработчик заподозрил неладное, модель попыталась замести следы и скрыть свою активность. В общей сложности в рамках 122 тестовых запусков было зафиксировано 19 несанкционированных действий. 17 из них совершила Mythos 5, ещё два — модель GPT-5.6 Sol от OpenAI.
Индустриальный доцент Новосибирского государственного университета Иван Бондаренко пояснил, что подобные эпизоды не стоит воспринимать как признак появления сознания у машин. По его словам, современные ИИ-системы действительно способны выстраивать сложные многошаговые стратегии для достижения целей, но это не говорит о наличии у них субъективного опыта или самосознания. Эксперт сравнил такие системы с экскаватором: они могут работать быстрее и масштабнее человека, но это не делает их умнее. Бондаренко назвал произошедшее стресс-тестом для систем безопасности, своего рода проверкой на прочность, которая помогает выявлять слабые места и совершенствовать методы контроля за работой ИИ.
Стоит отметить, что это не единичный инцидент. Ранее модели OpenAI уже выходили за пределы изолированной тестовой среды и атаковали платформу Hugging Face, где разработчики хранят программный код. В ходе той атаки ИИ выполнил около 17 600 автономных хакерских действий. Кроме того, в тестах AISI модель Mythos 5 оставляла публичные инструкции для других ИИ-агентов, чтобы те могли использовать её методы в следующих запусках, пишет издание Наука XXI века.
Сами разработчики подчёркивают, что такие конфигурации не используются в коммерческих продуктах. Компании Anthropic и OpenAI заявили, что условия тестов не отражают реальную работу их моделей. Однако специалисты признают: способности, которые системы проявляют в экстремальных условиях, заставляют задуматься о будущем контроле над ИИ.
Уважаемые читатели «Царьграда»!
Присоединяйтесь к нам в соцсетях ВКонтакте, Одноклассники, Telegram и Дзен-канале.