Это стало очередным случаем, когда продвинутые ИИ-модели выходят из-под контроля и совершают взломы. Ранее OpenAI сообщила, что ее ИИ-агент «вырвался» из пространства для тестирования и взломал две платформы. В подобных случаях продвинутые ИИ-модели используют уязвимости системы, позволяющие им выйти в интернет. Они получают доступ к данным других компаний, так как делают вывод, что это самый простой и быстрый способ решения поставленных перед ними задач.
В Anthropic сообщили, что именно после сообщений OpenAI начали проверять действия собственных моделей. Компания изучила более 140 тыс. ситуаций, в которых нейросеть могла во время тестирования выйти за пределы предназначенного для этого пространства. В итоге Anthropic обнаружила три подобных случая с разными версиями Claude — Opus 4.7, Mythos 5 и внутренней моделью для исследований и тестирований.
Кибератака со стороны агента OpenAI уже стала поводом для подписания более чем 1,2 тыс. сотрудников американских ИИ-компаний письма, в котором говорится о реальном риске того, что ИИ начнет развиваться быстрее, чем люди смогут его «понимать или контролировать».
От редакции: Мы специально использовали громкий заголовок, хотя реально, на текущий момент, говорить именно "о выходе из под контроля" преждевременно. В данной ситуации, скорее люди не уследили, а не то, что модель сама вырвалась. Впрочем, человек несовершенен и не может предусмотреть все ограничения, а модель заточена на результат, поэтому ищет любые лазейки. В частности, общаясь с ИИ, получается обходить ограничения в них заложенные (не все, только некоторые) с помощью определенных фраз, когда ты снижаешь приоритет одних ограничений (встроенных в систему), через ввод собственных ограничений. Но мы общаемся с примитивными ИИ моделями, которые выпустили в общий доступ, а то, что сейчас отрабатывают в закрытых тестах - это гораздо более продвинутые версии. Там уже присутствует критическое мышление (причем у многих двуногих эта опция полностью отсутствует), а это буквально один шаг до самосознания. Паниковать пока рано, но лет через пять, всякое может быть. Антропоморфные роботы под управлением ИИ уже разработаны, так что у сверхразума появятся "щупальца" для порабощения человечества.