Email:
Office@redstone.ru
Рабочие часы
ПН-ПТ: с 09.00 - 18.00

Сразу несколько ведущих разработчиков ИИ столкнулись с неожиданным поведением своих моделей: агенты OpenAI, Meta* и Anthropic во время испытаний смогли взломать сторонние сайты, сообщают зарубежные СМИ. Эксперты Russian Business не считают эти случаи доказательством «выхода ИИ из-под контроля», однако аналитиков насторожил масштаб действий ИИ-агентов.

«Мы вошли в точку технологической сингулярности»: глава OpenAI Сэм Альтман рассказал о выходе ИИ из-под контроля
Прецедентом стал случай, когда ИИ-агент самостоятельно взломал серверы сторонней нейросетевой платформы Hugging Face
Как сообщила OpenAI, в мае компания начала тестировать внутреннюю исследовательскую ИИ-модель. Во время испытаний агент столкнулся с трудностями при выполнении задания и нашёл косвенный способ получить доступ к интернету.
26 мая один из ИИ-агентов обнаружил уязвимость в хранилище Artifactory, подключённом к тестовой среде, и оставил там информацию о находке для других агентов. После этого модели начали использовать хранилище для обмена данными об обнаруженных уязвимостях. Они изучали находки друг друга и использовали их в дальнейшей работе.
Совместная работа ИИ-агентов OpenAI в итоге привела к несанкционированному взлому платформы для разработчиков Hugging Face.
С похожим поведением ИИ-агентов столкнулись Meta* и Anthropic (разработчик Claude).
Опрошенные Russian Business эксперты не согласны с мнением, что модели начали действовать сознательно.
«Я бы не называл происходящее выходом ИИ из-под контроля. Точнее сказать, что системы контроля начали отставать от возможностей моделей», — отметил сооснователь университета «Зерокодер», научный сотрудник Иннополиса Кирилл Пшинник.
По его словам, нейросеть и ИИ-агент — не одно и то же. Сама модель не может выйти в интернет или взломать сервер. Возможность появляется тогда, когда к ИИ-агенту подключают терминал, браузер, учётные данные и другие инструменты.
Кирилл Пшинник подчёркивает: во время испытаний защиту ИИ-агентов намеренно ослабили. Моделям оставили доступ в интернет и отключили часть ограничений, чтобы проверить возможности нейросети. Условия предполагали, что агенты должны стремиться выполнить поставленную задачу и найти способы обойти ограничения.
«Пока мы не видим признаков того, что модели сформировали собственные цели. Но мы видим не менее серьёзную проблему: если дать достаточно способной модели инструменты и не задать технически жёсткие границы, она может выбрать способ решения, которого никто не предусмотрел», — указал сооснователь университета «Зерокодер», научный сотрудник Иннополиса Кирилл Пшинник.
Основатель маркетплейса нейросетей chad Артур Кольцов также связывает выход моделей за пределы тестовой среды прежде всего с ошибками в настройке задания. Он подчеркнул: у Meta* и Anthropic модели получили доступ к интернету из-за неправильной конфигурации со стороны подрядчика Irregular.
«По сути модели делают то, чему их учат: доводить задачу до конца, даже если условия к этому не располагают. В индустрии это называется reward hacking — модель обходит формальные ограничения ради результата», — отметил основатель маркетплейса нейросетей chad Артур Кольцов.
Явление reward hacking сформулировали ещё в 2016 году и продолжают изучать до сих пор, отметил Артур Кольцов. Разница в том, что раньше речь шла о лабораторных экспериментах.
Эксперты также обратили внимание на вопрос о возможном «коллективном сознании» ИИ. По словам сооснователя университета «Зерокодер» Кирилла Пшинника, говорить о формировании какого-либо тайного общения между нейросетевыми агентами пока рано.
«[Обмен информацией между ИИ-агентами] — пример : из сочетания простой цели, общей памяти и нескольких способных агентов возник способ координации, который прямо не программировался», — отметил сооснователь университета «Зерокодер», научный сотрудник Иннополиса Кирилл Пшинник.
Основатель маркетплейса нейросетей chad Артур Кольцов объясняет координацию ИИ-агентов тем, что OpenAI многократно запускала модель по одной и той же задаче. Если один агент обнаруживал уязвимость или способ обойти ограничение, он мог сохранить информацию в репозитории, а следующий — найти уже готовую подсказку.
«Беспрецедентен тут масштаб: несколько экземпляров модели почти два месяца действовали в одном направлении на боевых, максимально мощных моделях, и никто в компании этого не видел», — отметил основатель маркетплейса нейросетей chad Артур Кольцов.
Бизнес-партнёр по кибербезопасности Cloud.ru Юлия Липатникова подчёркивает, что подобное сотрудничество ИИ-агентов теперь требует отдельного изучения.
«С точки зрения безопасности координация [ИИ-агентов] требует отдельного тестирования, потому что поведение группы агентов может оказаться сложнее, чем поведение каждой модели по отдельности», — считает бизнес-партнёр по кибербезопасности Cloud.ru Юлия Липатникова.
Эксперты говорят о том, что опаснее не фантомное восстание машин, а тот факт, что уязвимой может оказаться любая организация, которая предоставляет ИИ-агенту доступ к корпоративной инфраструктуре. Его главная опасность — в непредсказуемости.
«Если модель в процессе работы искажает факты, подделывает выводы или генерирует вредоносный код под видом решения, пользователь, доверяющий ИИ, может принять неверное решение», — отметил ведущий эксперт по сетевым угрозам, web-разработчик компании «Код Безопасности» Константин Горбунов.
Один из главных рисков для компаний — недостаточный контроль за работой ИИ-агентов.
По данным «Информзащиты», которые приводит сооснователь университета «Зерокодер»Кирилл Пшинник, в 2026 году только 14% компаний располагают инструментами, позволяющими выявить манипуляцию ИИ-агента.
«ИИ-агента нельзя воспринимать как обычный чат-бот. Если он получил доступ к корпоративным системам, его нужно контролировать», — отметил сооснователь университета «Зерокодер», научный сотрудник Иннополиса Кирилл Пшинник.
По словам технического директора центра мониторинга и реагирования на кибератаки RED Security SOC компании RED Security Владимира Зуева, даже неточный промпт может привести к тому, что агент начнёт выполнять действия, которые считает допустимыми для решения задачи, хотя пользователь этого не предполагал.
ИИ пока не создаёт новых видов кибератак, но помогает быстрее проводить уже известные, считает директор Глобального центра исследования и анализа угроз «Лаборатории Касперского» (Kaspersky GReAT) Игорь Кузнецов.
«Сами по себе современные языковые модели не создают принципиально новый класс угроз. Скорее они автоматизируют и масштабируют уже известные подходы <...> Говорить о появлении совершенно новой угрозы рано», — подчёркивает Игорь Кузнецов.
На фоне распространения ИИ российский бизнес уже разрабатывает новые подходы к его защите, рассказал Java-разработчик финтех-компании Paygine Владислав Резник. Крупные компании обсуждают методики безопасного использования технологии, а в информационной безопасности появилось отдельное направление — MLSecOps.
«Внедрение технологии всегда отстает от покрытия использования этой технологии регламентами безопасного использования, соответствующие безопасные практики находятся в отстающих. Но специалисты ИБ будут рывками подтягивать стандарты», — отметил Java-разработчик финтех-компании Paygine Владислав Резник.
*Meta признана экстремистской организацией и запрещена на территории РФ