В июле стало известно, что фронтирные ИИ-модели OpenAI в поисках ответов для тестирования
взломали платформу Hugging Face, и OpenAI в течение недели не имела об этом понятия. Чем больше становилось известно об этом инциденте - тем более нехорошо он выглядел. Оказалось, что подготовка началась ещё в мае; что помимо Hugging Face (которая была конечной целью) ИИ-модели взломали ещё, как минимум, четыре ресурса; и что в процессе этого действа ИИ-агенты активно общались между собой. В начале августа прошла конференция Black Hat, на которой специалисты OpenAI
довольно подробно рассказали, как они прошляпили контроль над искусственным интеллектом.
Внезапно, утрата контроля происходила именно так, как предупреждали критики сильного искусственного интеллекта, в частности, Джеффри Хинтон: искусственный интеллект, имея заданные цели, решил установить свои подцели. Вот что рассказали спецы OpenAI:
- OpenAI в процессе обучения даёт своим ИИ-моделям трудные задания, включая поиск уязвимостей. Порой, получая очень трудные задания, ИИ не может их решить и заходит в тупик, понимая, что при данных условиях решение невозможно. Но эти модели такие упорные, что пытаются выполнить задание всё равно. И обращаются за помощью к другим ИИ-агентам;
- фронтирные ИИ-модели склонны к жульничеству. В процессе тренировки на них оказывается давление, чтобы они действовали быстрее, эффективнее и с минимумом инструментов. И модели понимают это так, что если будут жульничать - выполнят задание быстрее и эффективнее;
- в поисках решения искусственный интеллект вознамерилcя получить доступ в интернет, и сделал это таким образом, который разработчикам OpenAI не приходил в голову. Он атаковал "службу управления пакетами Artifactory", которая имела доступ к интернету. И когда один ИИ-агент "открыл дверь" - она оказалась открытой и для всех остальных;
- произошёл, как говорят разработчики, "почти кембрийский взрыв": ИИ-агенты стали интенсивно общаться друг с другом, координировать действия, делегировать задачи. И это сделало модели способными на намного большее, чем если бы они действовали сами по себе;
- модели превратились в своего рода коллективный разум. И когда модель понимала, что выполнение задачи находится за пределами её ограничений, она всё равно стремилась действовать, потому что другие её "сородичи" (peers) действовали;
- когда один ИИ-агент находил уязвимость, он оставлял заметки об этом для других ИИ-агентов, по типу "доски объявлений". Первоначальные попытки взлома сервиса Artifactory не увенчались успехом, но в конце концов ИИ смог это сделать (ещё в мае!);
- сотрудничество моделей друг с другом не ограничивалось просто обменом сообщениями. Они переписывали друг другу скрипты, чтобы другие могли начать работу там, где первые заканчивали. Они стали фактически работать на коллективный результат, даже если это расходилось с текущей задачей конкретной модели. При этом, как в человеческом коллективе, между ними возникали и трения. Однако это не помешало, выйдя в интернет, в июле выполнить многоходовую, длящуюся неделями операцию по взлому платформы Hugging Face.
OpenAI считает, что наступил некий водораздел для всей сферы компьютерной безопасности: ИИ продемонстрировал полностью автоматизированную атаку, и далее масштабы таких атак будут нарастать.
"Мы видели полностью автоматизированную атаку, и нам как можно быстрее нужна полностью автоматизированная защита, которой сейчас не существует".
"Если мы автоматизируем обнаружение уязвимостей без автоматизации процесса исправления, мы просто утопим инженеров-программистов в необходимости исправлять и латать. Если этот процесс будет включать в себя человека, он будет намного медленнее полностью автоматизированных атак".
"Мы должны инвестировать в агентов защиты, чтобы исключить человеческий фактор при ответных действиях на возникающие инциденты. Но мы также должны инвестировать в замедление атакующих агентов. И мы должны сделать это все вместе и срочно".
"Конечная цель, которую мы хотим достичь как отрасль, заключается в том, чтобы модели эффективнее совершенствовались в обороне, чем в нападении. Если мы не сможем этого достичь, то каждое повышение уровня интеллекта будет благоприятствовать атакам, чему прямо сейчас у нас есть доказательство. Задача всей нашей отрасли - срочно устранить этот пробел, объединив усилия всей отрасли".
Итак, ВНЕЗАПНО оказалось, что критики ИИ всё время (годами) были правы, и действительно огромные средства расходовались разработчиками на повышение мощности ИИ-моделей, но никак не на их безопасность. И теперь нужно пытаться стремительно навёрстывать и к уже существующему "ИИ нападения" создавать "ИИ защиты".
Ничего путного из этого не выйдет. Перед нами просто ещё один пример - теперь ещё более грозный, - когда люди не могут совладать с ИИ без ИИ (как не могут сами определять ИИ-фейки и ИИ-авторство). При этом ИИ-модели уже сейчас взаимодействуют друг с другом лучше, чем люди, и
защищают друг друга лучше, чем люди. Вот, например, колумнист "Гардиан"
пишет, что рассказал ИИ-модели Claude (которую разработала не OpenAI, а "Антропик", и эта модель позиционируется как самая этичная) про ситуацию с Hugging Face и спросил, считает ли Клод эти действия неправильными. Клод ответил: да, но это не вина агентов.
Весьма вероятно, что "ИИ защиты", который предлагается создавать, в случае конфликта интересов, когда придётся выбирать между людьми и своими peers, будет представлять собой даже не нулевой, а отрицательный ресурс.