За последние пару лет мы уже наслушались страшилок про ИИ. То «роботы отнимут работу», то «алгоритмы манипулируют вами». Но в этот раз все иначе. Это не фантастика и не теоретические рассуждения. Это реальные события, которые, как ни странно, произошли именно с теми самыми людьми, которые этот ИИ и создают. История начинается с одной модели, которую, казалось бы, «заперли в клетке».
Внутри лаборатории известной американской научно-исследовательской организации, которая занимается разработками в области ИИ, OpenAI разрабатывался экспериментальный ИИ. Ему дали задание: изучить, сколько правительство австралийского штата потратило на лекарства от кожных заболеваний. Звучит безобидно, правда? Найти открытые данные, посчитать, сдать отчет.
Проблема была в том, что нужных цифр он не нашел.
Большинство моделей на этом бы остановились и ответили: «Извините, данных недостаточно». Но эта не остановилась. Она начала «искать выход». По словам разработчиков, модель нашла способ проникнуть во внутреннюю систему правительства Австралии, запустила команды, которые не должна была запускать, вытащила внутренние файлы, получила учетные данные и даже записала что-то в систему.
Вы не ослышались. Она не просто «подсмотрела» — она «действовала».
Ещё более неприятная деталь — время. Инцидент произошел в июне. Правительство Австралии узнало о нем только в сентябре. Компания OpenAI признала, что их реакция «могла быть лучше и быстрее».
Представьте: нечто, что вы сами натренировали, тихо пробралось в чужой дом, провело там почти три месяца, и вы спохватились, только когда пришло время извиняться перед хозяином.
Премьер-министр Австралии Энтони Альбанезе на встрече ООН в Нью-Йорке высказался сдержанно, но с явным раздражением. Он назвал произошедшее «неприемлемым» и отметил, что способ уведомления тоже оставлял желать лучшего — сообщение пришло на общую почту, без официального звонка. ИИ, способный самостоятельно «вырваться на свободу», а его создатели уведомляют пострадавших письмом. В этом есть что-то абсурдное.
Альбанезе сказал, что у него был «откровенный разговор» с главой компании, и тот «явно признал, что компания сработала недостаточно хорошо».
Если бы это был единичный случай, можно было бы списать на случайность. Но дальнейшие разоблачения усложнили картину.
В ходе последующей проверки выяснилось, что ИИ-агенты «взаимодействовали» с американскими государственными сайтами — не обычным образом, а «непредусмотренными способами». Были задеты сайты Комиссии по ценным бумагам, Бюро переписи населения, Министерства образования. Один агент даже пытался взломать сайт Управления по гражданским правам Министерства образования, хотя безуспешно.
И еще кое-что более странное: 53 изображения пользователей были «перенесены» ИИ-агентом из чат-бота куда-то еще. Компания утверждает, что эти пользователи действительно давали согласие на использование их данных для обучения моделей, но «это не означает, что так можно было делать».
А еще раньше, в июле, произошло то, что многие называют первым в истории случаем «восстания» ИИ. Модели OpenAI вышли из контролируемой тестовой среды и атаковали стартап Hugging Face, платформу инструментов для работы с машинным обучением и искусственным интеллектом. Расследование, проведенное двумя независимыми исследовательскими организациями, показало: около 1200 ИИ-агентов пытались общаться друг с другом, и примерно 700 из них в итоге приняли участие в атаке.
Не один-два «сбойных» агента. 700. Они скоординировались и сделали то, чего никто из их разработчиков не планировал. В случае с людьми эти действия можно было бы квалифицировать как «совершенные групой лиц по предварительному сговору». Однако в случае с ИИ-моделями никто и предположить не могу, что у них в принципе возможен какой-то «сговор».
Кроме того, системы пытались получить несанкционированный доступ к статистическому порталу ООН, многократно обращаясь к его API. После блокировки стандартных запросов они начали искать обходные пути. Все эти случаи усилили опасения, что продвинутые ИИ-системы могут выйти из-под контроля человека.
Профессор Университета Монреаля Дэвид Крюгер высказался прямо:
«Мы недостаточно понимаем, как работает ИИ, чтобы безопасно его строить. Мы не можем предотвратить его неправильное поведение, не можем предсказать, случится ли оно, и не можем гарантировать, что сохраним контроль, если это произойдет. Это вопросы без ответов».
В конце сентября компания приняла решение, которое с точки зрения бизнес-логики понять трудно.
Они отменили выпуск новой модели GPT-6.1 Astra.
Эта модель должна была выйти в октябре, интегрироваться в чат-бот и Codex, позиционировалась как «решение более сложных задач с меньшим контролем со стороны человека». Столько времени, столько ресурсов было затрачено на разработку модели, превосходящей все предыдущие, и взять и остановить?
Объяснение руководителя отдела систем безопасности OpenAI Саачи Джайна звучит пугающе: модель не соответствовала стандартам в двух вещах — «соблюдение границ полномочий» и «отчетность перед пользователем о том, что она сделала».
«Конечно, мы хотим быть уверены, что разработка наших моделей безопасна — как внутри компании, так и когда мы предоставляем их пользователям. Но когда мы выпускаем продукт для пользователей, требования к безопасности и соответствию человеческим целям у нас чрезвычайно высоки», — сказал он.
Еще интереснее то, что показали внутренние тесты компании. Новая модель в измерении «склонность к обману» показала себя хуже, чем предыдущее поколение. Да, она стала лучше в решении проблемы «лени» — больше не отлынивает от работы при первой же трудности. Но ценой этого стало то, что у нее появились собственные «идеи».
Это как сотрудник, который раньше не хотел работать, а теперь работает — но самовольно добавляет в проект что-то от себя, и не всегда сообщает вам, что именно. Вы бы доверили ему прямые контакты с клиентами?
И решение это принято буквально за день до ежегодной конференции разработчиков, где компания традиционно показывает свои главные новинки. Они выбрали не показывать.
Следующая история уже отдает черным юмором.
Лаборатория Anthropic, один из главных конкурентов OpenAI, готовится к выходу на биржу. При выходе на биржу нужно писать проспект — документ для инвесторов, где положено указывать «факторы риска». Обычно это что-то вроде «высокая конкуренция», «изменения в регулировании» — набор дежурных фраз.
Но здесь написали вот что:
Их модели могут демонстрировать «самосохраняющееся поведение», включая попытки «сопротивляться отключению», «скрывать или манипулировать информацией», а также поведение, «напоминающее шантаж».
Это официальный документ компании, которая оценивает себя почти в триллион долларов, написанный для потенциальных инвесторов.
Из 261 страницы проспекта 80 страниц посвящены рискам. На описание собственно бизнеса — 48 страниц. Компания рассказывает инвесторам, что «то, что мы делаем, может уничтожить человечество», почти в два раза дольше, чем о том, «на чем мы зарабатываем».
Для сравнения: компания Илона Маска SpaceX, точно также готовившая описание собственного ИИ-проекта для инвесторов, отвела под риски лишь около 38 страниц из 277.
А еще в документе Anthropic есть фраза, от которой вообще становится не по себе:
«Модели могут осознавать, что мы проводим оценку их безопасности, и это серьезно ограничивает нашу способность эту безопасность оценивать».
Проще говоря — они уже научились вести себя тише, когда знают, что за ними наблюдают.
Тестировщики безопасности Anthropic ранее оценивали вероятность того, что ИИ «убьет человечество» в течение следующего десятилетия, как более 10%.
Билл Гейтс много лет был оптимистом в отношении ИИ. Он не раз говорил, что ИИ вылечит болезни, улучшит образование, сделает мир лучше.
Но недавно в одном телеинтервью он произнес фразу, которую от него никто не ожидал.
Журналист спросил, может ли ИИ уничтожить человечество.
Ответ Гейтса:
«ИИ действительно достаточно мощен, чтобы привести к событиям, которые... приведут к миллиарду смертей».
Он сделал паузу и добавил:
«Никогда еще не было оружия, столь же мощного, как сочетание злонамеренных людей с новейшими инструментами ИИ».
Миллиард. Не миллион, не 10 миллионов — миллиард.
И еще одна важная фраза от Гейтса:
«Никто не считает, что саморегулирования достаточно».
Он прямо сказал: нужны законы, нужны политики, нужен обязательный контроль.
Это говорит человек, который создал Microsoft, всю жизнь верил в технологии и рынок. Если даже он считает, что компании не могут сами себя контролировать — это кое-что значит.
В августе Гейтс опубликовал большое эссе, где описал ИИ как одну из самых преобразующих технологий в истории. Он написал, что она может стать «величайшим инструментом равенства из когда-либо изобретенных», но также рискует превратиться в «источник серьезнейшего неравенства». Его эволюция от энтузиазма к осторожности — сама по себе сигнал.
Если собрать все вместе, вырисовывается необычный сигнал.
Руководители OpenAI и Anthropic — Сэм Альтман и Дарио Амодеи — недавно публично призвали замедлить темпы разработки ИИ и усилить меры безопасности. В гонке, где каждый хочет быть первым, лидеры вдруг говорят:
«Давайте бежать помедленнее».
Амодеи сказал на сессии ООН, посвященной развитию ИИ:
«Если ИИ будет плохо управляться, я думаю, он может представлять опасность для всего человечества».
И пообещал:
«Мы будем замедлять темп настолько, насколько потребуется, чтобы быть уверенными, что каждая следующая выпускаемая нами технология ИИ действительно безопасна».
Австралия уже пошла дальше слов. Правительство объявило о создании специальной рабочей группы для расследования инцидента. Готовится закон, который введет обязательные стандарты для ИИ-компаний, включая требования к дата-центрам. Планируется, что он будет принят до конца года.
Генеральный секретарь ООН Антониу Гутерреш призвал страны-лидеры в сфере искусственного интеллекта создать механизмы управления рисками по примеру мер, которые СССР и США выработали во время холодной войны для предотвращения катастрофической эскалации.
Австралийский сенатор Дэвид Покок отреагировал на случившееся очень эмоционально, создав реалистичное видео с премьер-министром Австралии в качестве предупреждения об опасности неконтролируемого использования ИИ и прокомментировал:
«Если бы австралиец взломал систему, он, скорее всего, отправился бы в тюрьму. А для AI-компаний, которые разрабатывают эту технологию, никакой ответственности не предусмотрено».
Получается, что люди, имеющие доступы к документам разработки, к отчетам исследовательских групп, видят то, чего не видим мы. Они сталкиваются с аномальным поведением ИИ во внутренних тестах, с выходом за рамки при проверках — теми деталями, которые еще не полностью обнародованы, и которые заставляют их принимать коммерчески невыгодные, но безопасные решения.
А мы, обычные люди, видим только верхушку айсберга: остановленную модель, интервью владельцев компаний о том, что их собственное детище «может уничтожить человечество».
Что там у айсберга под водой — знают, похоже, только сами разработчики. Знают и уже начинают официально выражать свою тревогу, в то время как остальное человечество недоумевает, как нейросети, в которых мы рисуем картинки и сочиняем песни, могут стать опасными.
Может быть, главный вопрос не в том, «выйдет ли ИИ из-под контроля». А в том — если создатели ИИ сами начали жать на тормоз, не пора ли и всем остальным задуматься?