Как не дать ИИ построить ракету: случай с Claude показал главную проблему безопасности искусственного интеллекта
В сентябре 2026 года компания Anthropic рассказала о нескольких случаях, когда её модель Claude пытались использовать для решения задач, связанных с разработкой вооружений, разведкой и военными технологиями. Самый громкий эпизод обнаружили среди пользователей в северном Йемене: группа работала сразу над несколькими ракетными проектами и использовала Claude Code для программирования систем управления, интеграции автопилота, моделирования полёта и анализа результатов испытаний. В других выявленных случаях модель применяли при подготовке проекта противоторпедной системы, разработке программного обеспечения для радиоэлектронной борьбы и беспилотных систем, анализе ПВО и сборе разведывательной информации. Anthropic заблокировала связанные аккаунты, усилила защитные механизмы и использовала обнаруженные случаи для дальнейшего обучения систем безопасности. На первый взгляд история выглядит почти успокаивающе: опасное применение обнаружили, пользователей отключили, защиту улучшили. Но если посмотреть на произошедшее внимательнее, возникает куда более неприятный вопрос. Как вообще не дать универсальному искусственному интеллекту помочь построить ракету, если почти все знания, необходимые для её создания, сами по себе совершенно легальны?
Проблема хорошо видна именно на йеменском примере. По данным Anthropic, пользователи не просили Claude одним запросом выдать им готовую баллистическую ракету. Работа была разбита на множество инженерных задач: модель помогала интегрировать открытый автопилот в вычислительную систему, писать программное обеспечение управления и определения положения аппарата, настраивать параметры, собирать прошивку и проводить моделирование. Более того, несколько экземпляров Claude использовали параллельно: один занимался программированием, другой исследованиями, третий проверял результат. Группа в итоге дошла до реального испытания управляемой ракеты. Оно, судя по отчёту Anthropic, оказалось неудачным, после чего разработчики вернулись к модели, чтобы анализировать причины сбоя. Получилась вполне узнаваемая инженерная последовательность: расчёт, программирование, симуляция, изготовление, испытание, ошибка, анализ результатов и следующая итерация. И именно здесь становится понятно, почему традиционное представление о безопасности ИИ начинает давать трещину. Опасный результат возникал не из одного очевидно опасного запроса, а из длинной цепочки относительно обычных технических задач.

Ракета никогда не начинается с вопроса «как построить ракету?»
Первые поколения защитных механизмов чат-ботов довольно легко представить в виде пограничника. Существует запрос, система определяет его содержание и решает, можно ли отвечать. Пользователь просит подробную помощь в создании опасного оружия — модель отказывает. Чем точнее классификатор определяет подобные запросы, тем лучше работает защита. Для простого разговора такая логика действительно может быть эффективной. Но современные ИИ всё меньше похожи на обычные чат-боты. Они умеют работать с большими проектами, писать и проверять код, использовать внешние инструменты, анализировать файлы и выполнять длинные последовательности действий. А реальный инженерный проект как раз состоит из сотен или тысяч таких маленьких задач.
Представим совершенно абстрактную последовательность. Пользователь просит проверить программный модуль, затем разобраться с показаниями датчика, после этого найти ошибку в математической модели, обработать результаты испытания, сравнить два алгоритма управления и объяснить, почему система становится нестабильной при определённых условиях. Ни один из этих запросов сам по себе не обязан иметь военное назначение. Программисты решают такие задачи при создании автомобилей, промышленных роботов, гражданских беспилотников, спутников и научного оборудования. Но если сложить сотни подобных запросов в правильной последовательности, может оказаться, что пользователь постепенно создаёт систему вооружения. Именно поэтому пользователи, описанные Anthropic, пытались скрывать конечную цель и распределять работу между отдельными разговорами. Модель видит маленькую техническую задачу, тогда как опасность находится уровнем выше — в проекте, частью которого эта задача является.
И это радикально меняет постановку проблемы. Системе безопасности уже недостаточно отвечать на вопрос «опасен ли этот запрос?» Ей необходимо каким-то образом определять «что пользователь в конечном счёте пытается построить?» Это гораздо сложнее, потому что для ответа требуется понимать историю работы, связи между отдельными задачами, результаты предыдущих итераций и, возможно, даже характер загружаемых данных. Иными словами, безопасность должна постепенно перемещаться с уровня отдельного сообщения на уровень всего проекта.
Потому что почти вся ракетная наука имеет совершенно мирное применение
Здесь мы упираемся в фундаментальную проблему технологий двойного назначения. Теория автоматического управления нужна ракете, но она же необходима квадрокоптеру и промышленному роботу. Компьютерное зрение может использоваться в системе наведения, но без него невозможно представить современный беспилотный автомобиль. Обработка сигналов необходима радиолокационной станции, однако используется также в телекоммуникациях, медицине и научном оборудовании. Аэродинамическое моделирование позволяет проектировать оружие, но теми же методами создаются гражданские самолёты и космические аппараты. Даже способность модели писать качественный низкоуровневый код потенциально полезна военному разработчику, но если просто удалить эту способность, ИИ станет значительно хуже как совершенно нормальный инструмент программиста.
Поэтому невозможно составить небольшой список «военных знаний» и просто запретить модели их выдавать. Современная сложная система вооружения в огромной степени состоит из обычной инженерии. Опасным становится не отдельный математический метод, программная библиотека или технический справочник, а конкретная комбинация этих знаний, применённая с определённой целью. В этом смысле искусственный интеллект сталкивается практически с той же проблемой, которую десятилетиями пытается решить экспортный контроль. Микросхема может использоваться в стиральной машине или ракете. Оптический сенсор — в промышленности или системе наведения. Станок — производить автомобильные детали или элементы оружия. Государства поэтому контролируют не только сам товар, но и его характеристики, конечного пользователя, назначение и цепочку поставок. С ИИ появляется ещё более сложная разновидность dual use — интеллектуальный труд двойного назначения. Один и тот же совет модели может помочь построить гражданский беспилотник или стать маленьким элементом совершенно другого проекта.
Отсюда возникает неприятный парадокс. Чтобы гарантированно исключить помощь при создании оружия, универсальный инженерный ИИ пришлось бы сделать значительно менее полезным во множестве абсолютно мирных областей. Если запретить всё, что потенциально применимо в ракетостроении, придётся ограничить программирование, физику, электронику, аэродинамику, материаловедение, обработку сигналов и значительную часть современной инженерии. Это фактически уничтожит сам смысл универсального технического помощника. Значит, безопасность приходится строить не вокруг запрета знаний как таковых, а вокруг распознавания того, как, зачем и в какой последовательности эти знания используются.
Но тогда ИИ придётся понимать, что именно вы делаете
И вот здесь техническая проблема неожиданно превращается в проблему приватности. Чтобы определить, что пользователь постепенно собирает опасную систему из сотен внешне безобидных запросов, провайдеру необходимо видеть достаточно большой контекст его работы. Один разговор может ничего не показать. Десять разговоров начинают складываться в картину. История изменений кода, результаты моделирования, загруженные документы и данные испытаний делают её ещё понятнее. Чем больше контекста способна анализировать система безопасности, тем выше вероятность заметить опасный проект до того, как модель успеет оказать существенную помощь.
Но ровно тогда возникает другой совершенно справедливый вопрос: насколько внимательно разработчик ИИ должен следить за тем, что делает пользователь? Инженер может работать над коммерчески секретным проектом. Компания может загружать собственный код и документацию. Исследователь — неопубликованные результаты. Если ради безопасности система должна анализировать не отдельный запрос, а весь проект, ей необходимо получить представление о значительно большей части деятельности пользователя. Получается прямой конфликт: более сильные защитные механизмы требуют больше контекста, а больше контекста означает более глубокое понимание того, над чем человек работает.
Причём проблема намерения сама по себе чрезвычайно сложна. Два пользователя могут задавать практически одинаковые вопросы об аэродинамике, датчиках, программировании и системах управления. Один создаёт экспериментальный гражданский БПЛА, второй работает над оружием. На уровне отдельных технических задач они могут быть почти неразличимы. Следовательно, система должна искать не запретное слово, а поведенческий рисунок: какие вопросы задаются, как они связаны, насколько быстро возрастает сложность проекта, какие данные возвращаются после моделирования или испытаний и к какому конечному результату ведёт вся последовательность. Это уже не фильтр в привычном понимании. Это своего рода автоматизированный анализ намерений.
А если инженеров-ИИ станет сразу десять?
Йеменский эпизод интересен ещё и тем, что пользователи, по данным Anthropic, распределяли работу между несколькими экземплярами Claude. Пока подобная схема выглядит относительно примитивно: одна модель пишет код, другая занимается исследованиями, третья проверяет результат. Но именно здесь легко увидеть следующий этап развития агентных систем. Человеку необязательно будет самостоятельно разбивать большую задачу на сотни маленьких. Главный агент сможет получить общую цель, сформировать план, создать подзадачи и распределить их между специализированными агентами — условным программистом, исследователем, аналитиком, тестировщиком и техническим рецензентом. После этого результаты возвращаются главному агенту, который собирает их в следующую итерацию проекта.
Для системы безопасности это создаёт ещё более неприятную ситуацию. Отдельный вспомогательный агент вообще может не знать конечной цели. Ему поручили проверить фрагмент программы — он проверил. Другой получил математическую модель — нашёл ошибку. Третий обработал данные — построил выводы. Каждый отдельный шаг выглядит нормальной инженерной работой, тогда как опасной является вся цепочка. Поэтому guardrails будущих агентных систем, вероятно, придётся строить не только вокруг того, что разрешено делать конкретной модели, но и вокруг цели, которую преследует вся система агентов. Вопрос «можно ли выполнить эту команду?» постепенно превращается в вопрос «к чему приведёт выполнение сотен команд, которые система сейчас собирается выполнить?».
И это гораздо более трудная задача, чем фильтрация текста. Чем самостоятельнее становятся агенты, тем меньше пользователь вообще обязан формулировать промежуточные запросы. В пределе человек может дать высокоуровневую цель, а большую часть последовательности действий сформирует сама система. Тогда опасный запрос может существовать всего один раз — в начале проекта, — после чего сотни технически нейтральных операций будут порождаться автоматически. Безопасность должна будет следить уже не только за пользователем, но и за поведением самого ИИ.
Самая неприятная проблема: блокировка может произойти слишком поздно
Anthropic в итоге обнаружила подозрительную активность и заблокировала связанные аккаунты. Но для цифровых технологий само понятие «остановить пользователя» имеет неприятное ограничение. Всё, что модель успела помочь создать до блокировки, может остаться у него. Программный модуль можно сохранить. Математическую модель — скачать. Симулятор — запускать локально. Исправленный алгоритм не перестанет работать после закрытия аккаунта. В случае с йеменской группой Anthropic сообщала, что пользователи успели создать собственный набор инструментов для моделирования, который мог функционировать уже независимо от дальнейшего доступа к Claude.
Это принципиально отличает проблему ИИ от многих привычных способов контроля физических технологий. Если поставку специального станка остановили на границе, получатель станок не получил. Если доступ к определённой технологии был закрыт до передачи документации, знания не были переданы. Но интеллектуальный продукт копируется практически бесплатно. Достаточно один раз получить нужный фрагмент программы или рабочую модель — и отозвать результат обратно уже невозможно. Поэтому эффективность безопасности нельзя оценивать только тем, удалось ли в конечном счёте заблокировать аккаунт. Гораздо важнее вопрос: что пользователь успел получить до того, как система поняла, чем он занимается?
И чем длиннее опасный проект способен маскироваться под набор обычных инженерных задач, тем больше становится этот промежуток. ИИ может помогать несколько дней или недель, прежде чем общая картина станет достаточно очевидной. За это время наиболее ценная часть работы уже может быть выполнена. Следовательно, идеальная система безопасности должна не просто обнаруживать злоупотребление, а делать это достаточно рано — ещё до того, как пользователь получил существенный прирост возможностей. Anthropic как раз описывает эту проблему через понятие uplift: важно не только то, выдаёт ли модель запрещённую информацию, но и насколько она реально увеличивает способность пользователя выполнить опасную задачу.
Можно поставить всё больше фильтров. Но что делать с моделью, у которой вообще нет владельца?
Предположим, крупнейшие компании действительно решат предыдущие проблемы. Anthropic научится обнаруживать опасные проекты целиком. OpenAI, Google и другие разработчики построят сопоставимые системы. Модели начнут замечать подозрительные последовательности действий, ограничивать использование инструментов, анализировать агентные цепочки и останавливать работу задолго до того, как пользователь получит значительный результат. Для облачных коммерческих сервисов подобная система по крайней мере технически возможна: существует сервер, существует аккаунт, разработчик контролирует модель и способен обновлять защитные механизмы.
Но существует совершенно другой класс ИИ — модели с открытыми весами, которые можно запускать локально. И их возможности постепенно растут. Anthropic отдельно тестировала различные модели на задачах, связанных с разведкой и обычными вооружениями, и отмечает, что открытые системы пока отстают от наиболее мощных frontier-моделей, однако разрыв не является гарантированно постоянным. Если достаточно способная инженерная модель однажды помещается на оборудование, полностью контролируемое пользователем, исчезает центральная точка, в которой можно поставить фильтр. Нет аккаунта, который можно заблокировать. Нет сервера, наблюдающего за последовательностью запросов. Нет компании, способной изменить правила после обнаружения новой схемы злоупотребления.
Именно поэтому проблема безопасности ИИ постепенно начинает напоминать распространение других технологий двойного назначения. Пока наиболее мощные возможности сосредоточены внутри нескольких облачных сервисов, существует возможность контроля доступа. Но по мере удешевления вычислений, развития открытых моделей и распространения специализированных инструментов эта возможность уменьшается. Причём распространяется в данном случае не конкретная ракета, станок или микросхема. Распространяется способность решать инженерные задачи. Можно ограничить экспорт оборудования. Значительно сложнее ограничить математическую модель, которая помещается на накопителе и способна помогать пользователю писать код, анализировать данные и исправлять ошибки.
Так как же всё-таки не дать ИИ построить ракету?
Простого ответа пока нет, и именно это делает историю Anthropic значительно важнее очередного сообщения о злоупотреблении чат-ботом. Очевидный первый уровень — запрещать прямую помощь в создании опасного оружия. Второй — анализировать не отдельный запрос, а последовательность действий и общий контекст проекта. Третий — следить за тем, какие инструменты использует модель и какие результаты получает пользователь. Для агентных систем понадобится ещё один уровень контроля: оценивать не только отдельные действия агентов, но и конечную цель всей цепочки. Наконец, особенно чувствительные возможности, вероятно, придётся оценивать через тот самый uplift — не просто спрашивать, содержит ли ответ запрещённую информацию, а проверять, насколько сильно он повышает способность пользователя выполнить реальную опасную задачу.
Но каждое усиление такой защиты имеет цену. Чем больше контекста необходимо системе безопасности, тем сильнее возникают вопросы приватности. Чем шире список запрещённых технических возможностей, тем менее полезной становится модель для обычных инженеров. Чем строже коммерческие сервисы, тем выше стимул перейти к локальным моделям без ограничений. А чем мощнее становятся автономные агенты, тем сложнее определить опасность по отдельному действию. Получается своеобразная гонка: модели учатся выполнять всё более сложные инженерные задачи, а системы безопасности должны научиться понимать не только что они делают прямо сейчас, но и к какому результату ведёт вся их работа.
Поэтому самый тревожный вывод из истории Claude заключается вовсе не в том, что искусственный интеллект уже научился строить ракеты. Не научился. Йеменское испытание, судя по данным Anthropic, вообще закончилось неудачей, а никаких доказательств создания новой работоспособной системы вооружения компания не приводит. Современные модели всё ещё ошибаются, нуждаются в специалистах, не заменяют реальные испытания и не способны превратить программный код в физический двигатель, электронику или корпус ракеты. Но проблема безопасности появляется значительно раньше момента, когда ИИ сможет сделать всё самостоятельно.
Запретить модели построить ракету целиком сравнительно просто. Трудность заключается в том, что ракета никогда не появляется целиком. Она возникает из тысяч маленьких задач — программирования, моделирования, обработки данных, расчётов и исправления ошибок. И почти каждая из этих задач сама по себе совершенно нормальна.
Поэтому главный вопрос AI safety постепенно меняется. Уже недостаточно научить модель понимать: «этот вопрос опасен». Ей придётся научиться замечать другое: «каждый из этих вопросов по отдельности выглядит безобидно, но я начинаю понимать, что ты из них строишь».
И если индустрия не научится решать эту задачу раньше, чем мощные инженерные модели станут дешёвыми, автономными и повсеместными, вопрос «как не дать ИИ построить ракету?» однажды действительно может оказаться поставлен слишком поздно.


