Архитектура безопасного ИИ. Риски, управление и защита искусственного интеллекта

- -
- 100%
- +
Для организации практический вывод состоит в следующем. Аудио и речевые системы работают с одним из самых чувствительных типов данных и одновременно подвержены одним из наиболее убедительных форм мошенничества. Оценка рисков должна учитывать три направления: защиту от голосовых дипфейков в процессах, где решения принимаются на основании телефонного звонка или голосовой команды; защиту голосовой биометрии от обхода с помощью синтетического голоса; и защиту приватности аудиоданных, обрабатываемых ИИ-моделями. Организации, в которых голос руководителя является достаточным основанием для санкционирования финансовой операции, должны пересмотреть этот процесс с учётом того, что голос больше не является надёжным идентификатором.
2.4. Генерация и анализ видео
Видео объединяет визуальный ряд, звук и временну́ю последовательность, и именно эта комбинация делает его наиболее убедительным медиаформатом. Человек доверяет видеозаписи больше, чем тексту или отдельному изображению, потому что подделка видео долгое время требовала профессиональных навыков и значительных ресурсов. ИИ изменил это соотношение. Современные модели генерируют видео по текстовому описанию, превращают статичные фотографии в движущееся изображение, подменяют лица и голоса в записях и создают полностью синтетические сцены, которые сложно отличить от реальных. Для организаций это означает одновременно новые возможности и новый уровень угроз.
Анализ видео с помощью ИИ — более зрелая область, чем генерация. Организации используют видеоаналитику для наблюдения за территорией, подсчёта посетителей, распознавания номерных знаков, контроля соблюдения техники безопасности на производстве, анализа поведения покупателей в торговых залах. Архитектурно видеоаналитика строится на тех же свёрточных нейронных сетях, что и обработка изображений, но добавляет временно́е измерение: модель должна отслеживать объекты между кадрами, распознавать действия и последовательности событий, а не только статичные сцены. Рекуррентные нейронные сети и трансформеры для видео позволяют учитывать контекст движения и изменения на протяжении длительных фрагментов записи.
С точки зрения безопасности видеоаналитика наследует все уязвимости компьютерного зрения, описанные в предыдущем разделе, и добавляет к ним специфические. Адверсариальные воздействия, эффективные для одного кадра, могут оказаться нестабильными при смене ракурса, освещения или позы объекта в следующем кадре. Это одновременно и преимущество, и проблема: модель сложнее обмануть устойчиво, но и защитные проверки, успешные для одного кадра, не гарантируют надёжности на всей последовательности. Атакующий, размещающий адверсариальный патч в поле зрения камеры видеонаблюдения, должен учитывать, что камера фиксирует объект под разными углами, при разном освещении и на разном расстоянии. Исследования показали, что такие устойчивые патчи возможны: специально подобранные узоры на одежде позволяли человеку оставаться незамеченным для систем детекции пешеходов на протяжении длительных фрагментов видеозаписи.
Генерация видео переживает стремительное развитие. Модели на основе диффузии, адаптированные для работы с временны́ми последовательностями, способны создавать видеоролики продолжительностью в десятки секунд с реалистичной физикой движения, освещением и детализацией. Организации начинают использовать генерацию видео для создания маркетингового контента, обучающих материалов, прототипов рекламных роликов и презентаций. Стоимость производства видео с участием синтетических персонажей значительно ниже традиционных съёмок, и этот разрыв продолжает увеличиваться.
Но те же технологии создают инструментарий для злоумышленников. Видеодипфейки — синтетические видеозаписи, в которых лицо или тело одного человека заменено на другого — стали одной из наиболее обсуждаемых угроз. Инцидент в Гонконге, упомянутый в предыдущем разделе, показал, что дипфейк может быть достаточно убедительным для обмана участника видеоконференции. Злоумышленники синтезировали внешность и голос нескольких руководителей организации в реальном времени, и сотрудник, наблюдавший знакомые лица и слышавший знакомые голоса, выполнил финансовую операцию по их указанию. Этот случай продемонстрировал, что видеодипфейки способны преодолеть даже многоканальную верификацию: визуальное узнавание, голос и контекст рабочего совещания оказались недостаточными для выявления подделки.
Помимо мошенничества, видеодипфейки применяются для дискредитации, шантажа и манипулирования общественным мнением. Синтетические видеозаписи с участием руководителей организаций, политиков или публичных персон могут быть распространены в социальных сетях и нанести репутационный ущерб до того, как будет установлена их поддельность. Скорость распространения контента в интернете значительно превышает скорость его верификации, и организация может оказаться в ситуации, когда опровержение приходит слишком поздно.
Генерация видео поднимает и юридические вопросы, аналогичные тем, которые возникают при генерации изображений и аудио. Синтетическое видео может воспроизводить внешность конкретных людей без их согласия. Оно может содержать элементы, защищённые авторским правом: архитектуру зданий, дизайн продуктов, фрагменты фильмов или рекламных материалов. Организация, использующая генеративные видеомодели для производства контента, должна выстроить процесс проверки выходных материалов на предмет нарушения прав третьих лиц, а также обеспечить маркировку ИИ-сгенерированного контента в соответствии с требованиями, которые вводятся в ряде юрисдикций.
Средства обнаружения видеодипфейков развиваются параллельно с технологиями генерации, но пока отстают. Детекторы анализируют артефакты, характерные для синтетического видео: несогласованность освещения на лице и фоне, неестественные микродвижения губ, отсутствие характерных для живого человека пульсаций кровеносных сосудов под кожей, нарушения текстуры на границах подменённых областей. Проблема в том, что каждое новое поколение генеративных моделей устраняет артефакты, на которых были обучены детекторы предыдущего поколения. Возникает гонка между генерацией и обнаружением, в которой у генерации есть структурное преимущество: создать убедительный дипфейк проще, чем доказать, что видеозапись поддельна.
Организациям, которые полагаются на видеокоммуникации для принятия решений, необходимо пересмотреть свои процессы верификации. Видеоконференция больше не является надёжным подтверждением личности участника. Критические решения — финансовые операции, предоставление доступа, утверждение контрактов — требуют дополнительных каналов подтверждения, не зависящих от видео и голоса. Кодовые слова, обратные звонки по заранее согласованным номерам, двухфакторная аутентификация через независимый канал — всё это меры, которые добавляют трение в процесс, но снижают риск обмана через синтетические медиа.
Для организаций, работающих с видеоаналитикой на объектах критической инфраструктуры, практический вывод дополняется необходимостью тестирования устойчивости системы к адверсариальным воздействиям в физической среде. Камера на входе в защищённую зону, контролирующая доступ, должна быть проверена на устойчивость к патчам, подмене видеопотока и презентационным атакам. Эта проверка выходит за рамки стандартного тестирования точности модели и требует специализированных сценариев, приближённых к условиям реальной атаки.
2.5. Мультимодальные модели
В предыдущих разделах мы рассматривали системы, работающие с одной модальностью: текстом, изображением, аудио или видео. Но организации всё чаще сталкиваются с моделями, которые принимают на вход и генерируют данные нескольких типов одновременно. Пользователь загружает фотографию и задаёт вопрос текстом. Модель анализирует медицинский снимок и формирует текстовое заключение. Система принимает голосовую команду, интерпретирует изображение с камеры и отвечает синтезированной речью. Виртуальный ассистент читает документ, извлекает из него таблицу, строит график и объясняет результат в текстовом и голосовом формате. Такие модели называют мультимодальными, и их распространение меняет ландшафт рисков.
Архитектурно мультимодальные модели объединяют несколько кодировщиков, каждый из которых обрабатывает свой тип входных данных, и общее пространство представлений, в котором информация из разных модальностей приводится к единому формату. Текст, изображение и аудио преобразуются в числовые векторы, которые модель может сопоставлять, комбинировать и использовать для генерации результата в любой из поддерживаемых модальностей. Трансформерная архитектура, изначально разработанная для текста, оказалась достаточно гибкой, чтобы работать с токенами из разных источников: текстовыми, визуальными, аудио. Современные мультимодальные модели обрабатывают все модальности в едином потоке, и граница между «текстовой» и «визуальной» частью модели становится всё менее отчётливой.
Организации используют мультимодальные модели в сценариях, где одной модальности недостаточно. Медицинская система анализирует рентгеновский снимок совместно с историей болезни пациента и генерирует предварительное заключение. Система контроля качества на производстве совмещает изображение с камеры с показаниями датчиков и классифицирует дефект. Ассистент для работы с документами извлекает текст, таблицы и изображения из PDF-файла и отвечает на вопросы, учитывая все три типа содержимого. Чат-бот клиентской поддержки принимает фотографию повреждённого товара и текстовое описание проблемы, чтобы сформировать решение по обращению. Каждый из этих сценариев требует от модели способности устанавливать связи между данными разной природы и формировать ответ, основанный на их совокупности.
С точки зрения безопасности мультимодальные модели создают расширенную поверхность атаки, которая складывается из уязвимостей каждой отдельной модальности и новых уязвимостей, возникающих на их стыке. Инъекция в промпт, которая в текстовой модели передаётся через текст, в мультимодальной системе может быть встроена в изображение. Исследователи продемонстрировали, что текст, размещённый на изображении мелким шрифтом или скрытый за счёт цветовой маскировки, может быть прочитан моделью и интерпретирован как инструкция, хотя пользователь его не видит. Аналогичным образом вредоносные команды могут быть скрыты в аудиодорожке видеофайла: человек слышит обычную речь, а модель извлекает из звукового потока дополнительные инструкции.
Это означает, что для мультимодальной системы каждый канал входных данных становится потенциальным вектором атаки. Текст, изображение, аудио, видео, документы, таблицы — всё, что модель способна обработать, может содержать встроенные инструкции. При этом фильтрация входных данных усложняется: проверка текста на наличие инъекций — задача, для которой существуют отработанные подходы. Проверка изображения на наличие скрытого текста, который будет прочитан моделью, требует принципиально иных методов. Проверка аудиодорожки на наличие возмущений, незаметных для человека, но воспринимаемых моделью, — ещё более сложная задача. Организация, развёртывающая мультимодальную систему, должна выстраивать фильтрацию на каждом канале, а не только на текстовом входе.
Взаимодействие между модальностями порождает ещё один класс проблем: несогласованность. Модель может получить на вход изображение, содержащее одну информацию, и текстовый запрос, содержащий противоречащую информацию. Как она разрешит противоречие? Ответ зависит от архитектуры и обучения, и разработчик не всегда может предсказать результат. В контексте безопасности злоумышленник может использовать эту несогласованность: отправить изображение с одним содержанием и текст, описывающий другое, чтобы заставить модель сгенерировать результат, которого не дала бы ни одна модальность по отдельности. Это создаёт атаки, специфичные именно для мультимодальных систем и не имеющие аналогов в одномодальных.
Утечка информации через смену модальности — ещё одна угроза, характерная для мультимодальных систем. Модель, которая получает конфиденциальный документ в виде изображения и отвечает на вопросы о его содержании, может раскрыть чувствительные данные в текстовом ответе. Информация, защищённая в одной модальности (например, текст на изображении, которое не индексируется текстовыми поисковыми системами), становится доступной при переводе в другую модальность. Организация должна учитывать, что мультимодальная модель способна конвертировать данные между форматами, и классификация чувствительности должна распространяться на все модальности, через которые информация может быть извлечена.
Вопросы приватности приобретают дополнительную остроту. Мультимодальная модель, обрабатывающая видеозвонок, одновременно имеет доступ к изображению лица участника, его голосу, содержанию речи, фоновой обстановке и текстовым сообщениям в чате. Объём персональных данных, доступных модели в один момент времени, значительно превышает то, что получает одномодальная система. Если эти данные передаются внешнему поставщику для обработки, организация должна оценить риски с учётом всех модальностей одновременно, а не каждой по отдельности.
На практике мультимодальность добавляет сложности ко всем процессам безопасности, которые организация выстраивает для ИИ-систем. Моделирование угроз должно учитывать атаки через каждый канал ввода и их комбинации. Тестирование безопасности должно включать кросс-модальные сценарии: инъекции через изображение, скрытые команды в аудио, противоречия между модальностями. Мониторинг должен отслеживать поведение модели не только по текстовым входам и выходам, но и по визуальным, аудио и смешанным запросам. Классификация данных должна учитывать конвертацию между форматами. Всё это увеличивает стоимость и сложность программы безопасности, но игнорирование кросс-модальных рисков оставляет организацию с защитой, построенной для одномодального мира в мультимодальной реальности.
2.6. Предиктивная аналитика, рекомендательные системы и классификация
Генеративный ИИ привлекает основное внимание прессы и руководителей, но значительная часть ИИ-систем, работающих в организациях, решает более традиционные задачи. Модель предсказывает, какие клиенты уйдут в следующем квартале. Другая модель оценивает кредитоспособность заёмщика. Третья рекомендует товары на основе истории покупок. Четвёртая классифицирует транзакции как легитимные или мошеннические. Эти системы внедрены глубже, работают дольше и зачастую влияют на решения с более ощутимыми последствиями для конкретных людей, чем генеративные модели. При этом внимания к их безопасности уделяется меньше, потому что они воспринимаются как зрелые и понятные.
Предиктивная аналитика строится на моделях, обученных выявлять закономерности в исторических данных и переносить их на будущие события. Модель анализирует признаки — возраст клиента, частоту обращений, сумму покупок, историю платежей — и формирует прогноз: вероятность оттока, ожидаемый доход, риск дефолта. Архитектура таких моделей варьируется от классических алгоритмов машинного обучения — деревья решений, случайные леса, градиентный бустинг — до глубоких нейронных сетей. Многие из этих моделей работают в режиме реального времени, обрабатывая тысячи запросов в секунду и влияя на автоматические решения без участия человека.
Рекомендательные системы определяют, какой контент, товар или действие предложить пользователю. Они анализируют поведение конкретного пользователя (коллаборативная фильтрация), характеристики объектов (контентная фильтрация) или комбинируют оба подхода. Эти системы формируют значительную часть пользовательского опыта в электронной коммерции, стриминговых сервисах, новостных платформах и социальных сетях. Их влияние на поведение людей трудно переоценить: рекомендация определяет, что человек увидит, прочитает, купит или посмотрит.
Классификация — одна из базовых задач машинного обучения. Модель относит входные данные к одной из заранее определённых категорий. Письмо классифицируется как легитимное или спам. Транзакция — как обычная или подозрительная. Медицинский снимок — как норма или патология. Резюме кандидата — как соответствующее требованиям или нет. Обращение клиента — как жалоба, запрос информации или заявка на обслуживание. Простота формулировки задачи маскирует сложность последствий: ошибочная классификация транзакции может заблокировать легитимную операцию или пропустить мошенническую, а ошибочная классификация медицинского снимка — задержать лечение или назначить ненужное вмешательство.
С точки зрения безопасности эти системы подвержены ряду угроз, часть которых пересекается с угрозами генеративным моделям, а часть — специфична. Отравление обучающих данных работает здесь даже эффективнее, чем в LLM, потому что модели предиктивной аналитики обычно обучаются на меньших и более контролируемых наборах данных. Внедрение относительно небольшого количества искажённых записей может сместить границу решения модели. Классическая иллюстрация: злоумышленник, знающий структуру данных системы выявления мошенничества, целенаправленно совершает серию транзакций с определёнными характеристиками, чтобы при следующем цикле обучения модель перестала считать такие транзакции подозрительными.
Уклоняющиеся воздействия применимы к любой модели классификации. Если злоумышленник понимает, какие признаки влияют на решение модели, он может модифицировать свои действия так, чтобы оставаться ниже порога обнаружения. Мошенник, знающий, что система блокирует транзакции свыше определённой суммы из определённого региона, разобьёт операцию на несколько меньших переводов из других географических точек. Отправитель спама, знающий, какие слова повышают оценку нежелательности, перефразирует сообщение, сохраняя смысл, но обходя фильтр. Это не гипотетические сценарии, а повседневная практика: модели выявления мошенничества и спама находятся в постоянной гонке с теми, кто пытается их обойти.
Извлечение модели представляет серьёзную угрозу для организаций, чья конкурентная позиция зависит от качества предиктивных моделей. Атакующий отправляет множество запросов к модели, доступной через API, и по совокупности ответов восстанавливает её поведение с достаточной точностью, чтобы построить собственную копию. Для систем кредитного скоринга, ценообразования или оценки рисков потеря модели означает потерю коммерческого преимущества. Защита от извлечения включает ограничение числа запросов, огрубление ответов (возвращение категории вместо точной вероятности), мониторинг аномальных паттернов обращений и ограничение объёма информации в ответе.
Вопросы справедливости и дискриминации стоят для этих систем острее, чем для генеративных моделей, потому что предиктивные модели часто принимают решения, непосредственно затрагивающие права и возможности людей. Модель кредитного скоринга, обученная на исторических данных, в которых определённые демографические группы получали одобрение реже, воспроизведёт этот паттерн как закономерность. Модель отбора резюме, обученная на данных о прошлых наймах, унаследует предпочтения, которые организация, возможно, хотела бы преодолеть. EU AI Act относит ИИ-системы, используемые для оценки кредитоспособности, подбора персонала, назначения социальных выплат и правоприменения, к категории высокого риска и предъявляет к ним повышенные требования к прозрачности, объяснимости и отсутствию дискриминации.
Дрейф данных, описанный в разделе 1.3, особенно опасен для предиктивных моделей, потому что они чувствительны к изменениям в распределении входных данных. Модель прогнозирования спроса, обученная до пандемии, перестала давать адекватные прогнозы при резком изменении потребительского поведения. Модель оценки кредитного риска, откалиброванная в условиях низкой инфляции, может систематически занижать риск при изменении макроэкономической обстановки. В отличие от LLM, которые вызываются через внешний API и обновляются поставщиком, предиктивные модели часто развёрнуты локально, и ответственность за обнаружение дрейфа и переобучение лежит целиком на организации.
Объяснимость в предиктивных моделях имеет прямое практическое и регуляторное значение. Когда модель отклоняет кредитную заявку, заёмщик имеет право знать причину. Когда система выявления мошенничества блокирует транзакцию, клиент вправе оспорить решение. Регуляторы требуют, чтобы организация могла объяснить, какие факторы повлияли на автоматизированное решение. Для линейных моделей и деревьев решений объяснимость достижима. Для сложных ансамблей и глубоких нейронных сетей она требует специальных методов интерпретации, которые дают приближённое, а не точное объяснение. Организация, выбирающая архитектуру модели, должна учитывать требования к объяснимости как архитектурное ограничение, а не как задачу, которую можно решить после развёртывания.
Для организации практический вывод из этого раздела состоит в том, что зрелость технологии не означает зрелость защиты. Предиктивные модели и классификаторы работают в организациях годами, но многие из них не проходили оценку устойчивости к враждебным воздействиям, не проверялись на справедливость по отношению к разным группам пользователей и не оснащены мониторингом дрейфа. Именно потому, что эти модели принимают решения с конкретными последствиями для людей и бизнеса, они требуют такого же внимания к безопасности, как и генеративные системы, привлекающие основное внимание.
2.7. Специфика безопасности каждого типа систем
На протяжении этой главы мы рассмотрели шесть типов ИИ-систем, и у каждого обнаружился собственный набор уязвимостей. Языковые модели атакуют через текст. Модели компьютерного зрения обманывают через пиксельные возмущения. Голосовые системы подделывают через синтетическую речь. Видеомодели эксплуатируют через дипфейки. Мультимодальные системы открывают сразу несколько каналов атаки. Предиктивные модели уязвимы к отравлению данных и уклоняющимся воздействиям. Организация, которая подходит к защите всех этих систем одинаково, неизбежно оставляет пробелы.
Но из этого не следует, что для каждого типа нужно строить защиту с нуля. Угрозы различаются по механизму, но вопросы, которые организация должна задать перед развёртыванием любой ИИ-системы, остаются общими. Какие данные обрабатывает система и насколько они чувствительны? Какие решения принимает модель и каковы последствия ошибки? Кто может подать данные на вход и через какие каналы? Какие действия способна выполнить система в информационной среде организации? Как обнаружить, что модель ведёт себя аномально? Как откатить решение, если оно оказалось ошибочным?
Различия начинаются на уровне конкретных ответов. Для LLM-приложения основной канал атаки — текстовый ввод, и фильтрация входных промптов является первой линией защиты. Для системы компьютерного зрения текстовая фильтрация бесполезна: угроза приходит через модифицированные пиксели, адверсариальные патчи или подмену видеопотока. Для голосовой системы ключевой риск — клонирование голоса и обход биометрии, и защита строится на спектральном анализе и многофакторной верификации. Для предиктивной модели кредитного скоринга критичен дрейф данных и справедливость по отношению к демографическим группам, а не инъекции в промпт. Универсальный набор контролей, применённый без учёта типа системы, создаёт иллюзию безопасности.

Рисунок 7. Сравнение профилей угроз различных типов ИИ-систем.
Различается и характер ущерба. Ошибка генеративной модели может привести к репутационному инциденту: оскорбительный ответ чат-бота, выдуманная юридическая ссылка, раскрытие конфиденциального фрагмента. Ошибка модели классификации мошенничества влечёт прямые финансовые потери. Ошибка системы распознавания лиц на пункте пропуска создаёт физическую угрозу. Ошибка системы компьютерного зрения в автономном транспорте может стоить человеческой жизни. Уровень допустимого риска и строгость контролей должны соответствовать характеру ущерба, а он напрямую зависит от типа системы и её роли в бизнес-процессе.
Регуляторные требования тоже различаются по типам систем. EU AI Act относит биометрическую идентификацию в общественных пространствах и системы социального скоринга к запрещённым или высокорисковым категориям. Системы кредитного скоринга и отбора персонала требуют объяснимости и отсутствия дискриминации. Генеративные модели общего назначения подпадают под требования прозрачности и маркировки синтетического контента. Организация, применяющая ИИ в нескольких областях, может обнаружить, что одна из её систем регулируется строго, другая — мягко, а третья пока вообще не попадает в поле зрения регулятора. Карта применимости регуляторных требований, которую мы рассмотрим в восьмой главе, должна строиться с учётом типа каждой системы.



