Архитектура безопасного ИИ. Риски, управление и защита искусственного интеллекта

- -
- 100%
- +
Нечёткое определение активов приводит к тому, что ценные ресурсы остаются без защиты. Организация защищает серверы и базы данных, но не учитывает системные промпты, библиотеки шаблонов и конфигурации конвейеров. Она классифицирует корпоративные данные, но не распространяет классификацию на обучающие выборки и векторные хранилища. Она ведёт реестр приложений, но не включает в него модели и агентов.
Нечёткое определение границ приводит к появлению зон, за которые никто не отвечает. Облачный поставщик считает, что безопасность данных — ответственность организации. Организация считает, что безопасность модели — ответственность поставщика. Между ними остаётся пространство, которое не покрыто контролями ни одной из сторон. В третьей главе, посвящённой распределению ответственности, мы подробно разберём модели совместной ответственности для различных сценариев развёртывания.
Практический вывод из этого раздела прост. Прежде чем строить архитектуру защиты, организация должна провести инвентаризацию активов ИИ-системы, выходящую за рамки привычного реестра ИТ-активов. Она должна включить в него данные всех категорий, модели, промпты, конвейеры, интерфейсы и ключи доступа. И она должна определить границы каждой ИИ-системы с учётом внешних зависимостей, интеграций и агентного взаимодействия. Без этой работы оценка рисков, моделирование угроз и выбор мер защиты строятся на неполной картине, а неполная картина неизбежно оставляет пробелы.
Источники и дальнейшее чтение к главе 1
— Model Context Protocol — официальная спецификация, Anthropic / открытый стандарт, modelcontextprotocol.io.
— Agent2Agent Protocol (A2A) — официальная спецификация, Linux Foundation (изначально Google).
— NIST AI Risk Management Framework (AI RMF 1.0). National Institute of Standards and Technology, январь 2023.
— ISO/IEC 42001:2023. Information technology — Artificial intelligence — Management system, раздел 7.3 (компетентность и осведомлённость).
— NIST AI 100—2. Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations. National Institute of Standards and Technology.
— OWASP Top 10 for LLM Applications. OWASP Foundation.
— OWASP Agentic AI — Threats and Mitigations. OWASP Gen AI Security Project.
— MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems). MITRE Corporation.
Глава 2. Типы ИИ-систем и их архитектурные особенности
В первой главе мы разобрали общую анатомию ИИ-системы: компоненты, агенты, отличия от традиционного ПО, социотехническую природу и активы. Но за словами «ИИ-система» скрывается широкий спектр технологий, и каждая из них работает с информацией по-своему. Языковая модель, генерирующая текст, устроена иначе, чем система компьютерного зрения, распознающая дефекты на конвейере. Модель, синтезирующая речь, создаёт риски, которых нет у модели кредитного скоринга. Мультимодальная система, принимающая на вход текст, изображение и аудио одновременно, расширяет поверхность атаки за счёт каждого канала.
Для специалиста по безопасности различия между типами ИИ-систем имеют практическое значение. Уклоняющиеся воздействия на модели компьютерного зрения строятся на пиксельных возмущениях, незаметных человеческому глазу. Инъекции в промпт эксплуатируют способность языковой модели интерпретировать текст как инструкцию. Дипфейки используют генеративные модели изображений и видео для создания убедительных подделок. Атака, эффективная против одного типа системы, может быть бессмысленна для другого. Моделирование угроз, выбор контролей и тестирование безопасности должны учитывать конкретную технологию, а не абстрактный «ИИ».

Рисунок 5. Таксономия типов ИИ-систем по назначению, архитектуре, степени автономности и характеру взаимодействия с пользователем.
Эта глава последовательно рассматривает основные типы ИИ-систем, с которыми сталкиваются организации: большие языковые модели, системы компьютерного зрения, модели генерации и анализа аудио, видеосистемы, мультимодальные модели и системы предиктивной аналитики. Для каждого типа мы разбираем архитектурные особенности, характерные сценарии применения и специфические риски безопасности. Завершающий раздел сводит эти различия в единую картину, которая помогает определить профиль угроз для конкретной системы в конкретной организации.
2.1. Большие языковые модели и генерация текста
Большие языковые модели (Large Language Models, LLM) стали наиболее обсуждаемой и наиболее быстро внедряемой категорией ИИ-систем. Когда руководители говорят о внедрении ИИ, в большинстве случаев они имеют в виду именно LLM: чат-ассистенты для сотрудников и клиентов, генерация документов, анализ текстов, автоматизация переписки, суммаризация отчётов, помощь в написании кода. Масштаб распространения этих систем определяет и масштаб рисков, которые они несут. Поэтому мы начинаем обзор типов ИИ-систем именно с них.
Архитектурной основой современных LLM является трансформер — тип нейронной сети, предложенный в 2017 году. Трансформер обрабатывает текст не последовательно, слово за словом, а параллельно, используя механизм внимания (attention), который позволяет модели учитывать связи между любыми элементами текста независимо от их расположения. Входной текст разбивается на токены — минимальные единицы обработки, которые могут соответствовать словам, частям слов или отдельным символам. Каждый токен преобразуется в числовой вектор, проходит через десятки или сотни слоёв трансформера и на выходе формирует вероятностное распределение следующего токена. Модель генерирует текст последовательно, токен за токеном, каждый раз выбирая продолжение на основе всего предшествующего контекста.
Размеры современных LLM измеряются миллиардами и сотнями миллиардов параметров. Контекстное окно — объём текста, который модель может учитывать при генерации ответа — варьируется от сотен тысяч до нескольких миллионов токенов. Эти масштабы определяют как возможности моделей, так и требования к инфраструктуре: обучение требует кластеров из тысяч специализированных процессоров, а продуктивный инференс — значительных вычислительных ресурсов для обработки каждого запроса.
Организации используют LLM в нескольких конфигурациях, и каждая из них формирует собственный профиль риска. Вызов внешней модели через API поставщика — наиболее распространённый вариант. Организация отправляет запрос и получает ответ, не контролируя внутреннее устройство модели, данные, на которых она обучена, и момент обновления. Запросы и ответы проходят через инфраструктуру поставщика, и вопрос о том, сохраняются ли они, используются ли для дообучения и кто имеет к ним доступ, регулируется условиями сервиса, которые организация не всегда изучает до начала использования.
Локальное развёртывание модели с открытыми весами даёт организации контроль над средой выполнения, но возлагает на неё ответственность за безопасность инфраструктуры, управление доступом и проверку целостности модели. Модель, загруженная из открытого репозитория, может содержать вредоносный код в сериализованных весах или скрытые закладки, внедрённые при обучении. Организации, выбирающие этот путь, должны проверять происхождение модели, валидировать контрольные суммы и ограничивать доступ к среде, в которой модель работает.
Дообучение (fine-tuning) предобученной модели на корпоративных данных создаёт гибрид: модель наследует общие способности базовой модели и приобретает специфические знания из данных организации. С точки зрения безопасности дообучение вводит дополнительный риск. Корпоративные данные, использованные при дообучении, могут быть извлечены из ответов модели. Процесс дообучения сам по себе может стать точкой атаки, если злоумышленник получает возможность повлиять на обучающую выборку.
Отдельная архитектурная конфигурация — LLM-приложение с дополненной генерацией (RAG). В этом случае модель не хранит все нужные знания в своих параметрах, а получает контекст из внешней базы знаний в момент запроса. Текст запроса дополняется релевантными фрагментами документов, извлечёнными из векторного хранилища, и модель формирует ответ с учётом этого контекста. RAG расширяет возможности модели, но одновременно расширяет поверхность атаки: через внешние документы в контекст модели может попасть вредоносная инструкция, а ответ может содержать фрагменты конфиденциальных документов, к которым пользователь не должен иметь доступа.

Рисунок 6. Архитектура LLM-приложения с дополненной генерацией на основе поиска: запрос, оркестрация, поиск, векторное хранилище, контекст и языковая модель.
С точки зрения безопасности LLM обладают набором специфических уязвимостей, которые не встречаются в других типах ИИ-систем. Инъекция в промпт (prompt injection) позволяет злоумышленнику изменить поведение модели через специально сформированный текст. Прямая инъекция вводится в запросе пользователя. Косвенная — встраивается в документ, письмо или веб-страницу, которые модель обрабатывает как часть контекста. Модель не различает инструкцию разработчика и текст, поступивший извне, потому что и то, и другое для неё — последовательность токенов.
Утечка системного промпта раскрывает внутренние инструкции приложения: правила поведения, ограничения, описание доступных инструментов, иногда даже ключи и идентификаторы. Конфабуляция — способность модели уверенно генерировать несуществующие факты, ссылки и данные — создаёт риски при использовании LLM в юридических, медицинских и финансовых контекстах, где ошибка может привести к конкретному ущербу. Неограниченное потребление ресурсов при обработке сложных или злонамеренно сформированных запросов может привести к отказу в обслуживании или значительным финансовым затратам.
Каждая из этих уязвимостей подробно рассматривается в десятой главе. Здесь важно зафиксировать принципиальный момент: LLM — это системы, чьё поведение управляется текстом, и именно текст становится основным вектором атаки. Защита LLM-приложения требует контролей на уровне входных и выходных данных, ограничения полномочий модели, изоляции контекста и непрерывного мониторинга того, что модель генерирует и какие действия выполняет от имени пользователя.
2.2. Компьютерное зрение и обработка изображений
Если большие языковые модели работают с текстом, то системы компьютерного зрения работают с визуальной информацией: фотографиями, видеопотоками, медицинскими снимками, спутниковыми изображениями, сканами документов. Организации используют их для распознавания лиц при аутентификации, контроля качества продукции на конвейере, анализа медицинских изображений, мониторинга территорий через камеры наблюдения, автоматической обработки документов и классификации визуального контента. Автономные транспортные средства полагаются на компьютерное зрение для распознавания пешеходов, знаков и других объектов в режиме реального времени. Масштаб применения широк, и во многих из этих сценариев ошибка модели может привести к последствиям для здоровья, безопасности или прав человека.
Архитектурную основу большинства задач компьютерного зрения составляют свёрточные нейронные сети (Convolutional Neural Networks, CNN). Свёрточная сеть обрабатывает изображение, пропуская его через серию фильтров, каждый из которых выделяет определённые визуальные признаки: границы, текстуры, формы, сочетания элементов. Ранние слои сети распознают простые паттерны, такие как горизонтальные и вертикальные линии. Более глубокие слои комбинируют эти паттерны в сложные структуры: контуры объектов, лица, символы. На выходе сеть формирует классификацию изображения, определяет координаты объектов или создаёт попиксельную разметку сцены.
Задачи компьютерного зрения различаются по сложности. Классификация определяет, что изображено на фотографии: кошка, автомобиль, дефект на детали. Детекция находит объекты на изображении и определяет их координаты. Сегментация разделяет изображение на области, относящиеся к разным объектам или категориям. Распознавание лиц сопоставляет изображение лица с хранящимся образцом. Генерация изображений создаёт новые визуальные данные на основе текстового описания, шаблона или случайного начального состояния. Каждая из этих задач создаёт собственный профиль рисков, и защитные меры, эффективные для одной, могут оказаться бесполезными для другой.
Генерация изображений заслуживает отдельного внимания, потому что за последние годы она перешла из области исследований в массовое применение. Модели на основе диффузии (diffusion models) способны создавать фотореалистичные изображения по текстовому описанию. Процесс начинается с случайного шума, который модель постепенно преобразует в изображение, соответствующее запросу. Генеративно-состязательные сети (GAN) используют другой подход: две нейронные сети конкурируют друг с другом, одна генерирует изображение, другая оценивает его правдоподобность, и в результате качество генерации улучшается с каждой итерацией.
С точки зрения безопасности системы компьютерного зрения подвержены набору угроз, которые существенно отличаются от угроз текстовым моделям. Наиболее изученная категория — уклоняющиеся воздействия, или адверсариальные атаки. Суть их в том, что минимальное, незаметное человеческому глазу изменение изображения заставляет модель принять ошибочное решение. Исследователи продемонстрировали, что добавление специально рассчитанного шума к фотографии панды заставляет классификатор с высокой уверенностью определить её как гиббона. Изменения настолько малы, что два изображения визуально неотличимы для человека, но модель видит их совершенно по-разному.
На практике эти атаки принимают разные формы. Адверсариальные патчи — небольшие наклейки или изображения, размещённые в поле зрения камеры, которые заставляют модель игнорировать объект или классифицировать его неправильно. В экспериментах удавалось добиться того, что система автопилота переставала распознавать дорожный знак при наклеивании на него специально подобранного стикера. Модификация физических объектов — нанесение определённого узора на одежду или аксессуары, которое помогает человеку уклониться от распознавания системой видеонаблюдения. Эти сценарии выходят далеко за пределы лабораторных экспериментов и имеют прямое значение для организаций, использующих компьютерное зрение в системах физической безопасности, контроля доступа и критической инфраструктуры.
Системы распознавания лиц несут дополнительные риски, связанные с приватностью и правами человека. Биометрические данные — одна из наиболее чувствительных категорий персональных данных, и их обработка регулируется строгими нормами в большинстве юрисдикций. EU AI Act относит системы биометрической идентификации в реальном времени в общественных пространствах к категории запрещённых или высокорисковых сценариев. Помимо регуляторных требований, системы распознавания лиц демонстрируют различную точность для разных демографических групп: исследования показывали, что модели распознавания лиц ошибаются значительно чаще при работе с определёнными этническими группами и возрастными категориями. Если организация использует такую систему для принятия решений, затрагивающих людей, неравномерная точность превращается в дискриминационный риск.
Обход биометрической аутентификации — ещё один вектор атаки. Злоумышленники используют фотографии, загруженные из открытых источников, и превращают их в поддельные видеозаписи, демонстрирующие движения лица: моргание, повороты головы, мимику. Виртуальные камеры подменяют видеопоток, и система принимает поддельное видео за живого человека. Этот метод был успешно применён для обхода систем аутентификации в финансовых и государственных сервисах. Защита от него требует продвинутых методов определения подлинности: анализ текстуры кожи, микродвижений, глубины изображения, аппаратная привязка к доверенной камере.
Генеративные модели изображений создают отдельный класс рисков, связанный с дипфейками и синтетическим контентом. Организация может столкнуться с дипфейком руководителя, используемым для социальной инженерии. Сгенерированные изображения могут применяться для создания поддельных документов, удостоверений, отчётов. Синтетический контент может нарушать авторские права, воспроизводя стиль или элементы защищённых произведений. Маркировка ИИ-сгенерированного контента, водяные знаки и средства проверки происхождения (provenance) становятся важными элементами защиты, но ни один из них пока не даёт абсолютных гарантий.
Есть и ещё одно свойство, отличающее системы компьютерного зрения от текстовых моделей: их часто развёртывают на периферийных устройствах с ограниченными ресурсами. Камера видеонаблюдения, дрон, промышленный контроллер, мобильный терминал — всё это среды, где модель работает локально, вне защищённого периметра организации. Компрометация такого устройства может дать атакующему прямой доступ к модели, её весам и обрабатываемым данным. Защита периферийных развёртываний требует шифрования модели на устройстве, аппаратной аттестации, контроля целостности и мониторинга поведения модели на удалённых точках.
Для организации, внедряющей системы компьютерного зрения, из этого следует практический вывод. Оценка рисков должна учитывать не только точность модели, но и её устойчивость к враждебным воздействиям, справедливость для разных групп пользователей, условия развёртывания и потенциальное применение генерируемых данных. Модель, прошедшая проверку точности на тестовом наборе, может оказаться уязвимой к адверсариальному патчу, предвзятой к определённой демографической группе или небезопасной при развёртывании на незащищённом устройстве. Каждый из этих аспектов требует отдельной проверки и отдельного набора контролей.
2.3. Генерация и анализ аудио и речи
Звук — один из наиболее естественных каналов взаимодействия человека с технологией. Голосовые ассистенты принимают команды и отвечают на вопросы. Системы распознавания речи транскрибируют телефонные разговоры, записи совещаний и обращения клиентов. Модели синтеза речи озвучивают навигаторы, справочные системы и автоматические уведомления. Системы голосовой биометрии идентифицируют звонящего по характеристикам голоса. За каждой из этих функций стоят ИИ-модели, и каждая из них создаёт риски, которые организации привыкли недооценивать.
Технологически работа с аудио и речью делится на два направления. Распознавание речи (Automatic Speech Recognition, ASR) преобразует звуковой сигнал в текст. Модель принимает на вход аудиозапись, разбивает её на фрагменты, извлекает акустические признаки и сопоставляет их с языковой моделью, чтобы сформировать наиболее вероятную текстовую расшифровку. Современные ASR-системы построены на архитектуре трансформера и способны работать с десятками языков, распознавать речь в условиях шума, различать нескольких говорящих и адаптироваться к акценту. Организации используют ASR для автоматической транскрипции звонков в контакт-центрах, протоколирования совещаний, голосового управления интерфейсами и анализа переговоров в целях контроля соответствия требованиям.
Синтез речи (Text-to-Speech, TTS) работает в обратном направлении: преобразует текст в звуковой сигнал, имитирующий человеческую речь. Ранние системы звучали механически и узнаваемо. Современные модели генерируют речь, которую сложно отличить от записи живого человека. Они воспроизводят интонации, паузы, эмоциональную окраску и индивидуальные особенности произношения. Организации используют TTS для автоматизации клиентских коммуникаций, озвучивания контента, создания голосовых интерфейсов и локализации продуктов на разных языках.
Между этими двумя направлениями лежит область, которая быстро развивается и порождает наиболее острые вопросы безопасности: клонирование голоса. Современные модели способны воспроизвести голос конкретного человека по нескольким секундам записи. Они анализируют тембр, ритм, манеру говорить и создают синтетическую копию, которая звучит убедительно даже для знакомых людей. Технология находит легитимное применение: дубляж фильмов, восстановление голоса для людей, утративших способность говорить, персонализация голосовых интерфейсов. Но она же создаёт инструмент для мошенничества и социальной инженерии, масштаб которого трудно переоценить.
Инциденты, связанные с голосовыми дипфейками, перестали быть теоретической угрозой. В одном из широко описанных случаев злоумышленники воспроизвели голос генерального директора европейской энергетической организации и по телефону убедили подчинённого перевести около 220 тысяч евро на подконтрольный счёт. Сотрудник был уверен, что разговаривает с руководителем, поскольку голос, интонации и манера речи совпадали. В другом случае, в Гонконге, участники видеоконференции оказались сгенерированными дипфейками: изображение и голос нескольких руководителей были синтезированы в реальном времени, что привело к переводу значительных средств на мошеннический счёт. Эти случаи показывают, что голосовой дипфейк способен преодолеть один из наиболее устойчивых механизмов доверия в организации: узнавание голоса знакомого человека.
На теневых рынках появились сервисы «дипфейк как услуга» (deepfake-as-a-service), которые значительно снизили порог входа для злоумышленников. Заказчик предоставляет образец голоса, сценарий и получает готовую аудиозапись в течение нескольких часов. Стоимость таких услуг варьируется, но остаётся вполне доступной. Некоторые платформы предлагают готовые голосовые клоны публичных персон, которые можно использовать сразу, без индивидуальной настройки. Это означает, что атаки с использованием голосовых дипфейков перестали требовать глубокой технической экспертизы и доступны широкому кругу злоумышленников.
Системы голосовой биометрии, используемые для аутентификации в банковских и государственных сервисах, оказываются уязвимы к тем же технологиям. Если система сравнивает голос звонящего с хранящимся образцом, синтетический голос, созданный по записи из открытых источников, может пройти проверку. Исследователи демонстрировали успешный обход голосовой аутентификации с помощью клонированного голоса в лабораторных условиях, и есть основания полагать, что подобные атаки уже применяются на практике. Защита требует дополнительных уровней верификации: анализ спектральных характеристик, выявление артефактов синтеза, проверка канала связи, комбинирование голосовой биометрии с другими факторами аутентификации.
Помимо мошенничества, аудиосистемы подвержены адверсариальным атакам, аналогичным тем, которые применяются к компьютерному зрению. Исследователи показали, что в аудиозапись можно встроить возмущения, незаметные человеческому уху, но заставляющие модель распознавания речи выдать произвольный текст. Звуковой файл, который человек воспринимает как обычную музыку, может содержать скрытую команду, которую голосовой ассистент интерпретирует как инструкцию: открыть веб-страницу, отправить сообщение, выполнить действие. Эта категория атак особенно опасна в сценариях, где голосовой интерфейс используется для управления устройствами, транзакциями или доступом к системам.
Отдельного внимания заслуживают вопросы приватности. Аудиоданные содержат не только содержание речи, но и биометрические характеристики говорящего, эмоциональное состояние, фоновые звуки, позволяющие определить местоположение. Организация, которая транскрибирует звонки клиентов с помощью ASR-модели, обрабатывает чувствительные данные. Если эта обработка происходит через внешний API, аудиозаписи передаются поставщику, и условия их хранения, использования и удаления определяются договором, а не техническими мерами организации. Если записи используются для дообучения модели, голоса конкретных людей могут оказаться встроенными в параметры модели и теоретически могут быть извлечены.
Генерация музыки и звуковых эффектов с помощью ИИ добавляет ещё одно измерение рисков. Модели, обученные на корпусах музыкальных произведений, способны генерировать композиции, стилистически близкие к работам конкретных исполнителей. Вопросы авторских прав, возникающие при этом, пока не получили однозначного правового разрешения в большинстве юрисдикций. Организация, использующая генеративную аудиомодель для создания контента, должна учитывать юридические риски, связанные с потенциальным сходством сгенерированных произведений с защищёнными оригиналами.



