- -
- 100%
- +
Вы думаете, для запуска собственного ИИ нужен суперкомпьютер за полмиллиона рублей, команда программистов и серверная комната с кондиционером? Отбросьте этот стереотип. Скорее всего, вам хватит обычного сервера за 120—150 тысяч рублей, а иногда — даже старого офисного ПК с добавлением игровой видеокарты. В этой главе мы разберём, как устроена система изнутри, чтобы вы убедились: внедрение локального ИИ в компанию на 15 компьютеров — задача реальная, выполнимая за несколько вечеров и не требующая глубоких технических знаний.
Простая схема: сервер, сеть и браузер
Представьте себе обычную локальную сеть вашего офиса. Компьютеры сотрудников соединены между собой через роутер или коммутатор. К этой же сети мы добавляем ещё один компьютер — сервер, на котором будет работать ИИ. Всё. Никаких дополнительных проводов, облачных сервисов или сложного оборудования.
Сервер — это обычный системный блок, но с одной важной деталью: мощной видеокартой (GPU). Именно видеокарта выполняет все вычисления нейросети. Для работы языковой модели уровня GPT-3.5 достаточно видеокарты с 16—24 гигабайтами видеопамяти. Такие карты стоят от 40 до 150 тысяч рублей. В главе 4 мы подробно рассмотрим варианты, а пока просто запомните: это не сервер за миллионы, а скорее мощный игровой компьютер.
Сотрудники заходят в чат-интерфейс, как в Telegram. На каждом рабочем компьютере уже есть браузер — Chrome, Firefox, Edge. Никакого дополнительного программного обеспечения устанавливать не нужно. Сотрудник открывает браузер, вводит локальный адрес сервера (например, http://192.168.1.10:3000) и попадает на страницу с чатом, очень похожую на ChatGPT или Telegram. Там он пишет свой вопрос на обычном русском языке и через несколько секунд получает ответ. Всё происходит внутри вашей локальной сети, как если бы вы открыли внутренний сайт компании.
Один сервер — пятнадцать пользователей. Современные языковые модели умеют обрабатывать запросы по очереди или параллельно. При использовании видеокарты с 16 ГБ VRAM и модели среднего размера (7—14 миллиардов параметров) сервер легко выдерживает одновременную работу 5—10 пользователей без заметных задержек. Если все 15 сотрудников обращаются к ИИ не чаще, чем раз в несколько минут, нагрузка будет комфортной. Для пилотного запуска этого достаточно.
Принцип работы: модель, документы и роли
Как же сервер отвечает на вопросы о ваших данных? Внутри работают три ключевых компонента.
1. Языковая модель. Это «мозг» системы. Она умеет понимать русский язык, рассуждать, писать тексты и анализировать информацию. Мы будем использовать открытые модели, которые можно свободно скачать и запустить: Qwen, Llama, Mistral, Saiga и другие. Они не уступают облачным аналогам в базовых задачах, а для специфических бизнес-задач их можно дообучить на ваших документах. Модель работает локально, на вашем сервере, и не отправляет данные никуда.
2. Векторная база данных и индексация документов. Языковая модель не знает содержимого ваших Excel-файлов и выгрузок из 1С. Чтобы она могла отвечать на вопросы по вашим данным, мы используем технологию RAG (Retrieval-Augmented Generation — генерация с дополнением из поиска). Все ваши документы (Excel, CSV, PDF, Word, выгрузки из 1С) проходят процесс индексации: текст из них разбивается на фрагменты, каждый фрагмент преобразуется в числовой вектор (embedding) и сохраняется в специальной векторной базе данных. Когда пользователь задаёт вопрос, система ищет в векторной базе самые похожие фрагменты документов, подставляет их в запрос к языковой модели и просит сформулировать ответ на основе только этой информации. Благодаря этому ИИ отвечает по вашим актуальным данным, а не выдумывает.
3. Ролевой доступ. У каждого сотрудника есть своя учётная запись с логином и паролем. Администратор определяет, какие документы и функции доступны каждой роли. Например, менеджеры по продажам видят остатки и цены продажи, но не видят закупочные цены и зарплаты. Бухгалтер видит финансовые документы, но не видит переписку с клиентами. Это реализуется через настройку прав в веб-интерфейсе и разграничение доступа к векторным индексам. Все запросы логируются, поэтому вы всегда можете проверить, кто и что спрашивал.
Сравнение с облаком: почему локально выгоднее
Давайте честно сравним локальную систему с облачными сервисами, такими как ChatGPT, YandexGPT или GigaChat, по четырём критериям.
Стоимость. Облачные корпоративные тарифы стоят от 500 до 2000 рублей за пользователя в месяц. Для 15 сотрудников это от 90 000 до 360 000 рублей в год. Локальный сервер — разовая инвестиция 120—150 тысяч рублей. Он окупается за первый год, а дальше работает бесплатно. Электроэнергия: видеокарта потребляет 200—300 Вт, при круглосуточной работе это примерно 500—700 рублей в месяц. Итого годовые затраты после покупки — менее 10 000 рублей на электричество.
Скорость. Облачный сервис зависит от скорости вашего интернета и загруженности серверов провайдера. Локальная система отвечает за 1—5 секунд, потому что данные не покидают офис и нет задержек сети. Даже при медленном интернете или его полном отсутствии скорость остаётся высокой.
Приватность. Отправляя данные в облако, вы передаёте коммерческую информацию третьей стороне. Вы не контролируете, где хранятся ваши документы, кто имеет к ним доступ, не используются ли они для обучения чужих моделей. Локальная система гарантирует: все данные остаются внутри вашей сети. Вы можете провести аудит, убедиться, что никакая информация не уходит наружу, и при необходимости полностью отключить сервер от интернета.
Контроль. В облаке вы зависите от политики провайдера: он может изменить модель, интерфейс, условия. В локальной системе вы сами решаете, какую модель использовать, когда обновлять, какие данные подключать. Вы можете дообучить модель на своих документах, настроить её под свою терминологию, добавить собственные шаблоны отчётов.
Возможность полностью отключить интернет
Одно из главных преимуществ локальной архитектуры — независимость от внешнего мира. После того как система установлена и все необходимые модели и библиотеки скачаны, вы можете физически отключить сервер от интернета. ИИ продолжит работать, потому что все вычисления происходят внутри вашей локальной сети. Сотрудники так же будут заходить в чат по внутреннему адресу и получать ответы.
Зачем это нужно? Во-первых, безопасность: сервер, не подключённый к интернету, невозможно взломать удалённо, с него невозможно украсть данные. Во-вторых, стабильность: ваша работа не зависит от провайдера, сбоев связи или блокировок. В-третьих, соответствие требованиям: для некоторых отраслей (например, работа с персональными данными) критически важно, чтобы информация не покидала периметр компании.
Конечно, для удобства администрирования можно оставить серверу доступ в интернет для получения обновлений, но это не обязательно. В главе 14 мы подробно обсудим вопросы безопасности и способы изоляции.
Практический результат
Итак, вы теперь понимаете, что архитектура локального ИИ для 15 компьютеров проста и доступна:
Один сервер с GPU — центральный узел, выполняющий все вычисления.
Локальная сеть — уже есть в вашем офисе.
Браузер на каждом компьютере — интерфейс для сотрудников, ничего устанавливать не нужно.
Открытые программные компоненты — модель, векторная база, веб-интерфейс — всё бесплатно и свободно распространяется.
Вам не нужно быть программистом, чтобы это внедрить. Все шаги мы разберём детально, с командами и скриншотами. В следующей главе мы перейдём к выбору оборудования: вы узнаете, какую видеокарту купить, сколько нужно оперативной памяти и какой процессор выбрать, чтобы система работала быстро и надёжно. Вы сможете составить конфигурацию под свой бюджет — от минимальной до продвинутой.
А пока подумайте, есть ли у вас в организации старый, но мощный компьютер, который можно превратить в ИИ-сервер. Возможно, ваш путь к собственному интеллектуальному помощнику начнётся уже сегодня.
Глава 4. Железо: выбираем сервер под 15 пользователей
Вы решились. Вы готовы выделить угол в офисе, бюджет и несколько вечеров на настройку. Первый практический шаг — собрать или выбрать сервер, который будет тянуть локальный ИИ для пятнадцати сотрудников. В этой главе мы разберём каждый компонент, поговорим о требованиях и соберём три конфигурации: минимальную, оптимальную и с запасом. Никакой воды — только то, что действительно важно.
Почему именно видеокарта — сердце системы
Вся работа языковой модели — это миллиарды матричных операций, которые выполняются на графическом процессоре (GPU). Центральный процессор (CPU) тоже участвует: он обрабатывает запросы к векторной базе, управляет веб-интерфейсом, но основная вычислительная нагрузка лежит на видеокарте. Поэтому ключевой параметр — объём видеопамяти (VRAM). Именно он определяет, какую модель вы сможете запустить.
Для качественной работы на русском языке с приемлемой скоростью нам нужна модель с 7—14 миллиардами параметров. Такие модели в квантованном виде (сжатые без сильной потери качества) занимают от 5 до 12 ГБ видеопамяти. Плюс запас под контекст (историю диалога) и параллельные запросы. Отсюда правило: видеокарта должна иметь минимум 16 ГБ VRAM, а лучше 24 ГБ. Именно поэтому мы рассматриваем карты именно с такими объёмами.
Остальные компоненты сервера подбираются так, чтобы не создавать узких мест и работать стабильно 24/7.
Компоненты сервера: что и зачем
Процессор (CPU)
Для обслуживания 15 пользователей не нужен топовый процессор. Основная работа уходит на GPU, а CPU занимается:
обработкой HTTP-запросов от сотрудников;
поиском по векторной базе (это тоже вычисления, но не такие тяжёлые);
запуском дополнительных скриптов (выгрузки из 1С, планировщик).
Вам подойдёт любой современный 6—8-ядерный процессор, например Intel Core i5—12400/13400 или AMD Ryzen 5 5600/7600. Можно взять и серверный Xeon, но это не обязательно. Главное — поддержка PCIe 4.0 или хотя бы 3.0 для видеокарты.
Вывод: не переплачивайте за CPU. Достаточно среднего уровня.
Оперативная память (RAM)
Языковая модель загружается в VRAM видеокарты, но сама система и приложения требуют оперативной памяти. Для наших задач необходимо минимум 32 ГБ. Если вы планируете держать в оперативной памяти несколько моделей или большие векторные индексы, берите 64 ГБ. Учтите, что для Docker-контейнеров, веб-интерфейса и самой ОС нужно около 8—10 ГБ.
Вывод: 32 ГБ — минимально, 64 ГБ — комфортно.
Видеокарта (GPU)
Это самый дорогой компонент. Требования: минимум 16 ГБ VRAM, желательно 24 ГБ. Чем больше видеопамяти, тем более крупную модель вы сможете запустить и тем больше одновременных запросов обработать.
Мы рассмотрим три реальных варианта:
NVIDIA RTX 4060 Ti 16GB — современная игровая карта с 16 ГБ. Отлично подходит для моделей 7—13B в квантованном виде. Низкое энергопотребление (160 Вт), не требует мощного блока питания, доступна в продаже. Цена новой — от 45 000 до 55 000 рублей. Идеальна для начала.
NVIDIA RTX 4090 24GB — топовая карта с 24 ГБ. Тянет модели до 30B, очень быстрая. Но дорогая (от 180 000 до 250 000 рублей), энергопотребление до 450 Вт, требует мощный блок питания и хорошее охлаждение. Имеет смысл, если вы планируете использовать большие модели (30B+) или много одновременных пользователей.
NVIDIA Tesla P40 24GB (б/у) — серверная карта с 24 ГБ, специально для вычислений. Её преимущество — огромный объём VRAM за небольшие деньги (на вторичном рынке от 35 000 до 60 000 рублей). Но есть нюансы: нет видеовыхода (карта не выводит изображение), требует принудительного охлаждения (у неё пассивный радиатор, нужен мощный вентилятор или переходник), поддерживает только PCIe 3.0. Работает с моделями до 13—30B. Отличный бюджетный вариант, если вы готовы повозиться с охлаждением.
Также можно рассмотреть RTX 3090 24GB — бывшая флагманская игровая карта, сейчас на вторичке стоит 70—100 тысяч рублей. Хорошая альтернатива 4090, если бюджет ограничен, а хочется 24 ГБ.
Важно: все карты должны быть от NVIDIA, так как экосистема для инференса (CUDA, TensorRT) развита именно для них. AMD и Intel пока сильно отстают.
Накопители: NVMe SSD
Для быстрой загрузки моделей и работы системы нужен NVMe SSD объёмом минимум 1 ТБ. Скорость чтения — критична, потому что модель загружается в VRAM при старте. Возьмите SSD с интерфейсом PCIe 3.0 или 4.0. Хорошие варианты: Samsung 970/980 Pro, WD Black SN770/SN850. Цена 1 ТБ — от 7 000 до 12 000 рублей.
Документы компании (Excel, PDF, выгрузки) можно хранить на обычном HDD объёмом 2—4 ТБ, чтобы не занимать место на быстром накопителе. Но для векторной базы лучше тоже использовать SSD.
Блок питания
Сервер работает круглосуточно, поэтому блок питания должен быть качественным, с запасом по мощности. Рассчитываем: видеокарта 150—450 Вт + остальная система 150—200 Вт. Для RTX 4060 Ti хватит блока на 550—650 Вт, для RTX 4090 — на 850—1000 Вт. Берите блоки известных брендов (Seasonic, Corsair, be quiet!) с сертификатом 80 Plus Gold или Platinum. Это обеспечит стабильность и меньший нагрев.
Охлаждение
Для сервера, работающего 24/7, важно продумать вентиляцию. Корпус должен быть с хорошим потоком воздуха: минимум два вентилятора на вдув и один на выдув. Процессорный кулер — стандартный башенный (например, DeepCool AK400). Для видеокарты достаточно её собственной системы охлаждения, но если у вас Tesla P40, потребуется отдельный мощный вентилятор, направленный на радиатор, или переходник для установки активного кулера. В серверных корпусах часто используются высокооборотистые вентиляторы, но для офиса лучше выбрать тихие модели, чтобы не мешать сотрудникам.
ИБП (источник бесперебойного питания)
Отключение электричества может привести к потере данных и повреждению индексов. Поэтому обязателен ИБП с мощностью, достаточной для корректного завершения работы. Для системы с RTX 4060 Ti (потребление около 300 Вт) подойдёт ИБП на 600—800 ВА. Для RTX 4090 — на 1000—1500 ВА. ИБП должен поддерживать автономную работу хотя бы 5—10 минут, чтобы сервер успел сохраниться и выключиться. Многие ИБП (например, APC) имеют USB-подключение для автоматического безопасного завершения работы.
Конец ознакомительного фрагмента.
Текст предоставлен ООО «Литрес».
Прочитайте эту книгу целиком, купив полную легальную версию на Литрес.
Безопасно оплатить книгу можно банковской картой Visa, MasterCard, Maestro, со счета мобильного телефона, с платежного терминала, в салоне МТС или Связной, через PayPal, WebMoney, Яндекс.Деньги, QIWI Кошелек, бонусными картами или другим удобным Вам способом.




