Разворачиваем языковую модель на вашем железе: в изолированном сегменте, с закрытым портом и журналированием. Данные не уходят в чужое облако. У нас такой контур работает в продуктиве — и, кстати, без видеокарты.
Публичные нейросети удобны, пока речь не заходит о клиентских базах, договорах, кадровых или медицинских сведениях. Как только такой текст уходит на чужой сервер, вы теряете контроль над тем, где он лежит и кто к нему имеет доступ. Локальный LLM решает это на уровне физики: запрос не покидает ваш периметр.
Отдельная виртуальная машина — 8 vCPU, 16 ГБ RAM, — Ollama и qwen2.5:7b в квантизации Q4. Видеокарты нет: инференс идёт на процессоре. Данные не покидают сервер.
API Ollama без аутентификации доступен только с адреса потребителя — правило nftables пропускает порт модели с одного адреса, остальное отбрасывает. Раскатано ролью и проверено на живой машине, а не «вроде закрыто».
Наш продуктивный бот работает и на своей модели, и на российском облаке, и на зарубежном API — переключением конфига. Клиент может начать на облаке и переехать в свой контур, когда вырастет.
Всё описано кодом: создание ВМ, установка движка, загрузка модели, правило firewall — Ansible-роли, секреты в зашифрованном хранилище. Не «настроил руками и забыл».
Начнём с аудита готовности: какие данные нельзя выносить наружу, какая модель подойдёт и потянет ли её ваше железо.
Или позвоните: 8 (804) 333-33-35 — бесплатно по России