Локальный LLM на своём сервере

Разворачиваем языковую модель на вашем железе: в изолированном сегменте, с закрытым портом и журналированием. Данные не уходят в чужое облако. У нас такой контур работает в продуктиве — и, кстати, без видеокарты.

Зачем локально

Модель у себя — единственный способ не отдавать данные наружу

Публичные нейросети удобны, пока речь не заходит о клиентских базах, договорах, кадровых или медицинских сведениях. Как только такой текст уходит на чужой сервер, вы теряете контроль над тем, где он лежит и кто к нему имеет доступ. Локальный LLM решает это на уровне физики: запрос не покидает ваш периметр.

Почему контур должен быть закрытым. Отправка персональных данных в зарубежное облако — это трансграничная передача и нарушение требования 152-ФЗ хранить данные граждан России в стране. Российское облако — условно (данные в РФ, но у третьего лица). Свой контур снимает вопрос. Но self-host не равен «данные в контуре»: модель может стоять у вас, а данные утекать через мессенджер или интеграцию — мы показываем и закрываем эти каналы, а не прикрываемся словом «локально». Подробнее — на странице внедрения ИИ.
Что входит

Не «поставить Ollama», а построить закрытый контур

Чем доказываем

Такой контур работает у нас в продуктиве

Модель на своём железе, без видеокарты

Отдельная виртуальная машина — 8 vCPU, 16 ГБ RAM, — Ollama и qwen2.5:7b в квантизации Q4. Видеокарты нет: инференс идёт на процессоре. Данные не покидают сервер.

Порт закрыт межсетевым экраном

API Ollama без аутентификации доступен только с адреса потребителя — правило nftables пропускает порт модели с одного адреса, остальное отбрасывает. Раскатано ролью и проверено на живой машине, а не «вроде закрыто».

Переключаемые провайдеры

Наш продуктивный бот работает и на своей модели, и на российском облаке, и на зарубежном API — переключением конфига. Клиент может начать на облаке и переехать в свой контур, когда вырастет.

Повторяемое развёртывание

Всё описано кодом: создание ВМ, установка движка, загрузка модели, правило firewall — Ansible-роли, секреты в зашифрованном хранилище. Не «настроил руками и забыл».

Честно про производительность. Инференс на процессоре подходит, когда потребитель один, ответ ждёт бот в фоне, а модель небольшая. Как только пользователей несколько и они приходят одновременно, ответ нужен в интерактивном темпе или модель крупнее 7B — нужна видеокарта. Мы сначала описываем профиль нагрузки, потом считаем железо, — и говорим об этом до подписания.
Смежное

Читать дальше

Обсудим ваш закрытый контур

Начнём с аудита готовности: какие данные нельзя выносить наружу, какая модель подойдёт и потянет ли её ваше железо.

Или позвоните: 8 (804) 333-33-35 — бесплатно по России