Локальная LLM на серверах компании: какое железо и модель нужны для старта
Локальная языковая модель нужна, когда данные нельзя отправлять во внешний сервис или когда запросов так много, что облачный API обходится дороже собственного сервера. Разбираем, из чего складываются требования к железу и как не переплатить на старте.
Сначала задача, потом модель
Требования к серверу определяет не «лучшая модель на рынке», а задача: ответы по документам, извлечение данных из договоров, классификация обращений, подготовка черновиков. Для многих корпоративных сценариев хватает моделей среднего размера, если к ним подключён поиск по документам. Большая модель нужна там, где требуется сложное рассуждение по длинному контексту.
Практичный подход — сравнить две-три открытые модели разного размера на одной контрольной выборке из ваших реальных задач и выбрать самую компактную, которая даёт приемлемое качество.
От чего зависят требования к видеокартам
Главный ресурс для LLM — видеопамять. Модель должна целиком помещаться в память GPU вместе с запасом под контекст и одновременные запросы. Объём памяти зависит от трёх вещей:
- размера модели — числа параметров;
- квантизации — точности хранения весов: 4- и 8-битные версии занимают в разы меньше памяти, чем полная точность, при небольшой потере качества;
- длины контекста и числа одновременных пользователей — каждый активный запрос держит в памяти свой контекст.
Ориентиры по видеопамяти
Модель на 7–8 миллиардов параметров в 4-битной квантизации ориентировочно запускается на одной видеокарте с 8–12 ГБ памяти. Моделям на 30–70 миллиардов параметров нужны десятки гигабайт видеопамяти — как правило, одна или несколько серверных карт.
Это оценки для планирования, а не спецификация: реальный расход памяти зависит от конкретной модели, длины контекста и сервера инференса. Точные цифры стоит проверять на тестовом стенде под вашу нагрузку.
Как оценить нагрузку
Для оценки нужны три числа: сколько сотрудников будут пользоваться системой, сколько запросов в час приходится на пик и какой длины документы попадают в контекст. Сервер для десятка пользователей с короткими вопросами и сервер для обработки тысяч договоров в сутки — это разные конфигурации и разный бюджет.
Для одновременной работы многих пользователей применяют специализированные серверы инференса, например vLLM: они обрабатывают несколько запросов параллельно и заметно лучше загружают видеокарту, чем простой запуск модели. Для прототипа и внутренних экспериментов подойдёт и более простой инструмент вроде Ollama.
Что входит в эксплуатацию
Запустить модель — половина работы. Эти задачи стоит заложить в план сразу, иначе пилот на одном сервере так и останется пилотом. В промышленной эксплуатации нужны:
- разграничение доступа и журнал запросов;
- мониторинг нагрузки, задержек и ошибок;
- процесс обновления модели и проверки качества после обновления;
- резервирование, если от системы зависят рабочие процессы;
- интеграции с источниками данных и рабочими системами.
Локально или в облаке
Облачный API удобен для быстрого старта: не нужно покупать оборудование, доступны самые сильные модели. Локальное размещение выигрывает, когда в запросах есть персональные данные или коммерческая тайна, когда важно не зависеть от внешнего сервиса и когда объём запросов стабильно высокий.
Возможен и гибридный вариант: чувствительные данные обрабатывает локальная модель, а задачи без таких данных уходят в облако.
С чего начать
Начните с тестового стенда на одном сервере: подключите один сценарий, прогоните контрольную выборку и замерьте качество, скорость и загрузку оборудования. По результатам станет понятно, какая конфигурация нужна для рабочей нагрузки, — и вы не купите лишнее железо до того, как проверите подход на своих данных.
Обсудим вашу задачу
Расскажите о процессе, который хотите улучшить. Ответим и предложим первый проверяемый шаг.
Оставить заявку ↗ +7 (929) 783-98-88