Решения

Аренда GPU для запуска и дообучения LLM

Языковые модели с открытыми весами сняли зависимость от внешних API, но переложили на разработчика вопрос железа. Llama, Qwen, DeepSeek и Mistral требуют видеопамяти, объём которой напрямую диктуется размером модели и выбранной точностью — и требуют её только тогда, когда модель реально работает.

QuData даёт доступ к картам нужного класса на время задачи: H200 и H100 для крупных моделей в полной точности, A100 и L40S для квантизованных версий и дообучения. Ollama и vLLM разворачиваются из готового образа, root-доступ по SSH позволяет собрать любое собственное окружение. Данные шифруются на время сессии и удаляются после её завершения — сценарий, ради которого локальный запуск чаще всего и выбирают.

Подходящие видеокарты

Готовые образы

Развернуть LLM с нуля — это подобрать версии драйверов, собрать движок инференса и разобраться с форматами весов. Готовые образы стартуют примерно за 30 секунд и сразу отдают рабочий эндпоинт.

Ollama

Самый быстрый способ поднять модель. Загрузка весов одной командой, совместимый API, удобно для прототипов и внутренних инструментов.

vLLM

Движок для продакшн-инференса с высокой пропускной способностью. Держит десятки параллельных запросов на одной карте.

text-generation-webui

Веб-интерфейс для ручных экспериментов с промптами, параметрами генерации и сравнением моделей между собой.

Окружение для дообучения

Собранный стек для LoRA и QLoRA с библиотеками работы с датасетами и квантизацией.

Кому подходит

Разработчикам AI-продуктов

Протестировать несколько моделей на своей задаче и выбрать оптимальную по соотношению качества и стоимости инференса, не оплачивая подписку на каждый вариант.

Компаниям с требованием держать данные внутри контура

Запустить модель на арендованной карте, обработать чувствительные данные и завершить сессию, не передавая ничего во внешние сервисы.

Интеграторам

Развернуть демо-стенд под конкретного заказчика на время пилота и свернуть его после подписания или отказа.

Исследователям

Дообучить открытую модель на узкой доменной выборке и сравнить с базовой версией на своих метриках.

Как подобрать GPU под языковую модель

Требования LLM к видеопамяти считаются почти арифметически, и это главное отличие от других задач: вы можете заранее сказать, поместится модель на карту или нет.

Сколько видеопамяти нужно для LLM

Базовая оценка для инференса: умножьте число параметров на число байт, приходящихся на параметр. В fp16 это два байта, значит модель на 7 миллиардов параметров занимает около 14 ГБ, на 13 миллиардов — около 26 ГБ, на 70 миллиардов — свыше 140 ГБ. К этому добавьте память под KV-кеш, который растёт с длиной контекста и числом одновременных запросов, — закладывайте запас в 15–25%.

Квантизация меняет расклад радикально. В 8 бит расход падает вдвое, в 4 бита — вчетверо. Модель на 70 миллиардов параметров в 4-битной квантизации помещается в 40–48 ГБ, то есть на одну карту класса L40S или A100. Качество при этом снижается умеренно, и для большинства прикладных задач разница незаметна.

Инференс и дообучение требуют разного

Дообучение всегда дороже по памяти, чем запуск. Полное дообучение требует места под градиенты и состояния оптимизатора — фактически в несколько раз больше, чем сама модель. Именно поэтому в практике доминируют LoRA и QLoRA: они обучают небольшой набор дополнительных весов поверх замороженной базовой модели.

LoRA для модели среднего размера укладывается в одну карту на 48–80 ГБ. QLoRA, где базовая модель хранится в 4 битах, снижает планку ещё сильнее. Полное дообучение крупных моделей — это уже multi-GPU конфигурация и отдельный разговор о бюджете.

Пропускная способность против латентности

Для чат-сценария важна скорость отклика на один запрос, для пакетной обработки — суммарное число обработанных токенов. Это разные оптимизации. Если вы прогоняете через модель массив документов, движок вроде vLLM с батчингом даст кратно больше отдачи с той же карты, чем наивный последовательный запуск.

Оценивайте стоимость не в часах аренды, а в стоимости обработки тысячи токенов — тогда сравнение с внешним API становится корректным.

Когда локальный запуск оправдан

Три ситуации, где своя модель на арендованной карте выигрывает у внешнего API: данные нельзя передавать наружу; объём обработки настолько велик, что поштучная оплата запросов перестаёт сходиться; нужна модель, дообученная под узкую предметную область. Во всех остальных случаях честно сравните итоговую стоимость — иногда API оказывается дешевле.

Часто задаваемые вопросы

Какая видеокарта нужна для запуска LLM?

Ориентируйтесь на размер модели в видеопамяти: модели до 13B параметров запускаются на одной карте с 24 ГБ, для 70B в полной точности нужны H100 или H200, либо multi-GPU конфигурация.

Сколько видеопамяти нужно для Llama 70B?

В квантизации 4 бит модель помещается примерно в 40–48 ГБ, в 8 бит — около 70–80 ГБ, в fp16 требуется свыше 140 ГБ, то есть H200 или несколько карт.

Есть ли готовые образы с Ollama и vLLM?

Да, оба доступны в списке готовых решений и разворачиваются примерно за 30 секунд без ручной установки зависимостей.

Можно ли дообучить модель на своих данных?

Да. Для LoRA и QLoRA достаточно одной карты с 48–80 ГБ, для полного дообучения крупных моделей потребуется multi-GPU конфигурация.

Останутся ли мои данные конфиденциальными?

Данные шифруются на время сессии и удаляются после её завершения. Это основной сценарий для компаний, которым нельзя передавать данные во внешние API.