Аренда GPU для запуска и дообучения LLM
Языковые модели с открытыми весами сняли зависимость от внешних API, но переложили на разработчика вопрос железа. Llama, Qwen, DeepSeek и Mistral требуют видеопамяти, объём которой напрямую диктуется размером модели и выбранной точностью — и требуют её только тогда, когда модель реально работает.
QuData даёт доступ к картам нужного класса на время задачи: H200 и H100 для крупных моделей в полной точности, A100 и L40S для квантизованных версий и дообучения. Ollama и vLLM разворачиваются из готового образа, root-доступ по SSH позволяет собрать любое собственное окружение. Данные шифруются на время сессии и удаляются после её завершения — сценарий, ради которого локальный запуск чаще всего и выбирают.
Готовые образы
Развернуть LLM с нуля — это подобрать версии драйверов, собрать движок инференса и разобраться с форматами весов. Готовые образы стартуют примерно за 30 секунд и сразу отдают рабочий эндпоинт.
Ollama
Самый быстрый способ поднять модель. Загрузка весов одной командой, совместимый API, удобно для прототипов и внутренних инструментов.vLLM
Движок для продакшн-инференса с высокой пропускной способностью. Держит десятки параллельных запросов на одной карте.text-generation-webui
Веб-интерфейс для ручных экспериментов с промптами, параметрами генерации и сравнением моделей между собой.Окружение для дообучения
Собранный стек для LoRA и QLoRA с библиотеками работы с датасетами и квантизацией.Кому подходит
Разработчикам AI-продуктов
Протестировать несколько моделей на своей задаче и выбрать оптимальную по соотношению качества и стоимости инференса, не оплачивая подписку на каждый вариант.Компаниям с требованием держать данные внутри контура
Запустить модель на арендованной карте, обработать чувствительные данные и завершить сессию, не передавая ничего во внешние сервисы.Интеграторам
Развернуть демо-стенд под конкретного заказчика на время пилота и свернуть его после подписания или отказа.Исследователям
Дообучить открытую модель на узкой доменной выборке и сравнить с базовой версией на своих метриках.Как подобрать GPU под языковую модель
Требования LLM к видеопамяти считаются почти арифметически, и это главное отличие от других задач: вы можете заранее сказать, поместится модель на карту или нет.
Сколько видеопамяти нужно для LLM
Базовая оценка для инференса: умножьте число параметров на число байт, приходящихся на параметр. В fp16 это два байта, значит модель на 7 миллиардов параметров занимает около 14 ГБ, на 13 миллиардов — около 26 ГБ, на 70 миллиардов — свыше 140 ГБ. К этому добавьте память под KV-кеш, который растёт с длиной контекста и числом одновременных запросов, — закладывайте запас в 15–25%.
Квантизация меняет расклад радикально. В 8 бит расход падает вдвое, в 4 бита — вчетверо. Модель на 70 миллиардов параметров в 4-битной квантизации помещается в 40–48 ГБ, то есть на одну карту класса L40S или A100. Качество при этом снижается умеренно, и для большинства прикладных задач разница незаметна.
Инференс и дообучение требуют разного
Дообучение всегда дороже по памяти, чем запуск. Полное дообучение требует места под градиенты и состояния оптимизатора — фактически в несколько раз больше, чем сама модель. Именно поэтому в практике доминируют LoRA и QLoRA: они обучают небольшой набор дополнительных весов поверх замороженной базовой модели.
LoRA для модели среднего размера укладывается в одну карту на 48–80 ГБ. QLoRA, где базовая модель хранится в 4 битах, снижает планку ещё сильнее. Полное дообучение крупных моделей — это уже multi-GPU конфигурация и отдельный разговор о бюджете.
Пропускная способность против латентности
Для чат-сценария важна скорость отклика на один запрос, для пакетной обработки — суммарное число обработанных токенов. Это разные оптимизации. Если вы прогоняете через модель массив документов, движок вроде vLLM с батчингом даст кратно больше отдачи с той же карты, чем наивный последовательный запуск.
Оценивайте стоимость не в часах аренды, а в стоимости обработки тысячи токенов — тогда сравнение с внешним API становится корректным.
Когда локальный запуск оправдан
Три ситуации, где своя модель на арендованной карте выигрывает у внешнего API: данные нельзя передавать наружу; объём обработки настолько велик, что поштучная оплата запросов перестаёт сходиться; нужна модель, дообученная под узкую предметную область. Во всех остальных случаях честно сравните итоговую стоимость — иногда API оказывается дешевле.
Часто задаваемые вопросы
Какая видеокарта нужна для запуска LLM?
Ориентируйтесь на размер модели в видеопамяти: модели до 13B параметров запускаются на одной карте с 24 ГБ, для 70B в полной точности нужны H100 или H200, либо multi-GPU конфигурация.
Сколько видеопамяти нужно для Llama 70B?
В квантизации 4 бит модель помещается примерно в 40–48 ГБ, в 8 бит — около 70–80 ГБ, в fp16 требуется свыше 140 ГБ, то есть H200 или несколько карт.
Есть ли готовые образы с Ollama и vLLM?
Да, оба доступны в списке готовых решений и разворачиваются примерно за 30 секунд без ручной установки зависимостей.
Можно ли дообучить модель на своих данных?
Да. Для LoRA и QLoRA достаточно одной карты с 48–80 ГБ, для полного дообучения крупных моделей потребуется multi-GPU конфигурация.
Останутся ли мои данные конфиденциальными?
Данные шифруются на время сессии и удаляются после её завершения. Это основной сценарий для компаний, которым нельзя передавать данные во внешние API.