Старшая Qwen: лучший на сегодня открытый универсал по совокупности задач и один из немногих, кто уверенно держит русский на уровне закрытых API. Требует карту от 80 ГБ и терпения к скорости.
| MMLU | 86,1 | |
|---|---|---|
| GSM8K | 95,8 | |
| HumanEval | 86,6 |
Какая видеокарта нужна для Qwen2.5 72B?
Минимальная конфигурация — 1x A100: этого хватает примерно на 22 токенов в секунду. Для большего числа параллельных запросов и запаса по скорости берите 1x H100.
Сколько стоит аренда Qwen2.5 72B?
Час работы Qwen2.5 72B стоит от 121,08 ₽ до 274,29 ₽ в зависимости от выбранной конфигурации GPU. Оплата почасовая: вы платите за время работы сервера, а не за количество токенов.
Как обращаться к Qwen2.5 72B из своего кода?
После запуска вы получаете OpenAI-совместимый эндпоинт: подставьте выданный base_url в любой клиент OpenAI и указывайте модель qwen2.5:72b. Менять код, написанный под OpenAI API, не нужно.
Данные остаются приватными?
Да. Qwen2.5 72B работает на выделенном GPU-сервере в закрытом контуре: запросы и ответы не уходят к вендору модели и не используются для обучения.
Какой контекст и лицензия у Qwen2.5 72B?
Qwen2.5 72B держит 16K токенов контекста за один запрос и распространяется под лицензией Qwen License — модель можно использовать в коммерческих проектах на своих условиях хостинга.