Первый раздел объясняет суть без вступления и рекламных обещаний.
Рабочие настройки сохраняют до изменения, а проверку проводят на копии.
Запишите исходное состояние, действие и итог, чтобы найти причину ошибки.
На VPS работают приложение, очередь и база; GPU не нужен.
Локальной модели нужна RAM или VRAM под веса и контекст.
Требует больше памяти, чем запуск готовой модели.
Диск, сеть и остановленные ресурсы считают вместе с GPU.
Источники: Ollama GPU support, Ollama FAQ.
GPU-сервер для нейросети нужен, когда модель должна обучаться или отвечать локально, а процессор не дает приемлемой скорости. Выбирайте не число vCPU, а конкретный ускоритель, объем VRAM, совместимость драйверов и почасовую стоимость всей конфигурации. Для приложения, которое вызывает внешнее API, видеокарта на вашем VPS не нужна.
Почему обычного VPS недостаточно
CPU-VPS запускает Python, базу, очередь и API, но матричные операции большой модели выполняет медленно. Некоторые небольшие квантованные модели работают в RAM, однако задержка и пропускная способность могут не подойти даже одному пользователю. Проверять нужно на своей модели и контексте.
Как выбрать GPU и объем VRAM
Начните с официальной матрицы совместимости фреймворка. Ollama поддерживает NVIDIA с определенной compute capability и версией драйвера, а список AMD зависит от ROCm. Название семейства без точной модели ускорителя ничего не гарантирует.
Модель, KV-кеш и рабочие буферы должны помещаться в VRAM. Параллельные запросы увеличивают память. Оставьте запас, иначе сервер начнет переносить данные в системную RAM или ставить запросы в очередь.
Обучение и inference требуют разного
Inference читает готовые веса и отвечает на запросы. Обучение хранит дополнительные состояния оптимизатора и градиенты, поэтому требует заметно больше памяти и времени. Для редкого обучения выгоднее почасовое облако с выключением ресурса после задачи. Постоянный сервис считают по месяцу и пиковому числу запросов.
Из чего складывается цена
К GPU добавляются vCPU, RAM, системный и рабочий диск, snapshot, публичный IP и исходящий трафик. Остановленная виртуальная машина может продолжать оплачивать диск и адрес. Запишите правила тарификации до запуска эксперимента и поставьте бюджетное уведомление.
Какие облака сравнить
| Провайдер | Что проверять | Модель оплаты | Подходящий сценарий |
|---|---|---|---|
| Тип GPU, VRAM и квоту | Почасово, ресурсы отдельно | Локальный inference и ML | |
| GPU, зону и стоимость диска | Почасово, сеть отдельно | Обучение и облачные данные | |
| Доступный ускоритель и образ | Почасово, ресурсы отдельно | Российская облачная среда | |
| Регион, GPU и исходящий трафик | Почасово с месячным расчетом | Международный inference |
Наличие GPU и квота меняются. До заказа проверьте точную модель ускорителя, VRAM, регион, диск и исходящий трафик.
Официальные источники: Cloud.ru, Yandex Cloud, VK Cloud, Vultr. Проверено 4 сентября 2026 года.
Сопоставьте Cloud.ru, Yandex Cloud, VK Cloud и Vultr по доступным моделям GPU в нужном регионе. Наличие продукта в документации не означает свободную квоту. HostVDS в этот список не входит: его публичная линейка описывает CPU-инстансы без GPU.
Безопасный тест конфигурации
Создайте инстанс на час, установите драйвер из документации провайдера и запустите фиксированный набор запросов. Запишите скорость генерации, p95 задержки, пиковую VRAM и стоимость часа вместе с диском. После теста удалите ненужные snapshots и проверьте, что тарифицируемые ресурсы действительно остановлены. Вернитесь к общему руководству по хостингу для нейросети, если модель можно оставить у внешнего API.

