Выделенный GPU-сервер

GPU-сервер с 48 ГБ VRAM для LLM и AI-проектов

Запускайте локальные модели, RAG-системы, AI-агентов и генеративные приложения на выделенной NVIDIA GeForce RTX 4090 с увеличенным до 48 ГБ объёмом видеопамяти.

Получите удалённый доступ к готовой вычислительной среде без покупки и обслуживания собственного оборудования. Ориентир температуры под согласованной нагрузкой — около 53 °C.

Тарифы от 1 000 ₽/час

48 ГБGPU: NVIDIA GeForce RTX 4090
24/7Доступ
3 000 ₽за сутки
GPU-сервер с NVIDIA GeForce RTX 4090
Доступ к серверу 24/7.

Конфигурация

Описание

Демо · RTX 4090 48 ГБ
# Пример подключения и базовых команд
user@client:~$ ssh gpu-user@SERVER_IP -p SSH_PORT

Welcome to Ubuntu 24.04 LTS (GNU/Linux 6.8.0-generic x86_64) * Documentation: https://help.ubuntu.com * Management: https://landscape.canonical.com * Support: https://ubuntu.com/pro Last login: Mon Jul 13 17:02:44 2026 from CLIENT_IP gpu-user@gpu-rtx4090:~$ nvidia-smi +-----------------------------------------------------------------------------+ | NVIDIA-SMI 555.42.02 Driver Version: 555.42.02 CUDA Version: 12.5 | |-----------------------------------------+----------------------+------------+ | GPU Name Persistence-M | Bus-Id Disp.A | Volatile | | Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util | |=========================================+======================+============| | 0 NVIDIA GeForce RTX 4090 Off | 00000000:01:00.0 Off | N/A | | 31% 53C P8 18W / 450W | 14MiB / 49152MiB | 0% | +-----------------------------------------+----------------------+------------+
# Запуск языковой модели Llama 3 в выделенной среде
gpu-user@gpu-rtx4090:~$ ollama run llama3:8b

pulling manifest pulling 87048f7661b6... 100% ▕████████████████████▏ 4.7 GB pulling 86025b16fb20... 100% ▕████████████████████▏ 1.7 KB success >>> привет, кто ты? Я — языковая модель Llama 3, запущенная на выделенном GPU-сервере с RTX 4090 (48 ГБ). Чем я могу помочь?
# Запуск Jupyter Notebook с поддержкой GPU CUDA
gpu-user@gpu-rtx4090:~$ docker run --gpus all -d -p 8888:8888 tensorflow/tensorflow:latest-gpu-jupyter

e23df858022b7d90d8102a0a2df33900aefc30f4090a1bc77ee782df4971c26b gpu-user@gpu-rtx4090:~$ docker ps CONTAINER ID IMAGE STATUS e23df858022b tensorflow/tensorflow:latest-gpu-jupyter Up 5 seconds (healthy)
# Тестирование CUDA в Python
gpu-user@gpu-rtx4090:~$ python3 -c "import torch; print('CUDA Available:', torch.cuda.is_available()); print('Device Name:', torch.cuda.get_device_name(0))"

CUDA Available: True Device Name: NVIDIA GeForce RTX 4090

Характеристики сервера

GPU:
NVIDIA GeForce RTX 4090, 48 ГБ, водяное охлаждение
Рабочая температура:
Ориентир около 53°C под согласованной нагрузкой
CPU:
AMD Ryzen 9 7900X, 12 ядер
RAM:
64 ГБ DDR5, 2 × 32 ГБ
SSD:
серверный SSD Seagate
Блок питания:
1200 Вт
Основной интернет-канал:
350 Мбит/с
Резервный интернет-канал:
30 Мбит/с
Резервное питание:
ИБП
IP:
белый IP-адрес на обоих каналах
Порты:
нужные порты прокидываются по запросу
Доступ:
24/7

Демонстрация показателей Ориентир

Пример данных интерфейса, а не телеметрия или результат тестирования.

Загрузка GPU
82%
Температура ядра
53.1°C
Использование VRAM
41.2 ГБ
Энергопотребление
312 Вт

Сценарии

Что можно запустить на сервере

01

LLM и поиск по документам

Разворачивайте локальные языковые модели, RAG-системы и сервисы ответов по внутренним документам.
Используйте Ollama, Open WebUI, llama.cpp, vLLM и собственные приложения на Python.

02

Генеративные пайплайны

Собирайте процессы для генерации изображений, обработки серий и создания визуального контента.
Используйте ComfyUI, Stable Diffusion, FLUX и AUTOMATIC1111.

03

ML-эксперименты и дообучение

Проверяйте ML-гипотезы, работайте с датасетами и запускайте эксперименты в PyTorch или TensorFlow.
Выполняйте дообучение моделей через LoRA и QLoRA.

04

Видеообработка и GPU-рендер

Используйте GPU для рендера, апскейла, обработки видео и других задач с продолжительной вычислительной нагрузкой.
Рабочий компьютер остаётся доступен для подготовки материалов.

05

API, агенты и прототипы

Размещайте тестовые API, AI-агентов, Telegram-ботов, демонстрационные стенды и прототипы продуктов.
Белый IP и проброс портов позволяют организовать согласованный удалённый доступ.

06

CUDA-разработка и тестирование

Компилируйте, тестируйте и профилируйте CUDA-приложения в выделенной среде.
Подготовка собственного рабочего компьютера для вычислений не требуется.

Ориентиры

Оценка производительности

Графики показывают ориентировочное сравнение сценариев. Фактическая скорость зависит от модели, настроек и программного окружения.

Inference LLM (Llama 3 8B, FP16)

Иллюстративная оценка скорости вывода Llama 3 8B. Результат зависит от конфигурации модели, контекста и параметров запуска.

Память GPU
0 ГБ

Объём видеопамяти одной GPU для моделей, контекста и рабочих данных

Охлаждение
0 °C

Ориентир температуры ядра под нагрузкой при водяном охлаждении

Линк (Интернет)
0 Мб/с

Основной интернет-канал; резервный канал — 30 Мбит/с

Доступ к серверу
0 ч/сутки

Удалённое подключение в течение согласованного периода аренды

Тарифы

Выберите срок работы

Форматы под разные задачи:

Почасовая аренда1 000 ₽/час

Для первичной проверки совместимости, короткого теста или небольшой задачи. Доступна Ubuntu Server 24.04 LTS.

Недельная аренда15 000 ₽/неделя

Для разработки, серии экспериментов и последовательной настройки проекта. ОС — по выбору.

Месячная аренда45 000 ₽/месяц

Для регулярной работы API, AI-агентов, внутренних сервисов и длительных вычислений.

Интерактивный калькулятор

Выберите формат и продолжительность аренды, чтобы рассчитать итоговую стоимость.

Срок аренды: 1 час
1 ч 6 ч 12 ч 18 ч 24 ч

Конфигурация:

  • ● RTX 4090 (48 ГБ VRAM)
  • ● 12 ядер AMD Ryzen 9 7900X
  • ● 64 ГБ DDR5 / SSD Seagate
Итоговая стоимость 1 000 ₽ Скидка 0%

Поместится ли модель?

Оцените, поместится ли LLM в 48 ГБ VRAM с учётом размера и квантования. Итог зависит от контекста и настроек.

Размер модели (параметры):
Квантование (сжатие):
Загрузка видеопамяти: 16.0 / 48 ГБ
Ориентировочно модель помещается в VRAM.
Остаётся 32.0 ГБ под контекст (KV cache) и батчи (~32k токенов).

Поддерживаемые сценарии

— запускать LLM, RAG, ML, AI- и CUDA-задачи;
— генерировать изображения и видео;
— обучать и тестировать модели;
— разворачивать веб-интерфейсы и API;
— использовать SSH, RDP или веб-доступ по договорённости;
— запрашивать проброс нужных портов;
— работать 24/7 в рамках согласованной аренды;
— заранее согласовывать необходимое ПО.

Ограничения использования

— майнинг криптовалюты;
— спам, фишинг, брутфорс и сканирование чужих сетей;
— DDoS, ботнеты и нагрузочные тесты сторонних ресурсов;
— хранение или распространение запрещённого контента;
— действия, нарушающие законы РФ или правила провайдеров;
— стресс-тесты оборудования без согласования;
— размещение и запуск вредоносного ПО.

Возможности

Инфраструктура и доступ

Доступ к серверу — 24/7.
Основной интернет-канал — 350 Мбит/с, резервный — 30 Мбит/с.
ИБП обеспечивает резервное питание.
Белый IP-адрес доступен на обоих каналах, нужные порты прокидываются по запросу.

Можно согласовать базовую подготовку окружения: Ubuntu, Docker, Python, CUDA, Jupyter, ComfyUI, Ollama, Open WebUI, llama.cpp, vLLM и другие необходимые инструменты.

Основной канал350 Мбит/с
Доступ24/7 · белый IP
GPU-серверRTX 409048 ГБ · онлайн
Резервный канал30 Мбит/с
ПитаниеИБП

Целевая аудитория

Для кого подходит сервис

— разработчикам AI-сервисов и агентов; — ML-инженерам и специалистам по данным; — командам, создающим генеративную графику; — специалистам по видео и GPU-рендерингу; — стартапам, проверяющим техническую гипотезу; — компаниям, которым нужен временный GPU-ресурс без покупки оборудования; — разработчикам, которым требуется отдельная CUDA-среда

FAQ

Часто задаваемые вопросы

На сервере используется RTX 4090 с увеличенным до 48 ГБ объёмом видеопамяти. Дополнительная VRAM позволяет размещать более требовательные конфигурации моделей, увеличивать контекст и оставлять больше памяти для рабочих данных. Совместимость зависит от модели и квантования.

Ориентир температуры под согласованной нагрузкой — около 53 °C. Фактический температурный режим зависит от задачи и продолжительности работы.

Для почасовой и суточной аренды используется Ubuntu Server 24.04 LTS. При аренде от одной недели вариант операционной системы можно согласовать до начала работы.

Формат доступа согласовывается под задачу: SSH, RDP или веб-интерфейс. Белый IP и проброс необходимых портов позволяют подключаться к Jupyter, ComfyUI, Open WebUI и другим согласованным сервисам.

Нет. Майнинг криптовалюты, фишинг, спам, брутфорс, вредоносное ПО и другие противозаконные действия запрещены условиями использования сервера.

Базовую подготовку окружения можно согласовать заранее. Укажите нужные версии Docker, CUDA, PyTorch, Ollama, ComfyUI или другого ПО в форме бронирования.

Нужные порты прокидываются по запросу. Укажите сервисы и номера портов в форме бронирования, чтобы согласовать сетевой доступ до начала аренды.

Бронирование

Пришлите название модели, программы или репозитория. Проверим требования и согласуем подходящий формат доступа.