LLM и поиск по документам
Разворачивайте локальные языковые модели, RAG-системы и сервисы ответов по внутренним документам.
Используйте Ollama, Open WebUI, llama.cpp, vLLM и собственные приложения на Python.
Выделенный GPU-сервер
Запускайте локальные модели, RAG-системы, AI-агентов и генеративные приложения на выделенной NVIDIA GeForce RTX 4090 с увеличенным до 48 ГБ объёмом видеопамяти.
Получите удалённый доступ к готовой вычислительной среде без покупки и обслуживания собственного оборудования. Ориентир температуры под согласованной нагрузкой — около 53 °C.
Тарифы от 1 000 ₽/час
Конфигурация
# Пример подключения и базовых команд
user@client:~$ ssh gpu-user@SERVER_IP -p SSH_PORT
Welcome to Ubuntu 24.04 LTS (GNU/Linux 6.8.0-generic x86_64)
* Documentation: https://help.ubuntu.com
* Management: https://landscape.canonical.com
* Support: https://ubuntu.com/pro
Last login: Mon Jul 13 17:02:44 2026 from CLIENT_IP
gpu-user@gpu-rtx4090:~$ nvidia-smi
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 555.42.02 Driver Version: 555.42.02 CUDA Version: 12.5 |
|-----------------------------------------+----------------------+------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util |
|=========================================+======================+============|
| 0 NVIDIA GeForce RTX 4090 Off | 00000000:01:00.0 Off | N/A |
| 31% 53C P8 18W / 450W | 14MiB / 49152MiB | 0% |
+-----------------------------------------+----------------------+------------+
# Запуск языковой модели Llama 3 в выделенной среде
gpu-user@gpu-rtx4090:~$ ollama run llama3:8b
pulling manifest
pulling 87048f7661b6... 100% ▕████████████████████▏ 4.7 GB
pulling 86025b16fb20... 100% ▕████████████████████▏ 1.7 KB
success
>>> привет, кто ты?
Я — языковая модель Llama 3, запущенная на выделенном GPU-сервере с RTX 4090 (48 ГБ). Чем я могу помочь?
# Запуск Jupyter Notebook с поддержкой GPU CUDA
gpu-user@gpu-rtx4090:~$ docker run --gpus all -d -p 8888:8888 tensorflow/tensorflow:latest-gpu-jupyter
e23df858022b7d90d8102a0a2df33900aefc30f4090a1bc77ee782df4971c26b
gpu-user@gpu-rtx4090:~$ docker ps
CONTAINER ID IMAGE STATUS
e23df858022b tensorflow/tensorflow:latest-gpu-jupyter Up 5 seconds (healthy)
# Тестирование CUDA в Python
gpu-user@gpu-rtx4090:~$ python3 -c "import torch; print('CUDA Available:', torch.cuda.is_available()); print('Device Name:', torch.cuda.get_device_name(0))"
CUDA Available: True
Device Name: NVIDIA GeForce RTX 4090
Сценарии
Разворачивайте локальные языковые модели, RAG-системы и сервисы ответов по внутренним документам.
Используйте Ollama, Open WebUI, llama.cpp, vLLM и собственные приложения на Python.
Собирайте процессы для генерации изображений, обработки серий и создания визуального контента.
Используйте ComfyUI, Stable Diffusion, FLUX и AUTOMATIC1111.
Проверяйте ML-гипотезы, работайте с датасетами и запускайте эксперименты в PyTorch или TensorFlow.
Выполняйте дообучение моделей через LoRA и QLoRA.
Используйте GPU для рендера, апскейла, обработки видео и других задач с продолжительной вычислительной
нагрузкой.
Рабочий компьютер остаётся доступен для подготовки материалов.
Размещайте тестовые API, AI-агентов, Telegram-ботов, демонстрационные стенды и прототипы продуктов.
Белый IP и проброс портов позволяют организовать согласованный удалённый доступ.
Компилируйте, тестируйте и профилируйте CUDA-приложения в выделенной среде.
Подготовка собственного
рабочего компьютера для вычислений не требуется.
Ориентиры
Графики показывают ориентировочное сравнение сценариев. Фактическая скорость зависит от модели, настроек и программного окружения.
Иллюстративная оценка скорости вывода Llama 3 8B. Результат зависит от конфигурации модели, контекста и параметров запуска.
Объём видеопамяти одной GPU для моделей, контекста и рабочих данных
Ориентир температуры ядра под нагрузкой при водяном охлаждении
Основной интернет-канал; резервный канал — 30 Мбит/с
Удалённое подключение в течение согласованного периода аренды
Тарифы
Форматы под разные задачи:
Для первичной проверки совместимости, короткого теста или небольшой задачи. Доступна Ubuntu Server 24.04 LTS.
Для полноценного тестирования модели, пайплайна или подготовленного окружения. Доступна Ubuntu Server 24.04 LTS.
Для разработки, серии экспериментов и последовательной настройки проекта. ОС — по выбору.
Для регулярной работы API, AI-агентов, внутренних сервисов и длительных вычислений.
Выберите формат и продолжительность аренды, чтобы рассчитать итоговую стоимость.
Оцените, поместится ли LLM в 48 ГБ VRAM с учётом размера и квантования. Итог зависит от контекста и настроек.
— запускать LLM, RAG, ML, AI- и CUDA-задачи;
— генерировать изображения и видео;
— обучать
и тестировать модели;
— разворачивать веб-интерфейсы и API;
— использовать SSH, RDP или веб-доступ по
договорённости;
— запрашивать проброс нужных портов;
— работать 24/7 в рамках согласованной аренды;
—
заранее согласовывать необходимое ПО.
— майнинг криптовалюты;
— спам, фишинг, брутфорс и сканирование чужих сетей;
— DDoS, ботнеты и
нагрузочные тесты сторонних ресурсов;
— хранение или распространение запрещённого контента;
— действия,
нарушающие законы РФ или правила провайдеров;
— стресс-тесты оборудования без согласования;
—
размещение и запуск вредоносного ПО.
Возможности
Доступ к серверу — 24/7.
Основной интернет-канал — 350 Мбит/с, резервный — 30 Мбит/с.
ИБП
обеспечивает резервное питание.
Белый IP-адрес доступен на обоих каналах, нужные порты прокидываются
по запросу.
Можно согласовать базовую подготовку окружения: Ubuntu, Docker, Python, CUDA, Jupyter, ComfyUI, Ollama, Open WebUI, llama.cpp, vLLM и другие необходимые инструменты.
Целевая аудитория
FAQ
На сервере используется RTX 4090 с увеличенным до 48 ГБ объёмом видеопамяти. Дополнительная VRAM позволяет размещать более требовательные конфигурации моделей, увеличивать контекст и оставлять больше памяти для рабочих данных. Совместимость зависит от модели и квантования.
Ориентир температуры под согласованной нагрузкой — около 53 °C. Фактический температурный режим зависит от задачи и продолжительности работы.
Для почасовой и суточной аренды используется Ubuntu Server 24.04 LTS. При аренде от одной недели вариант операционной системы можно согласовать до начала работы.
Формат доступа согласовывается под задачу: SSH, RDP или веб-интерфейс. Белый IP и проброс необходимых портов позволяют подключаться к Jupyter, ComfyUI, Open WebUI и другим согласованным сервисам.
Нет. Майнинг криптовалюты, фишинг, спам, брутфорс, вредоносное ПО и другие противозаконные действия запрещены условиями использования сервера.
Базовую подготовку окружения можно согласовать заранее. Укажите нужные версии Docker, CUDA, PyTorch, Ollama, ComfyUI или другого ПО в форме бронирования.
Нужные порты прокидываются по запросу. Укажите сервисы и номера портов в форме бронирования, чтобы согласовать сетевой доступ до начала аренды.
Бронирование