Специальное предложение для новых клиентов: Получите скидку до 15% на первый заказ с промокодом NEW25!

Аренда NVIDIA DGX Spark

AI-суперкомпьютер с 128 ГБ unified memory на узел. Большие модели помещаются в память целиком — без квантования и без разбиения по картам. Конфигурации из 1, 2 и 4 узлов в дата-центрах М-Клауд: три площадки в Санкт-Петербурге и одна в Москве.

Зачем это нужно

Память — главный потолок

Модель не помещается

Веса модели на 70B в FP16 не влезают в 32 ГБ потребительской карты и с трудом — в 80 ГБ ускорителя. Приходится квантовать, теряя качество, или разносить модель по нескольким картам.

Что мешает
Квантование ухудшает ответы
Разбиение по картам усложняет запуск
Обмен между картами съедает время
Обсудить задачу

Аренда по часам не решает

Почасовая аренда ускорителей выглядит дешевле, пока эксперимент короткий. На длинной дообучающей сессии счёт растёт непредсказуемо, а данные каждый раз едут в чужой контур.

Что мешает
Счёт зависит от длительности
Данные покидают ваш контур
Нет гарантии доступности узла
Обсудить задачу

Своё железо — это надолго

Закупка узла — это срок поставки, место в стойке, питание, охлаждение и обслуживание. Между решением и первым запуском проходят месяцы.

Что мешает
Долгий цикл закупки
Капитальные затраты сразу
Обслуживание на вас
Обсудить задачу
Платформа

NVIDIA DGX Spark на чипе GB10

Grace Blackwell GB10 объединяет процессор и ускоритель общей памятью. Модель не копируется между хостом и картой — она лежит в одном адресном пространстве.

128 ГБ unified memory — общая память для CPU и GPU
273 ГБ/с — пропускная способность памяти
6144 CUDA-ядра и 192 тензорных ядра
1 PFLOP в формате FP4
NVLink-C2C 600 ГБ/с между CPU и GPU
Полная совместимость с CUDA — код переносится без правок
Сравнение

Чем отличается от привычных вариантов

DGX Spark

Один узел — 128 ГБ unified memory. Llama 70B работает в FP16 без квантования, кластер из двух узлов поднимает Llama 405B.

Память
128 ГБ на узел
Unified — общая с CPU
Llama 70B в FP16
Llama 405B на двух узлах
Наше предложение
Заказать расчёт

H100

80 ГБ HBM3 на ускоритель, память дискретная. Для 70B в FP16 её не хватает — нужно квантование либо несколько карт.

Память
80 ГБ на ускоритель
Дискретная HBM3
70B требует квантования
405B — от восьми карт
Обсудить задачу

RTX 5090

32 ГБ GDDR7. Подходит для небольших моделей и обучения на малых наборах, крупные модели не запускаются.

Память
32 ГБ на карту
Дискретная GDDR7
70B не запускается
405B не запускается
Обсудить задачу
Что помещается

Модели, работающие без квантования

Один узел — 128 ГБ

Модели объёмом примерно до 200B параметров.

Запускается
Llama 3.1 70B
Qwen 72B
Mistral Large
DeepSeek-R1
Code Llama 70B
GPT-OSS 120B
Заказать расчёт

Два узла — 256 ГБ

Всё из конфигурации на один узел, плюс модели следующего порядка.

Дополнительно
Llama 3.1 405B
DeepSeek V3
Заказать расчёт

Четыре узла — 512 ГБ

Запас памяти под одновременную работу нескольких крупных моделей или под обучение с длинным контекстом.

Подходит для
Несколько моделей одновременно
Длинный контекст
Мульти-агентные системы
Заказать расчёт
Производительность

Справочные показатели платформы

Инференс

Пропускная способность в токенах в секунду, формат FP8.

Токенов в секунду
Llama 3.1 8B — 7991
DeepSeek-R1 14B — 2074
Llama 3.1 70B — 803
Обсудить задачу

Дообучение

Пропускная способность при дообучении, токенов в секунду.

Токенов в секунду
Llama 3.2 3B, полное — 82 739
Llama 3.1 8B, LoRA — 53 658
Llama 3.3 70B, QLoRA — 5079
Обсудить задачу

Как читать эти цифры

Это паспортные показатели платформы NVIDIA, а не результат наших замеров. На вашей модели и вашем наборе данных результат будет другим.

Что влияет
Формат весов
Длина контекста
Размер батча
Запросить тест
Кому подходит

Сценарии использования

Прототипирование моделей до 200B параметров без аренды кластера
Исследовательские команды, перебирающие архитектуры
Дообучение методами LoRA и QLoRA для моделей до 70B
Мульти-агентные системы, где несколько моделей работают одновременно
Компьютерное зрение и обработка видеопотоков
Корпоративные задачи, где нужна изоляция на уровне железа
Конфигурации

Стоимость аренды

Оборудование размещается в дата-центрах М-Клауд. Цены указаны за месяц аренды.

1 узел

128 ГБ unified memory, 6144 CUDA-ядра.

Включено
Размещение в дата-центре М-Клауд
Питание от двух независимых шин
SLA с денежной компенсацией
Подключение к сети М-Клауд
50 000 ₽ в месяц
Заказать

2 узла

256 ГБ unified memory, 12 288 CUDA-ядер.

Включено
Размещение в дата-центре М-Клауд
Питание от двух независимых шин
SLA с денежной компенсацией
Объединение узлов в кластер
120 000 ₽ в месяц
Заказать

4 узла

512 ГБ unified memory, 24 576 CUDA-ядер.

Включено
Размещение в дата-центре М-Клауд
Питание от двух независимых шин
SLA с денежной компенсацией
Объединение узлов в кластер
230 000 ₽ в месяц
Заказать
Вопросы

Частые вопросы

Мой код на CUDA заработает?

Да. Платформа полностью совместима с CUDA, переписывать код не требуется.

Что учесть
Проверьте версию CUDA Toolkit
Сборки под конкретную архитектуру пересоберутся
Уточнить

Чем это отличается от аренды H100?

Главное отличие — объём и тип памяти. 128 ГБ unified против 80 ГБ дискретной означает, что модель на 70B работает без квантования.

Отличия
Больше памяти на узел
Общая память CPU и GPU
Модель не делится между картами
Уточнить

Подходит ли для промышленного инференса?

Да, при условии что модель помещается в память узла. Для отказоустойчивости берут несколько узлов.

Что учесть
Резервирование — от двух узлов
SLA с денежной компенсацией
Уточнить

Как узлы объединяются в кластер?

Узлы связываются в единую конфигурацию, память суммируется: два узла дают 256 ГБ, четыре — 512 ГБ.

Что учесть
Настройку выполняем мы
Схема согласуется под задачу
Уточнить

Какого размера модель можно дообучить?

LoRA и QLoRA — до 70B на одном узле. Полное дообучение разумно для моделей меньшего размера.

Что учесть
QLoRA экономнее по памяти
Длина контекста влияет сильно
Уточнить

Где физически стоит оборудование?

В дата-центрах М-Клауд: три площадки в Санкт-Петербурге и одна в Москве. Питание от двух независимых шин, SLA с денежной компенсацией.

Что учесть
Санкт-Петербург и Москва
Доступ по согласованию
Уточнить
Готовы?
Стать клиентом