Alltokens

NVIDIA: Nemotron 3 Ultra (batch)

NVNvidiaОбновлено: 04 июня 2026 г.

NVIDIA Nemotron 3 Ultra — это мощная модель с архитектурой Mixture-of-Experts (MoE), сочетающая трансформеры и Mamba для эффективного рассуждения. Благодаря огромному контекстному окну более 500 тысяч токенов, она отлично справляется с анализом масштабных документов и сложной оркестрацией задач.

Использовать через API

Метрики

Вход

36 ₽/M

Выход

216 ₽/M

Контекст

512k tokens

Параметры

17

Релиз

04 июня 2026 г.

Поддерживаемые параметры

frequency_penaltyinclude_reasoninglogit_biasmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatstopstructured_outputstemperaturetool_choicetoolstop_ktop_p

Технический обзор

NVIDIA Nemotron 3 Ultra — это модель для рассуждений и оркестрации с открытым доступом от NVIDIA, содержащая 55 миллиардов активных параметров из общего числа 550 миллиардов (MoE). Модель построена на гибридной архитектуре Transformer-Mamba с использованием смеси экспертов.

Кодинг
Инструменты
Длинный контекст
Мультимодальность
Веб-автоматизация

Смежные подборки

Сравнение с похожими моделями

Модель

Для чего

NVIDIA Nemotron 3 Ultra — это мощная модель с архитектурой Mixture-of-Experts (MoE), сочетающая трансформеры и Mamba для эффективного рассуждения. Благодаря огромному контекстному окну более 500 тысяч токенов, она отлично справляется с анализом масштабных документов и сложной оркестрацией задач.

Контекст

512k

Цена ₽

36 / 216

Модель

Для чего

Обе модели относятся к классу продвинутых решений для сложного логического вывода и поддерживают работу с инструментами.

Контекст

1M

Цена ₽

66 / 206

Для чего

Модели конкурируют в сегменте эффективных архитектур, предлагая высокую производительность при обработке текстовых запросов.

Контекст

131k

Цена ₽

84 / 168

Когда выбирать

  • Необходима обработка сверхдлинных документов или целых кодовых баз благодаря контексту в 512k токенов.
  • Требуется высокая точность в задачах логического рассуждения и сложной оркестрации процессов.
  • Нужна поддержка структурированного вывода и работы с внешними инструментами через Function Calling.

Когда не выбирать

  • Требуется мгновенный отклик в чат-ботах реального времени, где критична минимальная задержка первого токена.
  • Задача ограничивается простыми короткими ответами, не требующими глубокого анализа контекста.
  • Необходима работа с мультимодальными данными, такими как изображения или аудио.

FAQ

МИРVisaMastercardСБП
AllTokens

© 2026 Alltokens. Все права защищены.

ИП Наумов Евгений Алексеевич · ИНН 434522560555 · ОГРНИП 324430000002724 · support@alltokens.ru