Alltokens

Недорогие LLM-модели с лучшим соотношением цена/качество

Если приоритет — экономичность, начинайте с этой выборки. Здесь модели с низкой стоимостью входа и приемлемым качеством для массовых сценариев.

Моделей в подборке

60

Средняя цена (вход)

2 ₽/M

Макс. контекст

2.0M

Модели

stealth

Ox Alpha

Удаляется 31 декабря
РассужденияНовая
#14 в рейтинге

Ox Alpha — это модель рассуждений, разработанная для программирования, продолжительной агентной работы и производственных задач. Она подходит для долгосрочной разработки программного обеспечения, сложных рассуждений и рабочих процессов, которые сочетают текст с другими видами данных.

от Контекст 1.05MБесплатновхБесплатновых
liquid

LiquidAI: LFM2.5-Embedding-350M (Бесплатно)

LFM2.5-Embedding-350M — это модель текстовых эмбеддингов от Liquid AI. Она генерирует эмбеддинги размерностью 1024 для задач поиска и семантического поиска. Успешные запросы и эмбеддинги могут сохраняться и использоваться для обучения.

от Контекст 512Бесплатновхвых
dots-studio

Dots Studio: Dots3-Note Preview (Бесплатно)

Удаляется 30 сентября
Рассуждения

Dots3-Note Preview — это модель с открытым весом и архитектурой mixture-of-experts от Dots Studio, содержащая 16 миллиардов активных параметров из общего числа 280 миллиардов. Это самая легкая модель в семействе Dots 3 и...

от Контекст 512KБесплатновхБесплатновых
liquid

LiquidAI: LFM2.5-2.6B (Бесплатно)

Рассуждения

LFM2.5-2.6B — компактная модель рассуждений от Liquid AI. Она подходит для рабочих процессов агентов, извлечения данных, RAG и обработки длинных контекстов. Liquid не рекомендует использовать её для агентного программирования или...

от Контекст 66KБесплатновхБесплатновых
nvidia

NVIDIA: Nemotron 3.5 Lightning (Бесплатно)

Рассуждения

NVIDIA Nemotron 3.5 Lightning — это открытая модель с архитектурой mixture-of-experts от NVIDIA, содержащая 3 миллиарда активных параметров из общего числа 30 миллиардов. Она предназначена для высокопроизводительных агентных задач и специализированных применений, которые требуют...

от Контекст 1.00MБесплатновхБесплатновых
thinkingmachines

Thinking Machines: Inkling Small (Бесплатно)

Рассуждения

Inkling Small — это мультимодальная модель с открытым весом и смесью экспертов от Thinking Machines Lab, содержащая 12 миллиардов активных параметров из общего числа 276 миллиардов. Она представлена как более компактная и эффективная версия модели...

от Контекст 1.05MБесплатновхБесплатновых
poolside

Poolside: Laguna S 2.1 (Бесплатно)

Рассуждения

Laguna S 2.1 — это последняя модель агента для программирования от Poolside. Laguna S 2.1 представляет собой модель с общим числом параметров 118 миллиардов, из которых 8 миллиардов активных. Она достигает результата 70,2% на тесте Terminal-Bench 2.1.

от Контекст 262KБесплатновхБесплатновых
thinkingmachines

Thinking Machines: Inkling (Бесплатно)

Рассуждения

Inkling — это мультимодальная модель с открытым весом и смесью экспертов от Thinking Machines Lab, содержащая 41 миллиард активных параметров из общего числа 975 миллиардов. Она предназначена для универсального рассуждения, программирования, создания агентных систем и использования инструментов.

от Контекст 1.05MБесплатновхБесплатновых
nvidia

NVIDIA: Nemotron 3 Embed 1B (Бесплатно)

NVIDIA Nemotron 3 Embed 1B — это открытая модель текстового встраивания от NVIDIA, оптимизированная для высокопроизводительного и низколатентного поиска. Она подходит для корпоративного поиска, RAG, поиска кода и агентного поиска.

от Контекст 33KБесплатновхвых
poolside

Poolside: Laguna XS 2.1 (Бесплатно)

Рассуждения

Laguna XS 2.1 — это последняя модель агента для программирования в категории 33B-A3B от Poolside и развитие их модели Laguna XS.2 (выпущенной в апреле 2026 года). Она сочетает в себе...

от Контекст 262KБесплатновхБесплатновых
cohere

Cohere: North Mini Code (Бесплатно)

Рассуждения

North Mini Code — первая агентная модель для программирования от Cohere и дебют в серии North. Это модель с разреженной смесью экспертов, имеющая в общей сложности 30 миллиардов параметров, из которых активно используется 3 миллиарда. Модель оптимизирована для...

от Контекст 256KБесплатновхБесплатновых
z-ai

Z.ai: GLM 5.2 (Бесплатно)

Рассуждения

GLM 5.2 — это масштабная модель рассуждений от Z.ai. Она поддерживает ввод и вывод текста с контекстным окном в 1 миллион токенов и подходит для долгосрочных рабочих процессов агентов, проектной разработки программного обеспечения и других задач, требующих глубокого анализа и обработки больших объемов информации.

от Контекст 256KБесплатновхБесплатновых
nvidia

NVIDIA: Nemotron 3.5 Content Safety (Бесплатно)

Рассуждения

NVIDIA Nemotron 3.5 Content Safety — это компактная мультимодальная модель с 4 миллиардами параметров, разработанная NVIDIA и дообученная на базе Google Gemma-3-4B. Модель предназначена для модерации как входных данных, так и ответов больших языковых моделей (LLM) и моделей визуального языка (VLM).

от Контекст 128KБесплатновхБесплатновых
nvidia

NVIDIA: Nemotron 3 Ultra (Бесплатно)

Рассуждения
#4 в рейтинге

NVIDIA Nemotron 3 Ultra — это модель для рассуждений на открытых темах и оркестровки от NVIDIA, содержащая 55 миллиардов активных параметров из общего числа 550 миллиардов (MoE). Модель построена на гибридной архитектуре Transformer-Mamba с использованием смеси экспертов.

от Контекст 1.00MБесплатновхБесплатновых
minimax

MiniMax: MiniMax M3 (Бесплатно)

Рассуждения

MiniMax-M3 — это мультимодальная базовая модель от MiniMax. Она поддерживает ввод текста, изображений и видео с текстовым выводом, обладает контекстным окном на 1 миллион токенов и подходит для задач с длительным горизонтом, включая агентные системы и программирование.

от Контекст 1.05MБесплатновхБесплатновых
nvidia

NVIDIA: Nemotron 3 Nano Omni (Бесплатно)

Рассуждения

NVIDIA Nemotron™ 3 Nano Omni — это открытая мультимодальная модель с 30 миллиардами параметров, разработанная для работы в качестве подсистемы восприятия и контекста в корпоративных агентных системах. Модель принимает текст, изображения, видео и другие виды данных.

от Контекст 256KБесплатновхБесплатновых
alltokens

Pareto Code Router

Pareto Router — это способ, с помощью которого alltokens всегда выбирает для вас мощную модель для кодирования в соответствии с вашими потребностями, не привязываясь к конкретной модели. Вы выражаете единственное предпочтение `min_coding_score`...

от Контекст 2.00MБесплатновхБесплатновых
google

Google: Gemma 4 26B A4B (Бесплатно)

Рассуждения

Gemma 4 26B A4B IT — это модель с инструкционной настройкой Mixture-of-Experts (MoE) от Google DeepMind. Несмотря на 25,2 млрд общих параметров, при инференции активируется только 3,8 млрд на токен — обеспечивая качество, близкое к 31-миллиардной модели.

от Контекст 262KБесплатновхБесплатновых
google

Google: Gemma 4 31B (Бесплатно)

Рассуждения

Gemma 4 31B Instruct - это мультимодальная плотная модель Google DeepMind объемом 30,7 миллиарда параметров, поддерживающая текстовые и изображений входные данные с текстовым выводом. Оснащена 256K контекстным окном, настраиваемым режимом мышления/рассуждения, встроенными функциями...

от Контекст 262KБесплатновхБесплатновых
minimax

MiniMax: MiniMax M2.7 (Бесплатно)

Рассуждения

MiniMax-M2.7 — это модель крупного языка нового поколения, разработанная для автономной работы в реальных условиях и непрерывного совершенствования. Созданная для активного участия в собственном развитии, M2.7 включает продвинутые агентные возможности через многозадачное взаимодействие агентов.

от Контекст 197KБесплатновхБесплатновых
nvidia

NVIDIA: Nemotron 3 Super (Бесплатно)

Рассуждения

NVIDIA Nemotron 3 Super — это открытая гибридная модель MoE с 120 миллиардами параметров, активирующая всего 12 миллиардов для максимальной вычислительной эффективности и точности в сложных многоагентных приложениях. Основанная на гибридной архитектуре Mamba-Transformer Mixture-of-Experts с много-токеновым предсказанием (MTP), она обеспечивает более чем 50% прирост генерации токенов по сравнению с ведущими открытыми моделями. Модель оснащена контекстным окном в 1 миллион токенов для долгосрочной когерентности агентов, междокументного рассуждения и планирования многошаговых задач. Latent MoE позволяет вызывать 4 эксперта за стоимость одного, улучшая интеллект и обобщение. Мульти-средовое обучение с подкреплением в 10+ средах обеспечивает лидирующую точность на бенчмарках, включая AIME 2025, TerminalBench и SWE-Bench Verified. Полностью открытая с весами, наборами данных и рецептами под лицензией NVIDIA Open, Nemotron 3 Super позволяет легко настраивать и безопасно развертывать модель в любом месте — от рабочей станции до облака.

от Контекст 262KБесплатновхБесплатновых
nvidia

NVIDIA: Llama Nemotron Embed VL 1B V2 (Бесплатно)

Модель встраивания Llama Nemotron Embed VL 1B V2 оптимизирована для мультимодального поиска в задачах ответов на вопросы. Модель способна преобразовывать в векторные представления документы в виде изображений, текста или их комбинации. Поиск документов осуществляется на основе текстового запроса пользователя. Модель поддерживает обработку изображений, содержащих текст, таблицы, диаграммы и инфографику. Примечание: при использовании бесплатного доступа все запросы и результаты логируются для улучшения модели и сопутствующих сервисов. Пожалуйста, не загружайте личную, конфиденциальную или иную чувствительную информацию. Данный доступ предназначен только для ознакомительного использования. Не используйте его для производственных или критически важных бизнес-систем.

от Контекст 131KБесплатновхвых
alltokens

Free Models Router

Рассуждения

Самый простой способ получить бесплатный доступ к нейросетям. alltokens/free — это роутер, который случайным образом выбирает бесплатные модели из доступных на платформе alltokens. Система интеллектуально фильтрует модели, поддерживающие необходимые для вашего запроса функции, такие как анализ изображений, вызов инструментов, структурированные ответы и другие возможности.

от Контекст 200KБесплатновхБесплатновых
alltokens

Body Builder (beta)

Преобразуйте ваши запросы на естественном языке в структурированные объекты запросов API alltokens. Опишите, что вы хотите реализовать с помощью моделей ИИ, и Body Builder сформирует соответствующие вызовы API. Пример: посчитай до 10, используя gemini и opus. Этот инструмент полезен для создания мультимодельных запросов, кастомных роутеров моделей или программной генерации вызовов API на основе человеческих описаний. УВЕДОМЛЕНИЕ О БЕТА-ТЕСТИРОВАНИИ: Body Builder находится на стадии бета-тестирования и в данный момент предоставляется бесплатно. Стоимость и функциональные возможности могут измениться в будущем.

от Контекст 128KБесплатновхБесплатновых
alltokens

Auto Router

Рассуждения

Ваш запрос будет обработан мета-моделью и направлен в одну из десятков доступных моделей для достижения наилучшего результата. Чтобы узнать, какая именно модель была использована, проверьте историю активности или атрибут model в ответе API. Стоимость запроса соответствует тарифу выбранной модели. Вы можете настроить список моделей для маршрутизации в документации. Запросы направляются в следующие модели: - anthropic/claude-haiku-4.5 - anthropic/claude-opus-4.6 - anthropic/claude-sonnet-4.5 - deepseek/deepseek-r1 - google/gemini-2.5-flash-lite - google/gemini-3-flash-preview - google/gemini-3-pro-preview - meta-llama/llama-3.3-70b-instruct - mistralai/codestral-2508 - mistralai/mistral-large - mistralai/mistral-medium-3.1 - mistralai/mistral-small-3.2-24b-instruct-2506 - moonshotai/kimi-k2-thinking - moonshotai/kimi-k2.5 - openai/gpt-5 - openai/gpt-5-mini - openai/gpt-5-nano - openai/gpt-5.1 - openai/gpt-5.2 - openai/gpt-5.2-pro - openai/gpt-oss-120b - perplexity/sonar - qwen/qwen3-235b-a22b - x-ai/grok-3 - x-ai/grok-3-mini - x-ai/grok-4

от Контекст 2.00MБесплатновхБесплатновых
perplexity

Perplexity: Embed V1 0.6B

pplx-embed-v1-0.6B — одна из современных текстовых встраиваемых моделей Perplexity, разработанная для реального веб-масштабного поиска. Модель pplx-embed-v1 оптимизирована для стандартного плотного текстового поиска, а версия с 0.6B параметров предназначена для легковесной генерации встраиваемых представлений с низкой задержкой.

от Контекст 32K1 ₽/Mвхвых
thenlper

Thenlper: GTE-Base

Модель эмбеддингов gte-base преобразует английские предложения и абзацы в плотное векторное пространство размерностью 768. Она обеспечивает эффективное и качественное создание семантических эмбеддингов, оптимизированных для задач определения текстового сходства, семантического поиска и кластеризации.

от Контекст 5121 ₽/Mвхвых
intfloat

Intfloat: E5-Base-v2

Модель эмбеддингов e5-base-v2 преобразует предложения и абзацы на английском языке в плотные векторы размерностью 768. Она создает эффективные и высококачественные семантические эмбеддинги, оптимизированные для таких задач, как семантический поиск, оценка сходства, поиск информации и кластеризация. Модель доступна через API alltokens.

от Контекст 5121 ₽/Mвхвых
sentence-transformers

Sentence Transformers: paraphrase-MiniLM-L6-v2

Модель эмбеддингов paraphrase-MiniLM-L6-v2 преобразует предложения и короткие абзацы в 384-мерное плотное векторное пространство. Она создает высококачественные семантические эмбеддинги, оптимизированные для обнаружения парафраза, оценки семантического сходства, кластеризации и задач легковесного поиска данных.

от Контекст 5121 ₽/Mвхвых
sentence-transformers

Sentence Transformers: all-MiniLM-L12-v2

Модель эмбеддингов all-MiniLM-L12-v2 преобразует предложения и короткие абзацы в 384-мерное плотное векторное пространство. Она создает эффективные и высококачественные семантические эмбеддинги, оптимизированные для таких задач, как семантический поиск, кластеризация и оценка сходства текстов.

от Контекст 5121 ₽/Mвхвых
baai

BAAI: bge-base-en-v1.5

Модель эмбеддингов bge-base-en-v1.5 преобразует английские предложения и абзацы в плотные векторы размерности 768, обеспечивая эффективные и высококачественные семантические представления. Модель оптимизирована для задач поиска, семантического анализа и сопоставления документов. Версия v1.5 отличается улучшенным распределением показателей сходства и более высокой производительностью поиска без необходимости дополнительной настройки.

от Контекст 5121 ₽/Mвхвых
sentence-transformers

Sentence Transformers: multi-qa-mpnet-base-dot-v1

Модель эмбеддингов multi-qa-mpnet-base-dot-v1 преобразует предложения и короткие абзацы в плотное векторное пространство размерностью 768. Она генерирует высококачественные семантические эмбеддинги, оптимизированные для поиска ответов на вопросы, семантического поиска и оценки сходства текстов в различных типах контента.

от Контекст 5121 ₽/Mвхвых
sentence-transformers

Sentence Transformers: all-mpnet-base-v2

Модель эмбеддингов all-mpnet-base-v2 преобразует предложения и короткие абзацы в плотное векторное пространство размерности 768. Она обеспечивает высокую точность семантических представлений, которые отлично подходят для таких задач, как поиск информации, кластеризация, оценка сходства и ранжирование текстов.

от Контекст 5121 ₽/Mвхвых
sentence-transformers

Sentence Transformers: all-MiniLM-L6-v2

Модель эмбеддингов all-MiniLM-L6-v2 преобразует предложения и короткие абзацы в плотное векторное пространство размерностью 384. Это обеспечивает высококачественное семантическое представление данных, которое идеально подходит для таких задач, как поиск информации, кластеризация, оценка сходства и ранжирование текста. Модель доступна через API alltokens.

от Контекст 5121 ₽/Mвхвых
thenlper

Thenlper: GTE-Large

Модель эмбеддингов gte-large преобразует английские предложения, абзацы и документы средней длины в 1024-мерное векторное пространство. Она обеспечивает высококачественные семантические эмбеддинги, оптимизированные для задач поиска информации, определения семантического сходства текстов, переранжирования и кластеризации. Модель обучена с использованием многоэтапного контрастивного обучения на обширном корпусе релевантных данных из различных областей, что гарантирует отличную производительность в универсальных сценариях использования эмбеддингов на alltokens.

от Контекст 5122 ₽/Mвхвых
intfloat

Intfloat: E5-Large-v2

Модель эмбеддингов e5-large-v2 преобразует английские предложения, абзацы и документы в плотное векторное пространство размерностью 1024. Она обеспечивает высокую точность семантических представлений, оптимизированных для задач поиска информации, семантического поиска, переранжирования и оценки сходства текстов. Модель доступна через API alltokens.

от Контекст 5122 ₽/Mвхвых
intfloat

Intfloat: Multilingual-E5-Large

Модель эмбеддингов multilingual-e5-large преобразует предложения, абзацы и документы на более чем 90 языках в 1024-мерное векторное пространство. Она обеспечивает создание качественных семантических векторов, оптимизированных для многоязычного поиска, определения сходства текстов на разных языках и обработки крупномасштабных массивов данных через API alltokens.

от Контекст 5122 ₽/Mвхвых
baai

BAAI: bge-large-en-v1.5

Модель эмбеддингов bge-large-en-v1.5 преобразует английские предложения, абзацы и документы в плотное векторное пространство размерностью 1024. Она обеспечивает высокоточное семантическое представление данных, оптимизированное для семантического поиска, поиска документов и решения прикладных задач обработки естественного языка на английском языке. Модель доступна через API alltokens.

от Контекст 5122 ₽/Mвхвых
baai

BAAI: bge-m3

Модель эмбеддингов bge-m3 преобразует предложения, абзацы и длинные документы в плотное векторное пространство размерностью 1024. Она обеспечивает высококачественные семантические эмбеддинги, оптимизированные для мультиязычного поиска, семантического анализа и работы с приложениями, требующими обработки большого контекста.

от Контекст 8K2 ₽/Mвхвых
qwen

Qwen: Qwen3 Embedding 8B

Серия моделей Qwen3 Embedding — это новейшая разработка в семействе Qwen, специально созданная для задач встраивания текста и ранжирования. Данная серия унаследовала исключительные мультиязычные возможности, навыки понимания длинных текстов и логического вывода от своей базовой модели. Серия Qwen3 Embedding демонстрирует значительные успехи в различных задачах обработки текста, включая поиск текстовой информации, поиск кода, классификацию, кластеризацию и поиск параллельных корпусов текстов.

от Контекст 33K2 ₽/Mвхвых
voyageai

VoyageAI by MongoDB: voyage-4-lite

Voyage 4 Lite — это универсальная модель для создания эмбеддингов с акцентом на эффективность от Voyage AI компании MongoDB, оптимизированная для быстрого отклика и экономичного поиска. Поддерживает матрёшечные эмбеддинги с размерами 2048, 1024, 512 и 256.

от Контекст 32K3 ₽/Mвхвых
inclusionai

Ling-3.0-flash

Рассуждения

Ling-3.0-flash — это модель с 124 миллиардами параметров на основе архитектуры Mixture-of-Experts (MoE), при этом активируется около 5,1 миллиарда параметров на каждый токен. Модель разработана с приоритетом на эффективность обработки токенов и масштабируемое агентное инференс для производственных задач, что позволяет разработчикам...

от Контекст 262K3 ₽/Mвх8 ₽/Mвых
openai

OpenAI: Text Embedding 3 Small

text-embedding-3-small — это улучшенная и более производительная версия модели встраивания ada от OpenAI. Встраивания (embeddings) представляют собой числовое выражение текста, которое позволяет измерять степень смысловой близости между различными фрагментами данных. Данная модель эффективна для решения задач поиска, кластеризации, формирования рекомендаций, обнаружения аномалий и классификации текста. На платформе alltokens вы можете использовать эту модель для создания высокоточных векторных представлений.

от Контекст 8K3 ₽/Mвхвых
qwen

Qwen: Qwen3 Embedding 4B

Серия моделей Qwen3 Embedding — это новейшая разработка в семействе Qwen, специально созданная для задач встраивания текста и ранжирования. Данная серия унаследовала исключительные мультиязычные возможности, навыки понимания длинных текстов и логического вывода от своей базовой модели. Серия Qwen3 Embedding демонстрирует значительные успехи в различных задачах обработки текстов, включая поиск текстовой информации, поиск кода, классификацию, кластеризацию и поиск параллельных корпусов данных. На платформе alltokens эти модели обеспечивают высокую точность и производительность для современных ИИ-решений.

от Контекст 33K3 ₽/Mвхвых
ibm-granite

IBM: Granite 4.0 Micro

Granite-4.0-H-Micro — это модель с 3 миллиардами параметров из семейства Granite 4. Данные модели являются последними в серии релизов от IBM. Они специально оптимизированы для работы с длинным контекстом и вызова внешних инструментов.

от Контекст 131K3 ₽/Mвх14 ₽/Mвых
openai

OpenAI: gpt-oss-20b

Рассуждения

gpt-oss-20b — это модель с открытыми весами и 21 миллиардом параметров, выпущенная под лицензией Apache 2.0. Она использует архитектуру Mixture-of-Experts (MoE) с 3,6 миллиардами активных параметров на каждый проход, что оптимизирует ее для работы с низкой задержкой и позволяет развертывать на потребительском оборудовании или одиночных графических процессорах. Модель обучена в формате ответов Harmony и поддерживает настройку уровней рассуждения, дообучение, а также агентские возможности, включая вызов функций, использование инструментов и структурированный вывод данных. На платформе alltokens модель доступна для интеграции через API.

от Контекст 131K3 ₽/Mвх13 ₽/Mвых
meta-llama

Meta: Llama 3.1 8B Instruct

Новейшая линейка моделей Meta Llama 3.1 представлена в различных конфигурациях. Данная версия 8B с дообучением для следования инструкциям отличается высокой скоростью и эффективностью. В ходе экспертных оценок модель продемонстрировала высокие результаты, сопоставимые с ведущими проприетарными моделями. Использование данной модели на alltokens регулируется политикой допустимого использования Meta.

от Контекст 131K3 ₽/Mвх5 ₽/Mвых
mistralai

Mistral: Mistral Nemo

Модель с 12 миллиардами параметров и контекстным окном в 128 000 токенов, разработанная Mistral в сотрудничестве с NVIDIA. Модель является мультиязычной и поддерживает английский, французский, немецкий, испанский, итальянский, португальский, китайский, японский, корейский, арабский языки и хинди. Она поддерживает вызов функций (function calling) и распространяется под лицензией Apache 2.0.

от Контекст 131K3 ₽/Mвх4 ₽/Mвых
upstage

Upstage: Solar Pro 4

Рассуждения

Solar Pro 4 — это крупная языковая модель от Upstage. Она подходит для агентных рабочих процессов, офисной продуктивности, работы с большим объемом документов и программирования.

от Контекст 524K4 ₽/Mвх15 ₽/Mвых
deepseek

DeepSeek: DeepSeek V4 Flash 0731

Рассуждения
#11 в рейтинге

DeepSeek V4 Flash 0731 — это модель с разреженной смесью экспертов от DeepSeek, содержащая 13 миллиардов активных параметров из общего числа 284 миллиарда. Эта версия с повторным обучением подходит для программирования, логического мышления и работы с агентами.

от Контекст 1.31M4 ₽/Mвх10 ₽/Mвых
qwen

Qwen: Qwen3.7 Flash

Рассуждения
#7 в рейтинге

Qwen3.7 Flash — это модель для визуально-языкового рассуждения от Alibaba. Она предназначена для мультимодальных агентов, визуального программирования, поиска и взаимодействия с компьютером. Модель обладает сильными возможностями в распознавании объектов, пространственном понимании и работе с реальным миром.

от Контекст 1.00M4 ₽/Mвх17 ₽/Mвых
nex-agi

Nex AGI: Nex-N2-Mini

Рассуждения

Nex-N2-Mini — это открытая модель с агентной архитектурой mixture-of-experts от Nex AGI, младшая версия в серии Nex-N2. Модель принимает текстовые и графические данные на вход и предназначена для программирования, использования инструментов и других задач.

от Контекст 262K4 ₽/Mвх13 ₽/Mвых
perplexity

Perplexity: Embed V1 4B

pplx-embed-v1 -4B — это одна из передовых текстовых встраиваемых моделей Perplexity, разработанная для реального веб-масштабного поиска. Модель pplx-embed-v1 оптимизирована для стандартного плотного текстового поиска, а 4B-параметрическая модель максимизирует качество поиска.

от Контекст 32K4 ₽/Mвхвых
openai

OpenAI: GPT-5 Nano (batch)

Рассуждения

GPT-5-Nano — это самая маленькая и быстрая версия в системе GPT-5, оптимизированная для инструментов разработчиков, быстрого взаимодействия и сред с ультранизкой задержкой. Несмотря на ограниченную глубину рассуждений по сравнению с более крупными моделями, она обеспечивает высокую скорость отклика и эффективна в задачах, требующих мгновенной обработки.

от Контекст 400K4 ₽/Mвх25 ₽/Mвых
openai

OpenAI: GPT-5 Nano

Рассуждения

GPT-5-Nano — это самая компактная и быстрая версия в семействе GPT-5, оптимизированная для инструментов разработки, мгновенного взаимодействия и сред с минимальной задержкой. Несмотря на ограниченную глубину рассуждений по сравнению со старшими моделями, она сохраняет ключевые возможности следования инструкциям и функции безопасности. Являясь преемником GPT-4.1-nano, эта модель представляет собой легковесное решение для приложений, чувствительных к стоимости ресурсов или работающих в режиме реального времени.

от Контекст 400K4 ₽/Mвх25 ₽/Mвых
openai

OpenAI: gpt-oss-120b

Рассуждения

gpt-oss-120b — это языковая модель с открытыми весами на базе архитектуры Mixture-of-Experts (MoE), содержащая 117 миллиардов параметров и разработанная OpenAI для сложных логических задач, работы автономных агентов и универсального промышленного использования. Модель активирует 5,1 миллиарда параметров при каждом проходе и оптимизирована для запуска на одном графическом процессоре H100 с использованием нативного квантования MXFP4. Модель поддерживает настраиваемую глубину рассуждений, полный доступ к цепочке мыслей (chain-of-thought) и нативную работу с инструментами, включая вызов функций, поиск в сети и генерацию структурированных данных. На alltokens вы можете получить доступ к этой модели через API.

от Контекст 131K4 ₽/Mвх22 ₽/Mвых
meta-llama

Meta: Llama 3.2 1B Instruct

Llama 3.2 1B — это языковая модель с 1 миллиардом параметров, ориентированная на эффективное выполнение задач обработки естественного языка, таких как суммаризация, ведение диалогов и многоязычный анализ текста. Компактный размер позволяет модели эффективно работать в средах с ограниченными ресурсами, сохраняя при этом высокую производительность. Поддерживая восемь основных языков с возможностью дообучения на другие, Llama 3.2 1B идеально подходит для компаний и разработчиков, которым требуются легкие, но мощные ИИ-решения. Модель способна работать в различных многоязычных сценариях без высоких требований к вычислительным мощностям, характерных для более крупных моделей. Использование данной модели регулируется политикой допустимого использования Meta. Доступ к модели осуществляется через alltokens.

от Контекст 60K4 ₽/Mвх25 ₽/Mвых
cohere

Cohere: Command R7B (12-2024)

Command R7B (12-2024) — это компактное и быстрое обновление модели Command R+, выпущенное в декабре 2024 года. Модель демонстрирует отличные результаты в задачах RAG (генерация с дополнением из внешних источников), использовании инструментов, создании агентов и других сценариях, требующих сложной логики и выполнения многошаговых инструкций. Использование данной модели на alltokens регулируется политикой использования и соглашением SaaS компании Cohere.

от Контекст 128K5 ₽/Mвх19 ₽/Mвых
amazon

Amazon: Nova Micro 1.0

Amazon Nova Micro 1.0 — это текстовая модель, обеспечивающая минимальную задержку ответа в семействе Amazon Nova при очень низкой стоимости. Благодаря контекстному окну в 128K токенов и оптимизации под скорость и экономичность, Amazon Nova Micro отлично справляется с такими задачами, как суммаризация текста, перевод, классификация контента, интерактивные чаты и мозговой штурм. Модель также обладает базовыми способностями к математическим рассуждениям и написанию кода. Доступ к модели осуществляется через API alltokens.

от Контекст 128K5 ₽/Mвх18 ₽/Mвых
sao10k

Sao10K: Llama 3 8B Lunaris

Lunaris 8B — это универсальная модель для общих задач и ролевого взаимодействия, базирующаяся на архитектуре Llama 3. Она представляет собой стратегическое слияние нескольких моделей, разработанное для достижения баланса между креативностью, улучшенной логикой и общими знаниями. Созданная разработчиком Sao10k, эта модель призвана предложить более качественный опыт по сравнению со Stheno v3.2, обеспечивая повышенную творческую составляющую и логическое мышление. Для достижения наилучших результатов на alltokens рекомендуется использовать шаблон контекста Llama 3 Instruct, значение температуры 1.4 и параметр min_p 0.1.

от Контекст 8K5 ₽/Mвх7 ₽/Mвых

Похожие модели внутри подборки

Быстрые связки для углубленного сравнения: по цене, контексту и поддерживаемым API-параметрам.

Близкие по контексту

Близкие по параметрам

FAQ

Что считается недорогой моделью в этом каталоге?

В этой подборке — модели с минимальной ценой входных токенов, отсортированные по возрастанию стоимости.

Можно ли использовать дешевые модели в продакшене?

Да, особенно для массовых и менее критичных задач; важно проверять качество на ваших данных.

Смежные подборки

Лучшие для задач

Новости по теме

МИРVisaMastercardСБП
AllTokens

© 2026 Alltokens. Все права защищены.

ИП Наумов Евгений Алексеевич · ИНН 434522560555 · ОГРНИП 324430000002724 · support@alltokens.ru