LLM-модели с длинным контекстным окном
Для работы с крупными документами, длинными диалогами и многофайловыми кодовыми базами выбирайте модели из этой подборки.
Моделей в подборке
60
Средняя цена (вход)
150 ₽/M
Макс. контекст
2.0M
Модели
Pareto Code Router
Pareto Router — это способ, с помощью которого alltokens всегда выбирает для вас мощную модель для кодирования в соответствии с вашими потребностями, не привязываясь к конкретной модели. Вы выражаете единственное предпочтение `min_coding_score`...
SpaceXAI: Grok 4.20 Multi-Agent
Grok 4.20 Multi-Agent — это вариант модели xAI Grok 4.20, созданный для совместной работы агентов. Несколько агентов работают параллельно для проведения глубоких исследований, координации использования инструментов и синтеза информации при решении сложных задач. Поведение при затратах на рассуждение: - низкое / среднее: 4 агента - высокое / очень высокое: 16 агентов
SpaceXAI: Grok 4.20
Grok 4.20 — новейшая флагманская модель xAI с лидирующей скоростью и возможностями агентного вызова инструментов. Она сочетает самый низкий на рынке уровень галлюцинаций с строгим соблюдением инструкций, обеспечивая стабильно точные и правдивые ответы. Режим рассуждений можно включать/выключать с помощью параметра `reasoning` `enabled` в API. Подробнее в наших документах.
Auto Router
Ваш запрос будет обработан мета-моделью и направлен в одну из десятков доступных моделей для достижения наилучшего результата. Чтобы узнать, какая именно модель была использована, проверьте историю активности или атрибут model в ответе API. Стоимость запроса соответствует тарифу выбранной модели. Вы можете настроить список моделей для маршрутизации в документации. Запросы направляются в следующие модели: - anthropic/claude-haiku-4.5 - anthropic/claude-opus-4.6 - anthropic/claude-sonnet-4.5 - deepseek/deepseek-r1 - google/gemini-2.5-flash-lite - google/gemini-3-flash-preview - google/gemini-3-pro-preview - meta-llama/llama-3.3-70b-instruct - mistralai/codestral-2508 - mistralai/mistral-large - mistralai/mistral-medium-3.1 - mistralai/mistral-small-3.2-24b-instruct-2506 - moonshotai/kimi-k2-thinking - moonshotai/kimi-k2.5 - openai/gpt-5 - openai/gpt-5-mini - openai/gpt-5-nano - openai/gpt-5.1 - openai/gpt-5.2 - openai/gpt-5.2-pro - openai/gpt-oss-120b - perplexity/sonar - qwen/qwen3-235b-a22b - x-ai/grok-3 - x-ai/grok-3-mini - x-ai/grok-4
Z.ai: GLM 5.3 Flash
GLM-5.3-Flash — это нативная мультимодальная модель от Z.ai. Она предназначена для эффективного программирования и задач с длительным горизонтом планирования. Гибридная архитектура с разреженным и линейным вниманием обеспечивает точное поведение при работе с длинным контекстом, одновременно...

DeepSeek: DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731 — это модель с разреженной смесью экспертов от DeepSeek, содержащая 13 миллиардов активных параметров из общего числа 284 миллиарда. Эта версия с повторным обучением подходит для программирования, логического мышления и работы с агентами.

Meta: Llama 4 Scout
Llama 4 Scout 17B Instruct (16E) — это языковая модель на базе архитектуры смеси экспертов (MoE), разработанная Meta. Модель активирует 17 миллиардов параметров из общего числа в 109 миллиардов. Она поддерживает нативный мультимодальный ввод (текст и изображения) и мультиязычный вывод (текст и программный код) на 12 языках. Scout спроектирована для работы в режиме ассистента и визуального анализа, используя 16 экспертов на каждом проходе. Модель обладает контекстным окном в 10 миллионов токенов и обучена на корпусе объемом около 40 триллионов токенов. Созданная для высокой эффективности и локального или коммерческого развертывания, Llama 4 Scout использует технологию раннего слияния для бесшовной интеграции различных модальностей. Модель прошла процедуру настройки инструкций для использования в мультиязычных чатах, генерации описаний к изображениям и задач по распознаванию визуального контента. Выпущенная под лицензией Llama 4 Community License, она обучалась на данных вплоть до августа 2024 года и стала доступна на alltokens 5 апреля 2025 года.

OpenAI: GPT-5.6 Luna Pro (batch)
GPT-5.6 Luna Pro использует ту же базовую модель, что и GPT-5.6 Luna, но с включённым режимом `reasoning.mode` установленным на `pro` для получения более качественных ответов на сложные задачи.

OpenAI: GPT-5.6 Luna Pro
GPT-5.6 Luna Pro использует ту же базовую модель, что и GPT-5.6 Luna, но с включённым режимом `reasoning.mode` в значении `pro` для получения более качественных ответов на сложные задачи.

OpenAI: GPT-5.6 Luna (batch)
GPT-5.6 Luna — это быстрый и экономичный модель из серии GPT-5.6. Она подходит для задач с высоким объемом и чувствительностью к задержкам, таких как чат, классификация и легкие агентные рабочие процессы, обеспечивая эффективное логическое мышление для...

OpenAI: GPT-5.6 Luna
GPT-5.6 Luna — это быстрый и эффективный по затратам модель из серии GPT-5.6. Она подходит для задач с высоким объемом и чувствительностью к задержкам, таких как чат, классификация и легкие агентные рабочие процессы, обеспечивая качественное логическое мышление для...

OpenAI: GPT-5.6 Terra Pro (batch)
GPT-5.6 Terra Pro использует ту же базовую модель, что и GPT-5.6 Terra, но с включённым режимом `reasoning.mode` установленным на `pro` для получения более качественных ответов на сложные задачи.

OpenAI: GPT-5.6 Terra Pro
GPT-5.6 Terra Pro использует ту же базовую модель, что и GPT-5.6 Terra, но с включённым режимом `reasoning.mode` в значении `pro` для получения более качественных ответов на сложные задачи.

OpenAI: GPT-5.6 Terra (batch)
GPT-5.6 Terra — это сбалансированная модель из серии GPT-5.6, расположенная между флагманским уровнем Sol и экономичным уровнем Luna. Она подходит для повседневного программирования, рассуждений и выполнения агентских задач.

OpenAI: GPT-5.6 Terra
GPT-5.6 Terra — это сбалансированная модель из серии GPT-5.6, расположенная между флагманским уровнем Sol и экономичным уровнем Luna. Она подходит для повседневного программирования, рассуждений и выполнения агентских задач.

OpenAI: GPT-5.6 Sol Pro (batch)
GPT-5.6 Sol Pro — это та же базовая модель, что и GPT-5.6 Sol, но с включённым режимом `reasoning.mode` установленным на `pro` для получения более качественных ответов на сложные задачи.

OpenAI: GPT-5.6 Sol Pro
GPT-5.6 Sol Pro использует ту же базовую модель, что и GPT-5.6 Sol, но с включённым режимом `reasoning.mode` установленным на `pro` для получения более качественных ответов на сложные задачи.

OpenAI: GPT-5.6 Sol (batch)
GPT-5.6 Sol — это флагманская модель серии GPT-5.6. Она предназначена для сложных рассуждений, программирования и агентных рабочих процессов, особенно хорошо справляется с задачами командной строки и многошаговым программированием.

OpenAI: GPT-5.6 Sol
GPT-5.6 Sol — это флагманская модель серии GPT-5.6. Она предназначена для сложных рассуждений, программирования и агентных рабочих процессов, особенно хорошо справляется с задачами командной строки и многошаговым кодированием.

OpenAI: GPT-5.5 Pro (batch)
GPT-5.5 Pro — это высокопроизводительная модель, оптимизированная для глубокого анализа и точности при работе с комплексными и критически важными задачами. Модель поддерживает контекстное окно более 1 миллиона токенов (922 тысячи входных, 128 тысяч выходных).

OpenAI: GPT-5.5 Pro
GPT-5.5 Pro — это высокопроизводительная модель, разработанная для глубокого анализа и высокой точности при работе с комплексными и критически важными задачами. Модель поддерживает контекстное окно более 1 миллиона токенов (922 тысячи входных, 128 тысяч выходных).

OpenAI: GPT-5.5 (batch)
GPT-5.5 — передовая модель, разработанная для сложных профессиональных задач, основанная на GPT-5.4 с улучшенными возможностями рассуждения, повышенной надежностью и улучшенной эффективностью обработки токенов при выполнении сложных заданий. Модель поддерживает работу с более чем 1 миллионом токенов.

OpenAI: GPT-5.5
GPT-5.5 — передовая модель, разработанная для сложных профессиональных задач, основанная на GPT-5.4 с улучшенными возможностями рассуждения, повышенной надежностью и улучшенной эффективностью обработки токенов при выполнении сложных заданий. Модель поддерживает работу с более чем 1 миллионом токенов.
Xiaomi: MiMo-V2.5-Pro
MiMo-V2.5-Pro — флагманская модель Xiaomi, демонстрирующая высокую производительность в общих агентных задачах, сложном программном инжиниринге и долгосрочных проектах, занимая лидирующие позиции в бенчмарках, таких как ClawEval, GDPVal и SWE-bench Pro.
Xiaomi: MiMo-V2.5
MiMo-V2.5 — это нативная омнимодальная модель от Xiaomi. Она обеспечивает производительность уровня Pro для агентных задач примерно за половину стоимости вывода, при этом превосходя MiMo-V2-Omni в мультимодальном восприятии при анализе изображений и видео.

OpenAI: GPT-5.4 Pro (batch)
GPT-5.4 Pro — самая продвинутая модель, основанная на единой архитектуре GPT-5.4 с улучшенными возможностями рассуждения для выполнения сложных и ответственных задач. Модель поддерживает контекстное окно более 1 миллиона токенов (922 тысячи входных, 128 тысяч выходных).

OpenAI: GPT-5.4 Pro
GPT-5.4 Pro — самая продвинутая модель OpenAI, построенная на унифицированной архитектуре GPT-5.4 с улучшенными способностями к рассуждению для сложных, критически важных задач. Она оснащена контекстным окном в 1M+ токенов (922K входных, 128K выходных) с поддержкой текстовых и изображений входных данных. Оптимизирована для пошагового рассуждения, следования инструкциям и точности, GPT-5.4 Pro отлично справляется с агентным кодированием, рабочими процессами с длинным контекстом и решением многошаговых задач.

OpenAI: GPT-5.4 (batch)
GPT-5.4 — это новейшая модель компании OpenAI, объединяющая линии Codex и GPT в единую систему. Модель поддерживает контекстное окно более 1 миллиона токенов (922 тысячи входных, 128 тысяч выходных) с возможностью...

OpenAI: GPT-5.4
GPT-5.4 — это последняя флагманская модель OpenAI, объединяющая линии Codex и GPT в единую систему. Она оснащена контекстным окном более 1 млн токенов (922 тыс. входных, 128 тыс. выходных) и поддерживает текстовые и изображенные входные данные, что позволяет выполнять высококонтекстное рассуждение, программирование и мультимодальный анализ в рамках одного рабочего процесса. Модель демонстрирует улучшенные результаты в программировании, анализе документов, использовании инструментов и следовании инструкциям. Она разработана как надежный выбор как для общих задач, так и для разработки программного обеспечения, способна генерировать код промышленного качества, синтезировать информацию из множественных источников и выполнять сложные многошаговые рабочие процессы с меньшим количеством итераций и большей эффективностью использования токенов.
Meituan: LongCat 2.0
LongCat 2.0 — это языковая модель с разреженной смесью экспертов от Meituan, имеющая 48 миллиардов активных параметров из общего числа 1,6 триллиона. Она подходит для программирования, изменений на уровне репозиториев, решения задач с длительным горизонтом и агентных приложений.

Meta: Muse Spark 1.2 Contributor
Muse Spark 1.2 contributor tier — это модель рассуждения от Meta, предназначенная для разработчиков, которые хотят начать создавать проекты с еще меньшими затратами. Она значительно дешевле, чем Muse Spark...

DeepSeek: DeepSeek V4 Flash Vision Exp
DeepSeek V4 Flash Vision Exp — экспериментальная версия DeepSeek V4 Flash 0731 с поддержкой обработки изображений, которая добавляет возможности понимания изображений при сохранении базовых текстовых функций модели, включая работу с агентами.
Z.ai: GLM 5.3
GLM-5.3 — это масштабная модель рассуждений от Z.ai, разработанная для сложных задач в области программной инженерии и долгосрочного планирования агентов. Модель поддерживает ввод и вывод текста с контекстным окном размером 1 миллион токенов и обеспечивает улучшенную производительность в соответствующих задачах.

Google: Gemini 3.7 Flash (batch)
Gemini 3.7 Flash — мультимодальная модель от Google, предназначенная для быстрого выполнения агентных рабочих процессов, программирования и сложного многоэтапного рассуждения. Модель разработана для задач, требующих высокой отзывчивости и надежного выполнения многошаговых операций.

Google: Gemini 3.7 Flash
Gemini 3.7 Flash — мультимодальная модель от Google, предназначенная для быстрого выполнения агентных рабочих процессов, программирования и сложного многоэтапного рассуждения. Модель разработана для задач, требующих высокой отзывчивости и надежного выполнения многошаговых операций.

Qwen: Qwen3.8 2.4T A95B
Qwen3.8 2.4T A95B — это модель с открытыми весами, использующая разреженную смесь экспертов, разработанная Qwen. Она является вариантом Qwen3.8 Max с открытыми весами и содержит 95 миллиардов активных параметров из общего числа 2,4 триллиона. Модель предназначена для...

DeepSeek: DeepSeek V4 Pro 0813
DeepSeek V4 Pro 0813 — это крупномасштабная модель с архитектурой mixture-of-experts от DeepSeek. Это стабильный релиз DeepSeek V4 Pro.

Meta: Muse Spark 1.2
Muse Spark 1.2 — это модель рассуждения от Meta, предназначенная для выполнения сложных агентных задач. Она принимает текст, изображения, видео, аудио и PDF-документы, возвращает текст и поддерживает контекст объемом до 1 миллиона токенов.
Thinking Machines: Inkling Small (Бесплатно)
Inkling Small — это мультимодальная модель с открытым весом и смесью экспертов от Thinking Machines Lab, содержащая 12 миллиардов активных параметров из общего числа 276 миллиардов. Она представлена как более компактная и эффективная версия модели...
Thinking Machines: Inkling Small
Inkling Small — это мультимодальная модель с открытым весом и архитектурой mixture-of-experts от Thinking Machines Lab, содержащая 12 миллиардов активных параметров из общего числа 276 миллиардов. Она представлена как более компактная и эффективная версия модели.
Poolside: Laguna S 2.1
Laguna S 2.1 — это последняя модель агента для программирования от Poolside. Laguna S 2.1 имеет в общей сложности 118 миллиардов параметров, из которых 8 миллиардов активных. Модель достигает результата 70,2% на тесте Terminal-Bench 2.1.

Google: Gemini 3.6 Flash (batch)
Gemini 3.6 Flash — это высокоэффективная модель от Google, предназначенная для программирования, агентных рабочих процессов, а также разработки веб-сайтов и приложений. Модель создана для генерации качественных результатов с минимальным количеством лишних правок и...

Google: Gemini 3.6 Flash
Gemini 3.6 Flash — это высокоэффективная модель от Google, предназначенная для программирования, агентных рабочих процессов, а также разработки веб-сайтов и приложений. Модель создана для генерации качественных результатов с минимальным количеством лишних правок и...

Google: Gemini 3.5 Flash Lite (batch)
Gemini 3.5 Flash Lite — это высокоэффективная модель от Google с улучшенными агентными возможностями. Она подходит для субагентов, выполняющих специализированные задачи в рамках сложных многоагентных рабочих процессов.

Google: Gemini 3.5 Flash Lite
Gemini 3.5 Flash-Lite — это высокоэффективная модель от Google с улучшенными агентными возможностями. Она подходит для субагентов, выполняющих специализированные задачи в рамках сложных многоагентных рабочих процессов.
Thinking Machines: Inkling (Бесплатно)
Inkling — это мультимодальная модель с открытым весом и смесью экспертов от Thinking Machines Lab, содержащая 41 миллиард активных параметров из общего числа 975 миллиардов. Она предназначена для универсального рассуждения, программирования, создания агентных систем и использования инструментов.
Thinking Machines: Inkling
Inkling — это мультимодальная модель с открытыми весами и архитектурой mixture-of-experts от Thinking Machines Lab, содержащая 41 миллиард активных параметров из общего числа 975 миллиардов. Модель предназначена для универсального рассуждения, программирования, создания агентных систем и использования инструментов.
MoonshotAI: Kimi K3
Kimi K3 — это ультра-масштабная мультимодальная модель с открытыми весами от Moonshot AI. Она предназначена для сложного программирования, работы с знаниями и долгосрочных агентных процессов, особенно хорошо справляется с навигацией...

Meta: Muse Spark 1.1
Muse Spark 1.1 — это мультимодальная модель рассуждений от Meta, разработанная для выполнения агентных задач. Она принимает на вход текст, изображения, видео, аудио и PDF-документы и возвращает текст, поддерживая контекст до 1 миллиона токенов.
Z.ai: GLM 5.2
GLM-5.2 — флагманская модель Z.ai для задач с длительным горизонтом. Обладая действительно применимым контекстным окном в 1 миллион токенов, она способна работать с инженерным контекстом на уровне проектов, выполнять длительные задачи с повышенной надежностью и следовать сложным инструкциям.

MiniMax: MiniMax M3 (Бесплатно)
MiniMax-M3 — это мультимодальная базовая модель от MiniMax. Она поддерживает ввод текста, изображений и видео с текстовым выводом, обладает контекстным окном на 1 миллион токенов и подходит для задач с длительным горизонтом, включая агентные системы и программирование.

MiniMax: MiniMax M3
MiniMax-M3 — это мультимодальная базовая модель от MiniMax. Она поддерживает ввод текста, изображений и видео с текстовым выводом, обладает контекстным окном на 1 миллион токенов и подходит для задач с длительным горизонтом, агентных систем, программирования и других применений.

Google: Gemini 3.5 Flash (batch)
Gemini 3.5 Flash — это высокоэффективная мультимодальная модель от Google, обеспечивающая уровень программирования и рассуждений, близкий к профессиональному, с высокой скоростью и эффективностью. Модель оптимизирована для высокой производительности в программировании и параллельном агентном выполнении задач.

Google: Gemini 3.5 Flash
Gemini 3.5 Flash is Google's high-efficiency multimodal model, bringing near-Pro level coding and reasoning at Flash-tier cost and speed. It is highly optimized for coding proficiency and parallel agentic execution...

Google: Gemini 3.1 Flash Lite (batch)
Gemini 3.1 Flash Lite — это высокоэффективная мультимодальная модель Google, оптимизированная для задач с низкой задержкой и высокой нагрузкой. Она поддерживает ввод текста, изображений, видео, аудио и PDF, и предназначена для легковесных агентских приложений.

Google: Gemini 3.1 Flash Lite
Gemini 3.1 Flash Lite — это высокоэффективная мультимодальная модель Google с общедоступным выпуском, оптимизированная для задач с низкой задержкой и высокой нагрузкой. Модель поддерживает ввод текста, изображений, видео, аудио и PDF, и предназначена для использования в легких агентских приложениях.

DeepSeek: DeepSeek V4 Pro 0423
DeepSeek V4 Pro is a large-scale Mixture-of-Experts model from DeepSeek with 1.6T total parameters and 49B activated parameters, supporting a 1M-token context window. It is designed for advanced reasoning, coding,...

DeepSeek: DeepSeek V4 Flash 0423
DeepSeek V4 Flash is an efficiency-optimized Mixture-of-Experts model from DeepSeek with 284B total parameters and 13B activated parameters, supporting a 1M-token context window. It is designed for fast inference and...

Google: Gemini 3.1 Flash Lite Preview
Gemini 3.1 Flash Lite Preview — это высокоэффективная модель Google, оптимизированная для задач с высоким объемом использования. Она превосходит Gemini 2.5 Flash Lite по общему качеству и приближается к производительности Gemini 2.5 Flash по ключевым возможностям. Улучшения охватывают аудиовход/ASR, ранжирование фрагментов RAG, перевод, извлечение данных и завершение кода. Поддерживает полные уровни мышления (минимальный, низкий, средний, высокий) для точной настройки компромисса между стоимостью и производительностью. Стоит в два раза дешевле Gemini 3 Flash.

Google: Gemini 3.1 Pro Preview Custom Tools
Gemini 3.1 Pro Preview Custom Tools — это специализированная версия модели Gemini 3.1 Pro, в которой оптимизирован механизм выбора инструментов. Модель реже использует стандартный bash-инструмент в тех случаях, когда доступны более эффективные сторонние или пользовательские функции. Этот предварительный эндпоинт на alltokens значительно повышает надежность вызова функций и гарантирует, что модель выберет наиболее подходящий инструмент в сценариях с кодинг-агентами и сложными рабочими процессами, включающими множество инструментов. Модель сохраняет все ключевые преимущества Gemini 3.1 Pro, включая мультимодальное рассуждение при работе с текстом, изображениями, видео, аудио и кодом, контекстное окно объемом 1 миллион токенов и высокую производительность в задачах разработки программного обеспечения.
Похожие модели внутри подборки
Быстрые связки для углубленного сравнения: по цене, контексту и поддерживаемым API-параметрам.
Близкие по контексту
Pareto Code Router ↔ SpaceXAI: Grok 4.20 Multi-Agent (Δ 0K)
SpaceXAI: Grok 4.20 Multi-Agent ↔ SpaceXAI: Grok 4.20 (Δ 0K)
SpaceXAI: Grok 4.20 ↔ Auto Router (Δ 0K)
Z.ai: GLM 5.3 Flash ↔ DeepSeek: DeepSeek V4 Flash 0731 (Δ 0K)
DeepSeek: DeepSeek V4 Flash 0731 ↔ Meta: Llama 4 Scout (Δ 0K)
Meta: Llama 4 Scout ↔ OpenAI: GPT-5.6 Luna Pro (batch) (Δ 261K)
Близкие по параметрам
SpaceXAI: Grok 4.20 Multi-Agent ↔ Auto Router (общих: 11)
SpaceXAI: Grok 4.20 ↔ Auto Router (общих: 12)
Auto Router ↔ DeepSeek: DeepSeek V4 Flash 0731 (общих: 21)
Z.ai: GLM 5.3 Flash ↔ Auto Router (общих: 20)
Meta: Llama 4 Scout ↔ Auto Router (общих: 15)
OpenAI: GPT-5.6 Luna Pro (batch) ↔ Auto Router (общих: 9)
FAQ
Зачем нужен большой контекст?
Он позволяет модели удерживать больше информации в одном запросе и снижает необходимость агрессивной нарезки данных.
Какой порог используется в этой подборке?
В выборке показаны модели с контекстом от 200K токенов и выше.