Как выбрать AI-модель для работы в 2026 году
Актуальный на 11 июля разбор моделей для кода, текстов, данных, агентов и длинных документов.
Обновлено 11 июля 2026 года. Магической таблицы, после которой одна модель навсегда победила остальные, нет. За полгода модель успевает выйти, подорожать, сменить API и получить дату отключения. Выбирать надо не бренд, а конкретную рабочую задачу.
Начать надо не с модели
Самая частая ошибка — открыть рейтинг, увидеть первое место и посадить на него всю команду. Так покупают максимальную цену и всё равно получают плохой результат там, где важнее поиск, код, данные или доступ к инструментам.
Перед выбором ответьте на 4 вопроса:
- Что должно получиться на выходе: текст, правка кода, таблица, ответ по документам, действие в браузере?
- Может ли модель ошибиться без проверки человека?
- Какие данные вы ей отдаёте: публичные, внутренние, персональные?
- Что важнее именно здесь: качество, задержка, цена или воспроизводимый JSON?
После этого тестируйте не абстрактный бенчмарк, а 20–30 своих задач. Один и тот же набор. С одинаковым промптом, лимитами, инструментами и человеком, который вслепую оценивает результат. Иначе сравниваете не модели, а собственное настроение в разные дни.
Что сейчас на фронтире
На 11 июля 2026 года вокруг рабочих задач крутятся 4 семейства: Claude 4.6, GPT-5.4, Gemini 3 и открытые модели. У каждой семьи есть сильные варианты, но ни одна не закрывает всё.
Claude: сложная работа, код и редактура
Самая сильная доступная модель Anthropic — Claude Opus 4.6. Anthropic выпустили её 5 февраля и прямо позиционируют для долгих агентных задач, работы с большими кодовыми базами, ревью и сложного анализа. В API это claude-opus-4-6: $5 за миллион входных токенов и $25 за миллион выходных. У модели есть контекст до 1 млн токенов в beta и вывод до 128 тыс. токенов.1
Но Opus не надо ставить на каждый запрос. Claude Sonnet 4.6 стоит $3/$15 за миллион токенов, стал моделью по умолчанию в Claude.ai и тоже получил 1 млн токенов контекста в beta.2 Для ежедневных текстов, переписки, продуктовых документов, разбора кода и первых итераций Sonnet обычно даёт лучшее соотношение цены и результата.
Мой выбор здесь простой:
- Sonnet 4.6 — основной рабочий режим;
- Opus 4.6 — архитектура, тяжёлый код, сложный ресёрч и финальная проверка важного результата;
- не выбирайте Opus, если задачу можно формализовать и отдать маленькой модели.
GPT-5.4: инструменты, данные и компьютер
GPT-5.4 вышла 5 марта. OpenAI собрали в ней сильный кодинг, рассуждение и работу с инструментами. Для API и Codex важнее другое: у неё нативный computer use, поиск инструментов и до 1 млн токенов контекста в экспериментальном режиме Codex.3
Это хороший кандидат, когда задача не заканчивается ответом в чате. Например: разобрать таблицу, собрать презентацию, пройти по нескольким внутренним системам или сделать цепочку вызовов API. Но не путайте компьютерное управление с автопилотом: модель может кликнуть не туда. На действия с деньгами, доступами, публикацией и удалением нужен явный человеческий гейт.
Стандартная цена GPT-5.4 — $2.50 за миллион входных токенов и $15 за миллион выходных. У GPT-5.4 mini — $0.75/$4.50, у nano — $0.20/$1.25.3 Mini особенно полезна для субагентов, классификации, извлечения полей и простых правок: дешёвый этап не должен сжигать бюджет флагманом.
Gemini: большой контекст и мультимодальность
Gemini 3.1 Pro — вариант для длинных документов, изображений, видео и задач, где модели надо собрать много разных источников в один вывод. У неё входной контекст до 1 млн токенов, 64 тыс. токенов на ответ, поддержка code execution, function calling, search grounding и URL context.4
Есть важная оговорка: на 11 июля это gemini-3.1-pro-preview, то есть preview. В продакшене нельзя строить критичный маршрут вокруг модели, которую провайдер вправе поменять или снять. Google отдельно ведёт страницу жизненного цикла моделей — проверяйте её перед запуском.5
Цена Gemini 3.1 Pro — $2/$12 за миллион токенов при запросах до 200 тыс. токенов; выше порога — $4/$18. Кэширование стоит заметно дешевле, и это важно для длинных повторяющихся контекстов.6
Большой контекст не отменяет инженерную работу. Документ на миллион токенов можно положить в запрос, но это не гарантирует, что модель одинаково хорошо найдёт каждую деталь. Для регулярной базы знаний нужны поиск, ссылки на источники, тестовый набор вопросов и проверка цитат. Не романтика, зато потом не приходится объяснять, почему ассистент придумал пункт договора.
Открытые модели: когда нужен контроль
Открытая модель нужна не потому, что она бесплатная. На ней есть расходы на GPU, инференс, мониторинг, обновления, безопасность и человека, который всё это не бросит через 2 недели.
Она оправдана, когда данные не должны уходить внешнему провайдеру, нагрузка высокая и предсказуемая или вам нужен контроль над версией модели. Во всех остальных случаях сначала посчитайте total cost: API-счёт часто дешевле собственной инфраструктуры, которую команда героически собрала, а потом боится обновлять.
Для локальных и открытых моделей не копируйте чужой рейтинг. Прогоните свой датасет: русский язык, ваши документы, реальные форматы, ваши лимиты задержки. Только после этого решайте.
Выбор по задачам
Код
Для сложной разработки начните с Claude Opus 4.6 или GPT-5.4. Первый хорош там, где нужен план, работа по большой кодовой базе и внимательное ревью. Второй — когда агенту надо не только писать код, но и ходить в инструменты и окружение.
Для ежедневных правок и субагентов сначала попробуйте Sonnet 4.6 или GPT-5.4 mini. Разница в цене быстро становится заметной, а задачи типа поиска файла, написания теста или извлечения данных не всегда требуют максимального reasoning.
Ни один из этих вариантов не освобождает от тестов, линтера и code review. Модель пишет правдоподобный код. Это не то же самое, что рабочий код.
Тексты и продуктовая работа
Для черновиков, редактуры, продуктовых документов и сложной переписки я бы начинал с Sonnet 4.6. Дальше важнее не модель, а ваш процесс: кто задаёт контекст, где лежат примеры тона, кто отвечает за факты и как вы не публикуете сгенерированную ерунду в прод.
Opus 4.6 имеет смысл включать на финальный проход: стратегия, большой документ с противоречиями, критический текст, архитектурное решение. Не на письмо из 3 абзацев. Там это дорогой способ почувствовать себя серьёзным.
Таблицы, анализ и документы
GPT-5.4 хорош, когда модели надо подготовить не только ответ, но и артефакт: таблицу, документ, презентацию, расчёт. Gemini 3.1 Pro берите, когда вход смешанный и большой: длинные PDF, изображения, видео, пачка материалов.
В обоих случаях фиксируйте исходные данные, формулу и итоговые цифры отдельно от текста модели. Иначе вы не отличите ошибку в данных от ошибки в рассуждении.
Поиск по базе знаний
Не начинайте с fine-tuning. Для внутренней базы почти всегда сначала хватает RAG: документы режутся на фрагменты, поиск выбирает релевантные, а модель отвечает только с ссылками на найденные источники.
Длинный контекст подходит для разовой работы с одним договором или отчётом. RAG — для постоянно меняющейся базы. Fine-tuning нужен сильно реже, чем продают: например, когда нужен стабильный формат ответа или узкий повторяющийся паттерн, который не вытягивается промптом и примерами.
Агентные сценарии
Здесь важнее не лидерборд, а предсказуемость: валидные вызовы инструментов, ограничения прав, логи, повторяемость, fallback и человеческое подтверждение для опасных шагов.
GPT-5.4, Claude 4.6 и Gemini 3.1 Pro умеют работать с инструментами. Выбирать надо на вашем наборе tool calls. Возьмите 10 реальных цепочек, добавьте намеренно сломанные ответы инструментов и посмотрите: модель исправляет ситуацию, запрашивает уточнение или с улыбкой продолжает ломать систему.
Как собрать рабочий стек
Не нужно выбирать одного победителя. Нормальная схема выглядит так:
| Слой | Что поставить |
|---|---|
| Основная модель для команды | Claude Sonnet 4.6 или GPT-5.4 |
| Сложные задачи и финальная проверка | Claude Opus 4.6 или GPT-5.4 |
| Длинные мультимодальные материалы | Gemini 3.1 Pro Preview после отдельного теста |
| Массовые простые запросы | GPT-5.4 mini или nano |
| Резервный маршрут | Модель другого провайдера с тем же контрактом ответа |
Роутинг не надо строить в первый день. Сначала соберите логи: тип задачи, модель, цена, задержка, оценка качества, ошибки. Через месяц будет видно, где действительно нужен второй провайдер, а где вы собирались строить космодром ради одного try/catch.
Минимальная проверка перед продом
- Соберите 20–30 реальных задач, а не демо-промпты.
- Оцените качество вслепую и зафиксируйте критерии заранее.
- Посчитайте полную цену: вход, выход, reasoning, инструменты, поиск, retry.
- Проверьте доступы и правила хранения данных с безопасностью и юристом.
- Добавьте логи, лимиты, fallback и ручной гейт для необратимых действий.
- Смотрите на дату модели и её lifecycle. Preview и снятый endpoint — плохая основа для обещаний клиенту.
Как итог
На 11 июля 2026 я бы не искал одну лучшую модель.
- Claude Sonnet 4.6 — первая попытка для большинства рабочих задач.
- Claude Opus 4.6 — когда задача сложная и цена ошибки заметна.
- GPT-5.4 — когда нужны инструменты, документы, анализ и работа за компьютером.
- GPT-5.4 mini/nano — когда задача простая, массовая или это субагент.
- Gemini 3.1 Pro — длинный мультимодальный контекст, но с поправкой на preview.
Через квартал этот список частично устареет. И это нормально. Если у вас есть свой тестовый набор и логи, обновление модели занимает день. Если нет — вы снова выбираете по чужому твиту. Там обычно и начинается херня.
Источники
-
Introducing Claude Opus 4.6 — Anthropic, 5 февраля 2026.
-
Introducing Claude Sonnet 4.6 — Anthropic, 17 февраля 2026.
-
Introducing GPT-5.4 и GPT-5.4 mini and nano — OpenAI, март 2026.
-
Gemini 3.1 Pro Preview — Google AI for Developers.
-
Gemini model deprecations — Google AI for Developers.
-
Gemini Developer API pricing — Google AI for Developers.