К содержанию

Как выбрать AI-модель для работы в 2026 году

Актуальный на 11 июля разбор моделей для кода, текстов, данных, агентов и длинных документов.

Обновлено 11 июля 2026 года. Магической таблицы, после которой одна модель навсегда победила остальные, нет. За полгода модель успевает выйти, подорожать, сменить API и получить дату отключения. Выбирать надо не бренд, а конкретную рабочую задачу.

Начать надо не с модели

Самая частая ошибка — открыть рейтинг, увидеть первое место и посадить на него всю команду. Так покупают максимальную цену и всё равно получают плохой результат там, где важнее поиск, код, данные или доступ к инструментам.

Перед выбором ответьте на 4 вопроса:

  1. Что должно получиться на выходе: текст, правка кода, таблица, ответ по документам, действие в браузере?
  2. Может ли модель ошибиться без проверки человека?
  3. Какие данные вы ей отдаёте: публичные, внутренние, персональные?
  4. Что важнее именно здесь: качество, задержка, цена или воспроизводимый JSON?

После этого тестируйте не абстрактный бенчмарк, а 20–30 своих задач. Один и тот же набор. С одинаковым промптом, лимитами, инструментами и человеком, который вслепую оценивает результат. Иначе сравниваете не модели, а собственное настроение в разные дни.

Что сейчас на фронтире

На 11 июля 2026 года вокруг рабочих задач крутятся 4 семейства: Claude 4.6, GPT-5.4, Gemini 3 и открытые модели. У каждой семьи есть сильные варианты, но ни одна не закрывает всё.

Claude: сложная работа, код и редактура

Самая сильная доступная модель Anthropic — Claude Opus 4.6. Anthropic выпустили её 5 февраля и прямо позиционируют для долгих агентных задач, работы с большими кодовыми базами, ревью и сложного анализа. В API это claude-opus-4-6: $5 за миллион входных токенов и $25 за миллион выходных. У модели есть контекст до 1 млн токенов в beta и вывод до 128 тыс. токенов.1

Но Opus не надо ставить на каждый запрос. Claude Sonnet 4.6 стоит $3/$15 за миллион токенов, стал моделью по умолчанию в Claude.ai и тоже получил 1 млн токенов контекста в beta.2 Для ежедневных текстов, переписки, продуктовых документов, разбора кода и первых итераций Sonnet обычно даёт лучшее соотношение цены и результата.

Мой выбор здесь простой:

  • Sonnet 4.6 — основной рабочий режим;
  • Opus 4.6 — архитектура, тяжёлый код, сложный ресёрч и финальная проверка важного результата;
  • не выбирайте Opus, если задачу можно формализовать и отдать маленькой модели.

GPT-5.4: инструменты, данные и компьютер

GPT-5.4 вышла 5 марта. OpenAI собрали в ней сильный кодинг, рассуждение и работу с инструментами. Для API и Codex важнее другое: у неё нативный computer use, поиск инструментов и до 1 млн токенов контекста в экспериментальном режиме Codex.3

Это хороший кандидат, когда задача не заканчивается ответом в чате. Например: разобрать таблицу, собрать презентацию, пройти по нескольким внутренним системам или сделать цепочку вызовов API. Но не путайте компьютерное управление с автопилотом: модель может кликнуть не туда. На действия с деньгами, доступами, публикацией и удалением нужен явный человеческий гейт.

Стандартная цена GPT-5.4 — $2.50 за миллион входных токенов и $15 за миллион выходных. У GPT-5.4 mini — $0.75/$4.50, у nano — $0.20/$1.25.3 Mini особенно полезна для субагентов, классификации, извлечения полей и простых правок: дешёвый этап не должен сжигать бюджет флагманом.

Gemini: большой контекст и мультимодальность

Gemini 3.1 Pro — вариант для длинных документов, изображений, видео и задач, где модели надо собрать много разных источников в один вывод. У неё входной контекст до 1 млн токенов, 64 тыс. токенов на ответ, поддержка code execution, function calling, search grounding и URL context.4

Есть важная оговорка: на 11 июля это gemini-3.1-pro-preview, то есть preview. В продакшене нельзя строить критичный маршрут вокруг модели, которую провайдер вправе поменять или снять. Google отдельно ведёт страницу жизненного цикла моделей — проверяйте её перед запуском.5

Цена Gemini 3.1 Pro — $2/$12 за миллион токенов при запросах до 200 тыс. токенов; выше порога — $4/$18. Кэширование стоит заметно дешевле, и это важно для длинных повторяющихся контекстов.6

Большой контекст не отменяет инженерную работу. Документ на миллион токенов можно положить в запрос, но это не гарантирует, что модель одинаково хорошо найдёт каждую деталь. Для регулярной базы знаний нужны поиск, ссылки на источники, тестовый набор вопросов и проверка цитат. Не романтика, зато потом не приходится объяснять, почему ассистент придумал пункт договора.

Открытые модели: когда нужен контроль

Открытая модель нужна не потому, что она бесплатная. На ней есть расходы на GPU, инференс, мониторинг, обновления, безопасность и человека, который всё это не бросит через 2 недели.

Она оправдана, когда данные не должны уходить внешнему провайдеру, нагрузка высокая и предсказуемая или вам нужен контроль над версией модели. Во всех остальных случаях сначала посчитайте total cost: API-счёт часто дешевле собственной инфраструктуры, которую команда героически собрала, а потом боится обновлять.

Для локальных и открытых моделей не копируйте чужой рейтинг. Прогоните свой датасет: русский язык, ваши документы, реальные форматы, ваши лимиты задержки. Только после этого решайте.

Выбор по задачам

Код

Для сложной разработки начните с Claude Opus 4.6 или GPT-5.4. Первый хорош там, где нужен план, работа по большой кодовой базе и внимательное ревью. Второй — когда агенту надо не только писать код, но и ходить в инструменты и окружение.

Для ежедневных правок и субагентов сначала попробуйте Sonnet 4.6 или GPT-5.4 mini. Разница в цене быстро становится заметной, а задачи типа поиска файла, написания теста или извлечения данных не всегда требуют максимального reasoning.

Ни один из этих вариантов не освобождает от тестов, линтера и code review. Модель пишет правдоподобный код. Это не то же самое, что рабочий код.

Тексты и продуктовая работа

Для черновиков, редактуры, продуктовых документов и сложной переписки я бы начинал с Sonnet 4.6. Дальше важнее не модель, а ваш процесс: кто задаёт контекст, где лежат примеры тона, кто отвечает за факты и как вы не публикуете сгенерированную ерунду в прод.

Opus 4.6 имеет смысл включать на финальный проход: стратегия, большой документ с противоречиями, критический текст, архитектурное решение. Не на письмо из 3 абзацев. Там это дорогой способ почувствовать себя серьёзным.

Таблицы, анализ и документы

GPT-5.4 хорош, когда модели надо подготовить не только ответ, но и артефакт: таблицу, документ, презентацию, расчёт. Gemini 3.1 Pro берите, когда вход смешанный и большой: длинные PDF, изображения, видео, пачка материалов.

В обоих случаях фиксируйте исходные данные, формулу и итоговые цифры отдельно от текста модели. Иначе вы не отличите ошибку в данных от ошибки в рассуждении.

Поиск по базе знаний

Не начинайте с fine-tuning. Для внутренней базы почти всегда сначала хватает RAG: документы режутся на фрагменты, поиск выбирает релевантные, а модель отвечает только с ссылками на найденные источники.

Длинный контекст подходит для разовой работы с одним договором или отчётом. RAG — для постоянно меняющейся базы. Fine-tuning нужен сильно реже, чем продают: например, когда нужен стабильный формат ответа или узкий повторяющийся паттерн, который не вытягивается промптом и примерами.

Агентные сценарии

Здесь важнее не лидерборд, а предсказуемость: валидные вызовы инструментов, ограничения прав, логи, повторяемость, fallback и человеческое подтверждение для опасных шагов.

GPT-5.4, Claude 4.6 и Gemini 3.1 Pro умеют работать с инструментами. Выбирать надо на вашем наборе tool calls. Возьмите 10 реальных цепочек, добавьте намеренно сломанные ответы инструментов и посмотрите: модель исправляет ситуацию, запрашивает уточнение или с улыбкой продолжает ломать систему.

Как собрать рабочий стек

Не нужно выбирать одного победителя. Нормальная схема выглядит так:

СлойЧто поставить
Основная модель для командыClaude Sonnet 4.6 или GPT-5.4
Сложные задачи и финальная проверкаClaude Opus 4.6 или GPT-5.4
Длинные мультимодальные материалыGemini 3.1 Pro Preview после отдельного теста
Массовые простые запросыGPT-5.4 mini или nano
Резервный маршрутМодель другого провайдера с тем же контрактом ответа

Роутинг не надо строить в первый день. Сначала соберите логи: тип задачи, модель, цена, задержка, оценка качества, ошибки. Через месяц будет видно, где действительно нужен второй провайдер, а где вы собирались строить космодром ради одного try/catch.

Минимальная проверка перед продом

  1. Соберите 20–30 реальных задач, а не демо-промпты.
  2. Оцените качество вслепую и зафиксируйте критерии заранее.
  3. Посчитайте полную цену: вход, выход, reasoning, инструменты, поиск, retry.
  4. Проверьте доступы и правила хранения данных с безопасностью и юристом.
  5. Добавьте логи, лимиты, fallback и ручной гейт для необратимых действий.
  6. Смотрите на дату модели и её lifecycle. Preview и снятый endpoint — плохая основа для обещаний клиенту.

Как итог

На 11 июля 2026 я бы не искал одну лучшую модель.

  • Claude Sonnet 4.6 — первая попытка для большинства рабочих задач.
  • Claude Opus 4.6 — когда задача сложная и цена ошибки заметна.
  • GPT-5.4 — когда нужны инструменты, документы, анализ и работа за компьютером.
  • GPT-5.4 mini/nano — когда задача простая, массовая или это субагент.
  • Gemini 3.1 Pro — длинный мультимодальный контекст, но с поправкой на preview.

Через квартал этот список частично устареет. И это нормально. Если у вас есть свой тестовый набор и логи, обновление модели занимает день. Если нет — вы снова выбираете по чужому твиту. Там обычно и начинается херня.

Источники

  1. Introducing Claude Opus 4.6 — Anthropic, 5 февраля 2026.

  2. Introducing Claude Sonnet 4.6 — Anthropic, 17 февраля 2026.

  3. Introducing GPT-5.4 и GPT-5.4 mini and nano — OpenAI, март 2026.

  4. Gemini 3.1 Pro Preview — Google AI for Developers.

  5. Gemini model deprecations — Google AI for Developers.

  6. Gemini Developer API pricing — Google AI for Developers.