← Все статьи

Opus или Sonnet: что выбрать под задачу

Мы прогнали пять типовых рабочих задач на Haiku 4.5, Sonnet 5 и Opus 5 по три раза каждую — 48 замеров. Вот что показали цифры, а не ощущения.

Замер от 14 сентября 2026 · 48 прогонов и 87 рабочих сессий · обновляем ежемесячно

Короткий ответ

На четырёх задачах из пяти разницы нет. Извлечение данных, сводка текста, запрос к базе, починка кода — все три модели справились одинаково, все три прогона из трёх. При этом Haiku дешевле Opus в шесть раз.

Разница появляется там, где нужно суждение. На классификации запросов Opus прошёл порог 3 раза из 3, Sonnet — 1 раз из 3, Haiku — ни разу.

Правило простое: механическая работа — младшая модель, неоднозначные решения — старшая.

Сколько стоит одна задача

Opus или Sonnet: что выбрать под задачу — 48 замеров | ДвояHaiku 4.5$0.034Sonnet 5$0.094Opus 5$0.205
Медиана по пяти задачам. Разрыв между младшей и старшей — шестикратный.

Разрыв в прайсе за миллион токенов — пятикратный: $1 у Haiku, $2 у Sonnet, $5 у Opus. На живых задачах он превращается в шестикратный, потому что старшие модели ещё и рассуждают дольше, а значит пишут больше токенов на выходе.

Где модели действительно расходятся

Закрашенный квадрат — прогон уложился в критерий задачи. Критерии машинные: JSON проверяется валидатором схемы, ответы к базе сверяются с эталоном, починенный скрипт запускается и его вывод сравнивается с правильным.

Opus или Sonnet: что выбрать под задачу — 48 замеров | ДвояHaikuSonnetOpusКлассификация запросов0/31/33/3Извлечение данных3/33/33/3Сводка текста3/33/33/3Ответ по базе3/33/33/3Починка кода3/33/33/3
Одна задача из пяти делит модели. Остальные четыре — ничья.

На чём именно сыплются модели

Это самая интересная часть замера. Мы разобрали каждую ошибку на классификации запросов — той единственной задаче, где модели разошлись.

МодельЗапросов с ошибкой (из 50)Прошло прогонов
Haiku 4.5130 из 3
Sonnet 5101 из 3
Opus 543 из 3

Чего не понимает младшая модель

Haiku устойчиво, во всех трёх прогонах, относила к информационным запросы, которые на деле коммерческие:

  • «базы отдыха в калужской области» — человек выбирает, где забронировать. Haiku решила, что он изучает вопрос.
  • «отдых на выходные в калужской области» — то же самое.
  • «как оплатить chatgpt из россии» — здесь наоборот: Haiku увидела коммерцию там, где человек ищет инструкцию.

Закономерность видна: младшая модель цепляется за форму запроса, а не за намерение за ним. Там, где нет слов «купить» или «цена», она по умолчанию считает запрос информационным — и для регионального бизнеса это дорогая ошибка, потому что именно такие фразы приводят клиентов.

Что оказалось трудным для всех трёх

Два запроса из пятидесяти завалили все модели, включая Opus:

  • «рыбалка с детьми подмосковье» — все три сочли информационным. По нашей разметке это коммерческий: так ищут базу отдыха, а не статью о рыбалке.
  • «аура база отдыха отзывы» — все три сочли информационным, хотя человек ищет конкретный объект по названию, то есть запрос навигационный.

Честно скажем: это спорные случаи, где и два SEO-специалиста разойдутся во мнении. Но именно поэтому они полезны — показывают границу, за которой машине нужна ваша разметка, а не здравый смысл вообще.

Почему три прогона, а не один

После первого круга Sonnet и Opus выглядели равными — оба дали 0,94. Три повтора показали другое: Sonnet прошёл порог один раз из трёх. Один замер не отличает стабильную модель от везучей. Если вам показывают сравнение без числа повторов — это не сравнение.

Главная ошибка при выборе модели

Обычный совет звучит так: «возьмите модель попроще и сэкономите». Мы разобрали месяц живой работы — 87 сессий, 24 110 ответов модели — и увидели, что экономия выходит не там, где её ищут.

Opus или Sonnet: что выбрать под задачу — 48 замеров | Двоя48.1%44.7%Чтение из кэшаЗапись в кэшГенерация ответаНа что уходит счёт: 92,8% — переотправка контекста
Генерация текста — 7,2% счёта. Всё остальное — перечитывание истории диалога.
МодельЦена вызова в работеКонтекст на вызовПрайс входа
Opus 5$0,2594273 000 токенов$5 / млн
Sonnet 5$0,2421332 000 токенов$2 / млн

Sonnet дешевле Opus по прайсу в 2,5 раза. В реальной работе — на 6,7%, потому что уходит в ещё более длинный контекст. Вы платите за длину диалога, а не за букву в названии модели.

Миф: сменил Opus на Sonnet — счёт упал втрое.

Факт: счёт упал на 6,7%. Втрое он падает, когда вы режете историю диалога, а не когда меняете модель.

Длинный контекст — отдельная история

Шестым заданием мы дали документ на 129 тысяч токенов — 1 400 однотипных разделов, внутри которых спрятано одно кодовое слово. Нашли все три модели. Но вот цена:

МодельСтоимость прогонаВремяПрочитано токенов
Haiku 4.5$0,03314 с33 000
Sonnet 5$0,43978 с219 000
Opus 5$1,098106 с219 000

Обратите внимание на строку Haiku: 33 тысячи токенов вместо 219 тысяч. Она не читала документ — нашла слово поиском по файлу. Ответ верный, задача решена дешевле всех в 33 раза. Но как тест длинного контекста этот прогон не засчитан: мы мерили не то, что хотели померить.

Практический вывод отсюда важнее самого замера: если у модели есть инструменты, она решит задачу инструментом, а не рассуждением. Часто это именно то, что нужно — но тогда и платить за старшую модель незачем.

Полная таблица замера

Цена и время — медианы трёх прогонов. Балл — доля выполненного критерия.

ЗадачаHaiku 4.5Sonnet 5Opus 5
Классификация запросов 0,84 · $0,035 · 30 с 0,88 · $0,111 · 95 с 0,96 · $0,234 · 89 с
Извлечение данных 1,00 · $0,035 · 24 с1,00 · $0,095 · 25 с1,00 · $0,209 · 31 с
Сводка текста 1,00 · $0,034 · 18 с1,00 · $0,093 · 19 с1,00 · $0,203 · 19 с
Ответ по базе 1,00 · $0,034 · 17 с1,00 · $0,094 · 20 с1,00 · $0,202 · 18 с
Починка кода 1,00 · $0,033 · 12 с1,00 · $0,091 · 11 с1,00 · $0,205 · 18 с
Поиск в документе 129k 1,00 · $0,033 · 14 с1,00 · $0,439 · 78 с1,00 · $1,098 · 106 с

Любопытная деталь: на классификации Sonnet оказался медленнее Opus — 95 секунд против 89. Более простая модель дольше думала и при этом чаще ошибалась. Дешевле — не значит быстрее.

Как выбирать: короткий чек-лист

  • Задача механическая — разобрать, извлечь, переформатировать, починить простой код? Берите младшую модель. Разницы в результате нет, экономия шестикратная.
  • Нужно решить, что человек имел в виду, или выбрать между равнозначными вариантами? Берите старшую — здесь разрыв реальный.
  • Задача про поиск в большом документе? Дайте модели инструмент поиска — и берите младшую. Полное чтение стоит в 33 раза дороже и не даёт ничего сверху.
  • Диалог длинный и растёт? Сначала режьте историю, потом думайте о модели. Это даёт больше любой замены.
  • Сомневаетесь? Прогоните свою задачу три раза на каждой модели. Один прогон ничего не доказывает.

Что мы мерили

Пять задач, которые агент делает у нас каждый день:

  1. Классификация запросов — 50 поисковых фраз разложить на коммерческие, информационные и навигационные.
  2. Извлечение данных — пять заявок свободным текстом превратить в JSON по схеме.
  3. Сводка текста — деловую статью сжать в пять пунктов, не потеряв ни одного числа.
  4. Ответ по базе — пять вопросов к SQLite, ответом должно быть значение, а не запрос.
  5. Починка кода — падающий Python привести в рабочее состояние.

Как повторить замер у себя

Метод простой, и вам не нужен наш стенд — достаточно соблюсти четыре правила.

  1. Возьмите свои задачи, а не чужой бенчмарк. Модель, которая выигрывает олимпиадную математику, может сыпаться на ваших заявках — и наоборот.
  2. Придумайте машинный критерий. «Ответ выглядит хорошо» — не критерий. Нужна проверка, которую выполнит скрипт: схема, эталонное значение, запуск кода. Задача без такой проверки в замер не берётся.
  3. Держите условия одинаковыми. Один и тот же промпт без правок под модель, чистый контекст на каждый запуск, одинаковый набор инструментов.
  4. Повторяйте трижды и берите медиану. Именно повторы показали нам, что Sonnet нестабилен — на одном прогоне этого не видно.

Частые вопросы

Значит, Opus вообще не нужен?

Нужен там, где решение неоднозначно. В нашем замере это одна задача из шести, но именно она — самая дорогая по последствиям: неверно понятый интент запроса уводит целую страницу не в ту сторону.

А Sonnet — компромисс между ними?

По нашим цифрам — нет. На простых задачах он не лучше Haiku, но дороже втрое. На сложной прошёл порог один раз из трёх. Компромисс получается неустойчивым: либо берите младшую и экономьте, либо старшую и получайте стабильность.

Почему у вас цены не совпадают с прайсом?

В прайсе цена за миллион токенов, а в работе вы платите за конкретный вызов с конкретным контекстом. Мы показываем второе — потому что счёт приходит именно за это. Наши числа — нижняя граница: способ замера не разделяет вход и выход, а выход дороже впятеро.

Как быстро окупается смена модели?

Если у вас тысяча механических задач в месяц, переход со старшей модели на младшую экономит около 170 долларов. Если задачи сложные — экономия обернётся переделками. Посчитайте на калькуляторе ниже.

Можно ли доверять замеру, который сделан на одной линейке моделей?

Внутри линейки — да, условия одинаковы. Для сравнения с другими вендорами нужен отдельный стенд с их API, и мы его не делали. Публиковать чужие числа, которых сами не мерили, не будем.

Как часто вы обновляете цифры?

Раз в месяц и при выходе новой модели. Дата последнего замера стоит вверху страницы — если она старая, значит мы ещё не прогнали новый круг.

Честные оговорки

  • Цены — нижняя граница: способ замера отдаёт суммарные токены без разбивки на вход и выход, а выход дороже впятеро.
  • Задачу с длинным документом гоняли один раз, а не три.
  • На ней же Haiku нашла ответ поиском по файлу, а не чтением — ответ верный, но как тест длинного контекста прогон не засчитан.
  • Разметка интентов — наша. На спорных запросах другой специалист мог бы разметить иначе, и тогда часть «ошибок» перестала бы быть ошибками.
  • Сравнение только внутри линейки Anthropic. Чужие модели мы не гоняли и не публикуем чисел, которых сами не измеряли.

Как мы ловим собственные ошибки

В первой версии стенда правильные ответы лежали прямо во входном файле — модель могла их списать. Дефект нашла сама модель во время прогона и отказалась считать замер действительным.

После разделения входа и эталона результат Haiku на классификации упал с 1,00 до 0,78. Эти 0,22 балла и были списыванием. С тех пор правило: вход задачи не должен содержать ответа, и это проверяется перед каждым добавлением задачи в стенд.

Вторую ошибку мы нашли в задании на извлечение данных: схема требовала дату обязательно, а в одной из заявок даты не было вовсе — «в ноябре, дата плавающая». Модель честно поставила пустое значение и не прошла проверку. Мы исправили формулировку задания, а не оценку.

Посчитайте свой счёт

Введите, сколько таких задач у вас в месяц — покажем прогноз по каждой модели и предупредим, если дешёвая на вашей задаче не справляется.

Мы считаем эти цифры, потому что сами платим по ним каждый день. Нужен ИИ-агент, который работает на ваших задачах и не жжёт бюджет впустую — напишите нам.