Замер от 14 сентября 2026 · 48 прогонов и 87 рабочих сессий · обновляем ежемесячно
Короткий ответ
На четырёх задачах из пяти разницы нет. Извлечение данных, сводка текста, запрос к базе, починка кода — все три модели справились одинаково, все три прогона из трёх. При этом Haiku дешевле Opus в шесть раз.
Разница появляется там, где нужно суждение. На классификации запросов Opus прошёл порог 3 раза из 3, Sonnet — 1 раз из 3, Haiku — ни разу.
Правило простое: механическая работа — младшая модель, неоднозначные решения — старшая.
Сколько стоит одна задача
Разрыв в прайсе за миллион токенов — пятикратный: $1 у Haiku, $2 у Sonnet, $5 у Opus. На живых задачах он превращается в шестикратный, потому что старшие модели ещё и рассуждают дольше, а значит пишут больше токенов на выходе.
Где модели действительно расходятся
Закрашенный квадрат — прогон уложился в критерий задачи. Критерии машинные: JSON проверяется валидатором схемы, ответы к базе сверяются с эталоном, починенный скрипт запускается и его вывод сравнивается с правильным.
На чём именно сыплются модели
Это самая интересная часть замера. Мы разобрали каждую ошибку на классификации запросов — той единственной задаче, где модели разошлись.
| Модель | Запросов с ошибкой (из 50) | Прошло прогонов |
|---|---|---|
| Haiku 4.5 | 13 | 0 из 3 |
| Sonnet 5 | 10 | 1 из 3 |
| Opus 5 | 4 | 3 из 3 |
Чего не понимает младшая модель
Haiku устойчиво, во всех трёх прогонах, относила к информационным запросы, которые на деле коммерческие:
- «базы отдыха в калужской области» — человек выбирает, где забронировать. Haiku решила, что он изучает вопрос.
- «отдых на выходные в калужской области» — то же самое.
- «как оплатить chatgpt из россии» — здесь наоборот: Haiku увидела коммерцию там, где человек ищет инструкцию.
Закономерность видна: младшая модель цепляется за форму запроса, а не за намерение за ним. Там, где нет слов «купить» или «цена», она по умолчанию считает запрос информационным — и для регионального бизнеса это дорогая ошибка, потому что именно такие фразы приводят клиентов.
Что оказалось трудным для всех трёх
Два запроса из пятидесяти завалили все модели, включая Opus:
- «рыбалка с детьми подмосковье» — все три сочли информационным. По нашей разметке это коммерческий: так ищут базу отдыха, а не статью о рыбалке.
- «аура база отдыха отзывы» — все три сочли информационным, хотя человек ищет конкретный объект по названию, то есть запрос навигационный.
Честно скажем: это спорные случаи, где и два SEO-специалиста разойдутся во мнении. Но именно поэтому они полезны — показывают границу, за которой машине нужна ваша разметка, а не здравый смысл вообще.
Почему три прогона, а не один
После первого круга Sonnet и Opus выглядели равными — оба дали 0,94. Три повтора показали другое: Sonnet прошёл порог один раз из трёх. Один замер не отличает стабильную модель от везучей. Если вам показывают сравнение без числа повторов — это не сравнение.
Главная ошибка при выборе модели
Обычный совет звучит так: «возьмите модель попроще и сэкономите». Мы разобрали месяц живой работы — 87 сессий, 24 110 ответов модели — и увидели, что экономия выходит не там, где её ищут.
| Модель | Цена вызова в работе | Контекст на вызов | Прайс входа |
|---|---|---|---|
| Opus 5 | $0,2594 | 273 000 токенов | $5 / млн |
| Sonnet 5 | $0,2421 | 332 000 токенов | $2 / млн |
Sonnet дешевле Opus по прайсу в 2,5 раза. В реальной работе — на 6,7%, потому что уходит в ещё более длинный контекст. Вы платите за длину диалога, а не за букву в названии модели.
Миф: сменил Opus на Sonnet — счёт упал втрое.
Факт: счёт упал на 6,7%. Втрое он падает, когда вы режете историю диалога, а не когда меняете модель.
Длинный контекст — отдельная история
Шестым заданием мы дали документ на 129 тысяч токенов — 1 400 однотипных разделов, внутри которых спрятано одно кодовое слово. Нашли все три модели. Но вот цена:
| Модель | Стоимость прогона | Время | Прочитано токенов |
|---|---|---|---|
| Haiku 4.5 | $0,033 | 14 с | 33 000 |
| Sonnet 5 | $0,439 | 78 с | 219 000 |
| Opus 5 | $1,098 | 106 с | 219 000 |
Обратите внимание на строку Haiku: 33 тысячи токенов вместо 219 тысяч. Она не читала документ — нашла слово поиском по файлу. Ответ верный, задача решена дешевле всех в 33 раза. Но как тест длинного контекста этот прогон не засчитан: мы мерили не то, что хотели померить.
Практический вывод отсюда важнее самого замера: если у модели есть инструменты, она решит задачу инструментом, а не рассуждением. Часто это именно то, что нужно — но тогда и платить за старшую модель незачем.
Полная таблица замера
Цена и время — медианы трёх прогонов. Балл — доля выполненного критерия.
| Задача | Haiku 4.5 | Sonnet 5 | Opus 5 |
|---|---|---|---|
| Классификация запросов | 0,84 · $0,035 · 30 с | 0,88 · $0,111 · 95 с | 0,96 · $0,234 · 89 с |
| Извлечение данных | 1,00 · $0,035 · 24 с | 1,00 · $0,095 · 25 с | 1,00 · $0,209 · 31 с |
| Сводка текста | 1,00 · $0,034 · 18 с | 1,00 · $0,093 · 19 с | 1,00 · $0,203 · 19 с |
| Ответ по базе | 1,00 · $0,034 · 17 с | 1,00 · $0,094 · 20 с | 1,00 · $0,202 · 18 с |
| Починка кода | 1,00 · $0,033 · 12 с | 1,00 · $0,091 · 11 с | 1,00 · $0,205 · 18 с |
| Поиск в документе 129k | 1,00 · $0,033 · 14 с | 1,00 · $0,439 · 78 с | 1,00 · $1,098 · 106 с |
Любопытная деталь: на классификации Sonnet оказался медленнее Opus — 95 секунд против 89. Более простая модель дольше думала и при этом чаще ошибалась. Дешевле — не значит быстрее.
Как выбирать: короткий чек-лист
- Задача механическая — разобрать, извлечь, переформатировать, починить простой код? Берите младшую модель. Разницы в результате нет, экономия шестикратная.
- Нужно решить, что человек имел в виду, или выбрать между равнозначными вариантами? Берите старшую — здесь разрыв реальный.
- Задача про поиск в большом документе? Дайте модели инструмент поиска — и берите младшую. Полное чтение стоит в 33 раза дороже и не даёт ничего сверху.
- Диалог длинный и растёт? Сначала режьте историю, потом думайте о модели. Это даёт больше любой замены.
- Сомневаетесь? Прогоните свою задачу три раза на каждой модели. Один прогон ничего не доказывает.
Что мы мерили
Пять задач, которые агент делает у нас каждый день:
- Классификация запросов — 50 поисковых фраз разложить на коммерческие, информационные и навигационные.
- Извлечение данных — пять заявок свободным текстом превратить в JSON по схеме.
- Сводка текста — деловую статью сжать в пять пунктов, не потеряв ни одного числа.
- Ответ по базе — пять вопросов к SQLite, ответом должно быть значение, а не запрос.
- Починка кода — падающий Python привести в рабочее состояние.
Как повторить замер у себя
Метод простой, и вам не нужен наш стенд — достаточно соблюсти четыре правила.
- Возьмите свои задачи, а не чужой бенчмарк. Модель, которая выигрывает олимпиадную математику, может сыпаться на ваших заявках — и наоборот.
- Придумайте машинный критерий. «Ответ выглядит хорошо» — не критерий. Нужна проверка, которую выполнит скрипт: схема, эталонное значение, запуск кода. Задача без такой проверки в замер не берётся.
- Держите условия одинаковыми. Один и тот же промпт без правок под модель, чистый контекст на каждый запуск, одинаковый набор инструментов.
- Повторяйте трижды и берите медиану. Именно повторы показали нам, что Sonnet нестабилен — на одном прогоне этого не видно.
Частые вопросы
Значит, Opus вообще не нужен?
Нужен там, где решение неоднозначно. В нашем замере это одна задача из шести, но именно она — самая дорогая по последствиям: неверно понятый интент запроса уводит целую страницу не в ту сторону.
А Sonnet — компромисс между ними?
По нашим цифрам — нет. На простых задачах он не лучше Haiku, но дороже втрое. На сложной прошёл порог один раз из трёх. Компромисс получается неустойчивым: либо берите младшую и экономьте, либо старшую и получайте стабильность.
Почему у вас цены не совпадают с прайсом?
В прайсе цена за миллион токенов, а в работе вы платите за конкретный вызов с конкретным контекстом. Мы показываем второе — потому что счёт приходит именно за это. Наши числа — нижняя граница: способ замера не разделяет вход и выход, а выход дороже впятеро.
Как быстро окупается смена модели?
Если у вас тысяча механических задач в месяц, переход со старшей модели на младшую экономит около 170 долларов. Если задачи сложные — экономия обернётся переделками. Посчитайте на калькуляторе ниже.
Можно ли доверять замеру, который сделан на одной линейке моделей?
Внутри линейки — да, условия одинаковы. Для сравнения с другими вендорами нужен отдельный стенд с их API, и мы его не делали. Публиковать чужие числа, которых сами не мерили, не будем.
Как часто вы обновляете цифры?
Раз в месяц и при выходе новой модели. Дата последнего замера стоит вверху страницы — если она старая, значит мы ещё не прогнали новый круг.
Честные оговорки
- Цены — нижняя граница: способ замера отдаёт суммарные токены без разбивки на вход и выход, а выход дороже впятеро.
- Задачу с длинным документом гоняли один раз, а не три.
- На ней же Haiku нашла ответ поиском по файлу, а не чтением — ответ верный, но как тест длинного контекста прогон не засчитан.
- Разметка интентов — наша. На спорных запросах другой специалист мог бы разметить иначе, и тогда часть «ошибок» перестала бы быть ошибками.
- Сравнение только внутри линейки Anthropic. Чужие модели мы не гоняли и не публикуем чисел, которых сами не измеряли.
Как мы ловим собственные ошибки
В первой версии стенда правильные ответы лежали прямо во входном файле — модель могла их списать. Дефект нашла сама модель во время прогона и отказалась считать замер действительным.
После разделения входа и эталона результат Haiku на классификации упал с 1,00 до 0,78. Эти 0,22 балла и были списыванием. С тех пор правило: вход задачи не должен содержать ответа, и это проверяется перед каждым добавлением задачи в стенд.
Вторую ошибку мы нашли в задании на извлечение данных: схема требовала дату обязательно, а в одной из заявок даты не было вовсе — «в ноябре, дата плавающая». Модель честно поставила пустое значение и не прошла проверку. Мы исправили формулировку задания, а не оценку.
Посчитайте свой счёт
Введите, сколько таких задач у вас в месяц — покажем прогноз по каждой модели и предупредим, если дешёвая на вашей задаче не справляется.
Мы считаем эти цифры, потому что сами платим по ним каждый день. Нужен ИИ-агент, который работает на ваших задачах и не жжёт бюджет впустую — напишите нам.