Исследования

Сколько стоит решённая задача: сравниваем модели внутри одного агента

Десять конфигураций Exoskeleton на одном бенчмарке: качество, стоимость полного прогона, время и ошибки провайдеров.

· · 6 минут

Взять более дешёвую модель и получить более дешёвого агента получается далеко не всегда. Я проверил это на Exoskeleton: сохранил архитектуру, заменял модели и считал стоимость полного прогона. MiniMax M3 оказался близок к исходной связке GPT по расходам, Kimi дал лучший результат среди альтернатив, а GLM потребовал примерно в девять раз больше денег, чем типовой прогон GPT.

Что сравнивалось в эксперименте

Exoskeleton — агент для ECOM1, симуляции работы интернет-магазина. В каждом прогоне он решает 100 задач: каталог, корзины, возвраты, платежи и другие операции. Среда меняет параметры заданий, поэтому результаты описывают поведение на этом бенчмарке и не являются измерением качества обслуживания покупателей.

В исходном сравнении было десять конфигураций: GPT, Kimi, GLM, MiniMax, Nemotron, Mistral, Qwen, Gemma, DeepSeek и Llama. У эталона основную работу выполняла gpt-5.4-mini, вспомогательную — gpt-5.4-nano. У остальных одну и ту же модель я ставил в обе роли. Замена младших помощников на старшие была нужна, чтобы отдельно не упираться в их ошибки.

Обычный объём — три полных прогона по 100 задач. В приложении к исследованию есть исключения: четыре прогона для GPT и Qwen, два для Gemma. Приводить всё это как ровно три запуска каждой модели было бы неточно.

Качество измерялось оценкой платформы, score. Она учитывает выполнение задания, ссылки на данные и формат результата. Score 0,898 не означает, что успешно выполнено 89,8% задач. Для подсчёта стоимости именно успешной операции нужен отдельный критерий успеха.

Как выглядят результаты в деньгах

В таблице — лучший score и диапазон стоимости полных прогонов из исторического приложения к исследованию. Максимальный score и минимальная цена могут относиться к разным запускам; делить одно на другое для вычисления «цены успеха» нельзя. Суммы рассчитаны по данным расхода токенов и тарифам, использованным в исследовании.

КонфигурацияЛучший scoreПрогон 100 задач, $
gpt-5.4-mini / nano0,9341,14–1,71
Kimi K2.70,8982,70–2,87
GLM 5.10,88110,50–11,10
MiniMax M30,8371,15–1,26
Nemotron 3 Super0,7571,87–2,06
Mistral Large 30,7671,81–1,89
Qwen 3.6 35B-A3B0,7552,26–2,32
Gemma 4 31B0,7000,76; второй замер отсутствует
DeepSeek V4 Pro0,6212,60–3,89
Llama 4 Maverick0,5740,73–0,88

Диапазон GPT включает контрольный запуск с повышенным режимом рассуждения за $1,71. Три других контрольных запуска стоили $1,14–1,23. Поэтому ориентир около $1,18 из поста описывает типичный расход исходной связки, а не верхнюю границу всех её запусков.

MiniMax стал для меня самым интересным кандидатом по сочетанию качества и расходов: примерно та же сумма за прогон, но остаётся разрыв в score. Kimi ближе к GPT по лучшей оценке, при этом стоит дороже. Эти результаты помогают выбрать кандидатов для следующего этапа доработки агента.

Почему кэш меняет стоимость прогона

Агент делает несколько обращений к модели, передавая накопленный контекст. Инструкции, описание инструментов и ранее прочитанные данные могут повторяться. Если провайдер тарифицирует кэшированный вход дешевле, доля повторяющихся токенов становится существенной частью расчёта.

В моих измерениях у Kimi, MiniMax и Mistral больше 90% входа попадало в кэш, для которого был предусмотрен отдельный тариф. У использованных конфигураций GLM, Qwen и Nemotron такой скидки в расчёте не было. Поэтому близкие объёмы контекста давали заметно разные счета.

Для собственного агента я бы отдельно собирал обычные входные токены, кэшированный вход и выход. Затем умножал каждый объём на его тариф. Средняя цена миллиона токенов без этой разбивки скрывает структуру расходов. Сюда же нужно добавить повторные попытки и вспомогательные модели, иначе часть работы выпадет из расчёта.

Это исторические условия конкретных провайдеров в июне 2026 года. Перед выбором новой конфигурации стоимость следует пересчитать по её действующим тарифам и фактическому расходу.

Время и провайдер влияют на результат

Высокая оценка часто сопровождалась более долгой работой. Mistral в исследовании проходил задачи в среднем за 58 минут платформенного времени и уступал лидерам по score. Платформенное время здесь суммирует работу над задачами; это отдельная метрика, которую нельзя автоматически считать временем ожидания одного клиента.

Были и проблемы на стороне размещения моделей. GLM 5.2 через OpenRouter запустить не удалось, поэтому в итоговое сравнение вошёл GLM 5.1. У Qwen ошибки провайдера затрагивали 10–14 задач в каждом стозадачном прогоне. У Gemma на одном из маршрутов 24 задачи завершились ошибками сериализации вызова инструмента.

Для интеграции это означает, что выбирать нужно конкретную связку модели, API и настроек. Если сервис не принимает нужный режим вызова инструментов, качество рассуждений уже не помогает выполнить операцию. Такие отказы следует учитывать и в расходах, и в доступности агента.

Замена модели требует нового разбора ошибок

Обвязка Exoskeleton создавалась вокруг слабых мест gpt-5.4-mini. Другие модели могут ошибаться в других местах: нарушать формат, завершать работу раньше времени, терять ссылки или сообщать о действии, которое инструмент не выполнил.

Поэтому полученный рейтинг описывает модели внутри конкретного агента. Он не отвечает на вопрос, какая из них лучше для любого процесса. У другой системы будут свои инструменты, длина контекста и критерии результата.

Я бы выбирал несколько подходящих кандидатов и отдельно дорабатывал обвязку под их ошибки. После этого нужен новый полный прогон. Возможность улучшить результат — инженерная гипотеза; её нужно подтвердить измерением, прежде чем обещать пользователям прежнее качество после замены модели.

Как посчитать стоимость успешной операции

Для рабочего продукта сначала нужно определить завершённую операцию. Например, ответ по заказу считается успешным, когда агент нашёл нужный заказ, верно сообщил статус и соблюл права доступа. Для оформления заказа критерий уже включает изменение состояния и подтверждение результата.

Дальше расходы всех попыток, включая неудачные, делятся на число операций, которые прошли эти условия. Отдельно стоит учитывать стоимость инструментов, инфраструктуры и ручной доработки результата сотрудником. Так появится число, полезное для оценки тарифа и рентабельности продукта.

В эксперименте я измерил стоимость полного прогона и качество по правилам ECOM1. Для выбора следующего кандидата этого достаточно. Для обещания определённой цены решённого обращения в магазине потребуется замер на его собственных сценариях с явным учётом успехов, ошибок и повторных попыток.

Материал может пригодиться коллегам? Отправьте им ссылку на статью.