За какую AI-модель платить: три шага, которые не устареют через месяц

Рейтинги моделей стареют за месяц. Как решить, за какую нейросеть платить: разложить задачи по цене ошибки, сравнивать цены внутри уровня и оставить себе путь назад.

«Какую нейросеть лучше оплатить?» — вопрос, который звучит постоянно. Честный ответ разочаровывает: никакую одну. А любой конкретный ответ устареет раньше, чем вы привыкнете к новой подписке.

Масштаб этой текучки хорошо видно по данным AI Gateway Production Index — ежемесячного отчёта Vercel о том, как компании платят за модели в рабочих продуктах. В июле 81% всех токенов шлюза ушёл на модели, которых полгода назад не было в каталоге. DeepSeek в апреле обрабатывал меньше 1% объёма, а в июле — четверть.

Поэтому вместо рейтинга нужен способ решать, который переживает смену моделей. Рамку «уровень задачи → цена внутри уровня → обратимость» Vercel предлагает в разборе Which AI model should you actually pay for?. Ниже — та же логика, пересобранная под задачи маркетинга и малого бизнеса, и то, как она устроена у меня в работе.

За что платить: три шага — разложить задачи, сравнить внутри уровня, оставить путь назад

Почему дешёвая и дорогая модели не соперники

Самая частая ошибка — сравнивать цену флагмана с ценой дешёвой модели. Это как сравнивать гонорар юриста и курьера: оба стоят денег, но работу одного второй не сделает.

Данные индекса показывают это напрямую. Компании, которые платят за модели в продакшене, раскладывают работу по уровням — и платят на каждом уровне своё.

Июль 2026: доля работы и доля денегAnthropic29,8% токенов65,1% денегОткрытые модели36% токенов8,6% денегСветлым — доля объёма, ярким — доля трат. Открытые модели: DeepSeek, MiniMax, Moonshot, Z.aiТраты посчитаны по публичным прайсам лабораторий
Anthropic получает в семь с лишним раз больше денег, чем открытые модели, при меньшем объёме работы. Это не переплата, а сортировка задач.
  • Дорогой уровень. Токен Anthropic в июле стоил в среднем в 4,4 раза дороже токенов всех остальных лабораторий. И всё равно ему досталось почти две трети трат шлюза, а в задачах для программистов — больше 80%.
  • Дешёвый уровень. Открытые модели обработали больше трети всего объёма примерно по седьмой части цены флагманов.

Никто не переплачивает по незнанию. Дорогую модель ставят туда, где дешёвая не справится, а дешёвую — туда, где от блеска ничего не зависит. Спор за цену идёт между моделями одного уровня, а не между уровнями.

Одна оговорка о данных. Это статистика одного шлюза, в основном компаний-разработчиков, и траты там посчитаны по прайсам, а не по реальным счетам. Как точная картина рынка она не годится, а как индикатор поведения — вполне. И логика из неё работает хоть для API-бюджета компании, хоть для подписки одного маркетолога.

Разницу в счёте делает выбор, а не прайс

Самая интересная цифра индекса — про падение цены. В июле средняя цена токена снизилась на 13,6%. Но если бы компании остались на июньском наборе моделей, цена не изменилась бы вовсе. Всё снижение дали решения о том, какие задачи на какие модели отправлять.

У отдельных команд расхождение ещё сильнее. Среди тех, кто в июне и июле потратил больше 10 миллионов токенов, три из четырёх поменяли хотя бы десятую часть своего набора моделей.

Одинаковые прайсы, разный счёт: июнь → июльдешевле на 30% и больше¼ командв пределах ±5%1 из 6дороже на 20% и больше¼ командКоманды с объёмом больше 10 млн токенов в оба месяца; остальные — между группами
Экономили в основном те, кто платил выше среднего. Дороже стало в основном тем, кто платил ниже среднего и перевёл задачи на модели сильнее.

Вторую группу легко принять за проигравших, но это не так. Дорогой конец рынка сдвигался вниз, дешёвый — вверх: одни убрали переплату за простую работу, другие перестали экономить на работе, где дешёвая модель не тянула. И те и другие сделали одно и то же — разложили задачи заново.

Вывод для вас: вопрос не «какая модель», а «какая модель на какую задачу». И ответ на него меняется каждый месяц.

Шаг 1. Разложите задачи по цене ошибки

На этом шаге названия моделей вообще не нужны. Для каждой задачи, которую вы отдаёте AI, задайте один вопрос: что будет, если ответ окажется посредственным?

Уровень Посредственный ответ означает Примеры задач Как выбирать
1. Дорогая ошибка Потерю денег, клиента или репутации ответ на гневный отзыв, КП крупному клиенту, условия оферты, разбор юнит-экономики, сложный баг в рабочем продукте Сильная модель, которая проходит ваш тест. Экономия здесь ложная
2. Проверит человек Лишние полчаса правок посты, сценарии роликов, письма, структура лендинга, контент-план Решает, сколько правок остаётся после ответа
3. Важен объём Почти ничего: ошибку видно сразу или она не критична саммари звонков, разметка заявок, теги и alt-тексты, переформатирование, извлечение данных из документов Самая дешёвая модель, которая справляется. Здесь основная экономия

Две подсказки, которые помогают не ошибиться с уровнем.

Смотрите на последствия, а не на сложность. Короткий ответ на негативный отзыв — простая по объёму задача, но это первый уровень: его прочитают все, кто выбирает между вами и конкурентом. А разметка тысячи заявок — сложная по объёму, но третий: ошибку в одной строке никто не заметит.

Отдельный фильтр — данные. Если в запросе есть персональные данные клиентов, вопрос «какая модель дешевле» идёт вторым. Сначала решите, можно ли вообще отправлять эти данные этому провайдеру. Иногда ответ — обезличить данные перед отправкой или взять локальную модель.

flowchart TD
    A["Задача"] --> B{"В запросе<br/>персональные данные?"}
    B -->|да| C["Сначала решить,<br/>куда их можно отправлять"]
    B -->|нет| D{"Что будет,<br/>если ответ посредственный?"}
    C --> D
    D -->|"потеря денег<br/>или репутации"| T1["Уровень 1"]
    D -->|"правки человека"| T2["Уровень 2"]
    D -->|"почти ничего"| T3["Уровень 3"]
    T1 --> E["Слепой тест<br/>на 10 своих задачах"]
    T2 --> E
    T3 --> E
    E --> F["Самая дешёвая<br/>из прошедших тест"]
    F --> G["Пересмотр<br/>через месяц"]
    G -.-> E

Шаг 2. Сравнивайте цены только внутри уровня

Когда задачи разложены, сравнение становится честным. Внутри уровня берёте модели, которые в принципе с ним справляются, и ищете самую дешёвую из тех, что проходят ваш тест. Не общий бенчмарк, а тест на ваших задачах.

Слепой тест на десяти задачах

Проверка укладывается в час:

  1. Выпишите 10 настоящих задач уровня — из прошлой недели, а не придуманных для теста.
  2. Прогоните каждую через две-три модели с одинаковым промптом.
  3. Уберите названия моделей и перемешайте ответы. Оценивать должен тот, кто будет пользоваться результатом.
  4. Отметьте каждый ответ: годится как есть, нужны правки или не годится.
  5. Посчитайте полную цену: стоимость запроса плюс время на правки.

Для записи хватит простой таблицы:

Задача Вариант Годится как есть? Минут на правки Цена запроса
Ответ на отзыв про задержку доставки А да 0
Ответ на отзыв про задержку доставки Б нет

Слепота здесь не формальность. Стоит увидеть название известного бренда рядом с ответом — и оценка незаметно ползёт вверх.

Цена токена — ещё не цена задачи

Прайс за миллион токенов обманчив по трём причинам:

  • Длина ответа. Модели с рассуждением тратят токены на размышления, и дешёвый токен легко умножается на длинный ответ.
  • Повторы. Если с первого раза ответ не годится в трети случаев, реальная цена выше на эту треть — плюс ваше время.
  • Правки. Модель, после которой полчаса переписываешь текст, дороже модели, чей ответ уходит в работу как есть. Даже если за токен она берёт вдвое меньше.

Поэтому в тесте считается не прайс, а итог: сколько стоило получить годный результат.

Как это устроено у меня

В Telegram-боте, который собирает отчёты для клиентов, эта логика встроена в инструменты:

  • Слепой A/B-тест одной командой. Промпт уходит сразу во все модели набора, ответы приходят как варианты А, Б и В без названий, рядом — время ответа и длина. Какая модель какая, раскрывается только после оценки.
  • Модель меняется без правки кода. Выбор модели хранится в настройках и переключается командой в самом боте, без перезапуска.
  • Цепочка вместо одной модели. Запрос идёт в первую модель цепочки; не ответила — забирает следующая. Сбой одного провайдера не останавливает отчёты.
  • Расход виден по каждому отчёту. Каждый вызов записывается с моделью, токенами и стоимостью, и в админке видно, сколько в рублях стоил конкретный отчёт.

Если такого инструмента нет, ту же проверку делают руками по таблице выше. А ту же логику в автоматическом виде можно посмотреть в кейсе UspAIChat: там роутер сам отправляет простые запросы в дешёвые модели.

Шаг 3. Оставьте себе путь назад

Смысл шага в том, чтобы смена модели была делом одной настройки, а не проектом. Если ради перехода нужно переписывать интеграции, переучивать людей или терять оплаченный год, вы останетесь на старой модели даже тогда, когда она перестанет быть выгодной. А экономили в индексе как раз те, кто пересобирал набор, — и данные, по которым вы выбирали в прошлом месяце, уже другие.

На практике путь назад складывается из простых привычек:

  • Промпты — в файлах, а не в истории чата. Рабочие промпты живут в документе или базе знаний, откуда их можно отдать любой модели.
  • Проверяйте промпт на второй модели. Промпт, который работает только на одной модели, привязывает вас к ней. Со сменой поколений старые промпты начинают мешать даже той же модели.
  • Один интерфейс поверх провайдеров. Для автоматизации — совместимый API, шлюз или агрегатор, где модель задаётся одной строкой в настройках. Для России есть агрегаторы с оплатой в рублях.
  • Никаких годовых тарифов на одну модель, если есть помесячная оплата. Скидка за год — плата за то, чтобы не менять решение.
  • Считайте расход по задачам, а не общим счётом. Общая сумма не показывает, где переплата. Нужно видеть, сколько уходит на каждый тип работы. Что для этого записывать про каждый вызов модели — в статье как следить за AI-ботом в работе.
  • Держите эталонный набор. Те же десять задач из теста — чтобы новую модель можно было проверить за полчаса, а не за неделю.

Подписка или API: два разных случая

Вопрос «за что платить» звучит одинаково, но решается по-разному.

Вы работаете с AI сами, в чате. Выбор почти всегда сводится к одной-двум подпискам. Логика та же: платная подписка — под задачи первого уровня, для третьего часто хватает бесплатных или дешёвых режимов. Пересматривать хватит раз в квартал: экономия на одной подписке меньше, чем время на ежемесячные тесты.

AI встроен в процессы — бот, разбор заявок, контент-конвейер. Здесь вы платите за токены, и рамка работает в полную силу: ошибка в выборе модели умножается на каждый запрос. Для Claude разбирал отдельно, как держать дорогие модели в узде системой 10-80-10.

Пересмотр раз в месяц

Индекс выходит ежемесячно, и данные в нём меняются быстрее, чем привычки. Раз в месяц на пересмотр стоит выделить час.

Пересмотр раз в месяц: расход, тест вслепую, переключить, записать — вокруг эталонных задач

  1. Выгрузите расход по задачам за месяц.
  2. Найдите три самые дорогие задачи — пересматривать стоит их, остальное не окупит времени.
  3. Проверьте, что вышло нового в том же уровне: дешевле или сильнее.
  4. Прогоните эталонные задачи на новой модели вслепую.
  5. Переключите, если прошла. Путь назад у вас уже есть.
  6. Запишите решение с датой: какая модель, на какой уровень и почему.

Последний пункт кажется лишним, пока через три месяца не возникнет вопрос «почему у нас здесь эта модель». Запись отвечает за секунду.

Чем этот подход не является

Это не рейтинг. Победителя здесь нет специально: список лучших моделей пришлось бы переписывать каждый месяц, а три шага от смены лидеров не меняются. Актуальную картину линеек держу в отдельных картах: для Claude и для маркетинговых задач.

Это не призыв перейти на дешёвое. Дешёвые модели тянут не всё. Две трети денег шлюза уходят самым дорогим моделям, и платят их осознанно. Если от ответа зависят деньги или репутация, экономия на модели обходится дороже всего.

Это не бесплатная экономия. Тесты и пересмотры стоят времени. При маленьком расходе ежемесячный цикл не окупится — достаточно раза в квартал.

Вывод

Модель, за которую стоит платить, зависит не от рейтинга, а от задачи. Три шага работают при любой смене лидеров:

  1. Разложите задачи по цене ошибки — до того, как смотреть на модели.
  2. Сравнивайте цены только внутри уровня и проверяйте вслепую на своих задачах.
  3. Оставьте путь назад — и пересматривайте выбор раз в месяц.

Следующий шаг: выпишите десять задач, которые вы чаще всего отдаёте AI, и против каждой поставьте уровень — 1, 2 или 3. Если на первый уровень попало больше половины, скорее всего, вы переоцениваете цену ошибки. Если ни одной — недооцениваете.

Читайте также

Как пользоваться Claude Fable 5 и не разориться: система 10-80-10как распределить работу между дорогими и дешёвыми моделями Claude и срезать счётUspAIChat: свой AI-чат на пяти провайдерах — с биллингом, мобильным клиентом и умным роутеромсвой чат на пяти провайдерах с роутером, который сам выбирает модель под запросЛокальные AI-модели: когда это защита данных, а когда дорогая паранойякогда данные нельзя отправлять в облако и сколько стоит своя модель

Хотите разложить свои AI-расходы по уровням и настроить выбор моделей под задачи — напишите мне в Telegram.

Комментарии

Войдите через Telegram, чтобы оставить комментарий:

Пока нет комментариев. Будьте первым.