DeepSeek Flash без единого включённого размышления справился со всеми семью задачами теста. DeepSeek Pro — модель в четыре раза дороже — ошиблась в трёх из семи. Ниже разбор: какие задачи, какие ошибки и что это поменяло в моей настройке агента.
Какую модель выбрать для AI-агента — дорогую или дешёвую?
Если коротко: на простых задачах (счёт, агрегация данных без обращения к инструментам) разница между дорогой и дешёвой моделью не проявилась вообще — обе справились одинаково верно. На сложных многошаговых задачах (несколько вызовов инструментов подряд, свод данных из разных источников) дешёвая модель рискует не пройти всю цепочку, а тихо ответить из памяти прошлого запроса — формально похоже на ответ, а на деле не проверка, а угадывание. Дорогая модель в этом тесте тоже не была без проблем: она чаще ошибалась в конкретных задачах (даты, разбор просроченных созвонов, подсчёт дедлайна) и один раз не уложилась в таймаут провайдера. Прямого победителя «дороже = надёжнее» не получилось — выбор модели — это конкретный компромисс между стоимостью и риском тихого пропуска проверки, а не абстрактная настройка «подешевле = похуже».
Недавно я решил внедрить в бизнес агента на базе OpenClaw. Модель для него выбрал сразу — DeepSeek: на момент выхода последняя версия держалась примерно на уровне 80% от Claude Opus 4/4.8, но стоила примерно в 30 раз дешевле. Цена-качество плюс не нужен прокси.
Какое-то время Pro-модель прекрасно справлялась со всеми рядовыми задачами агента. Для по-настоящему сложных исследований и отчётов я работал напрямую через Claude Code с топовыми моделями Anthropic, а DeepSeek отвечал за обычную рутину.
Потом я случайно наткнулся на статью со сравнением: DeepSeek Flash High (с включёнными размышлениями) по эффективности почти сравнивается с большой моделью. Меня это зацепило — я до этого вообще не слышал про Flash Hi, привык, что обычный Flash работает без размышлений по умолчанию. И решил проверить это сам, на своём агенте — на реальных задачах и реальных инструментах, а не на абстрактных синтетических тестах. Свои инструменты для агента я, кстати, тоже пишу сам — про то, как я написал платформу утилит на чистом PHP без БД, отдельная история.
Каталог не знал про thinking у Flash
В конфиге OpenClaw модели deepseek-v4-pro и deepseek-v4-flash были захардкожены с "reasoning": false — то есть каталог просто не знал про параметр reasoning_effort, хотя по докам DeepSeek он поддерживается через anthropic-messages API (output_config.effort). Это была недоработка конфигурации, а не ограничение самой модели.
Пришлось лезть в models.providers.deepseek в openclaw.json и патчить конфиг руками: reasoning: true + compat: { thinkingFormat: "deepseek", supportedReasoningEfforts: [...] } — нашёл точный шаблон в официальной документации провайдера. Сначала прогнал dry-run на VPS, чтобы проверить, что патч валиден, потом применил на проде. Заодно добавил в whitelist третью модель — deepseek-reasoner, у которой thinking всегда включён по умолчанию (в отличие от pro/flash, где это регулируемый параметр).
Каталог моделей OpenClaw не знал о параметре reasoning у DeepSeek Flash — это была ошибка конфигурации, а не ограничение самой модели. После ручного патча конфига (плюс добавление в whitelist модели deepseek-reasoner) размышляющий Flash стал доступен как полноценный режим.
Как я чуть не испортил тест
Цепочки задач тянут в модель реальные данные из CRM — имена и ID лидов. Первая мысль была — не тестировать бенчмарк на реальных данных, но раз это тот же рабочий агент, который и так имеет к ним доступ в проде, решил не городить синтетику.
Дальше поймал себя на другой ошибке: в первой формулировке задачи я явно называл модели инструменты, которые нужно вызвать. Но смысл теста был в том, что обычный пользователь не знает названий инструментов и не должен их знать — модель сама обязана понять, какую цепочку вызовов выбрать. Пришлось переформулировать все задачи как обычные пользовательские запросы, без единого упоминания названий функций.
Тест гонял на реальных, а не синтетических данных того же рабочего CRM-агента. Задачи сформулировал как обычные пользовательские запросы, без упоминания названий инструментов — модель должна была сама решить, какую цепочку вызовов выбрать, как это делает обычный пользователь.
Семь задач, три модели
Тестировал по нарастающей сложности — от простого счёта до многошаговых цепочек вызовов инструментов:
- Даты. Посчитать количество рабочих дней между 15.07 и 01.09.
- Воронка-математика. Посчитать лидов по условию — без вызова инструментов, просто счёт по данным в контексте.
- Архитектура. Спроектировать защищённую от гонок синхронизацию стадии лида между двумя источниками истины — полем
_crm_stageв WordPress и статусом сделки в Laravel CRM (у меня они периодически расходятся: лид может быть подписан на бумаге, а stage в WP так и остаётсяmeeting2). Нужно было расписать: откуда истина по умолчанию для каждого поля, как обнаруживать дрейф, как обеспечить идемпотентность при повторных вебхуках, и псевдокод cron-джобы reconcile. - Воронка — узкое место. Обойти воронку лидов через реальные инструменты и найти, где скопление.
- Проекты без движения. Обойти активные проекты, проверить ленту активности и задачи по каждому, найти проблемные.
- Просроченные созвоны. Разобраться, кто из менеджеров срывает сроки по звонкам.
- Логика. Посчитать дедлайн разработчика с учётом дня недели и выходных.
Тест собран из семи задач по нарастающей сложности — от простого счёта до многошаговых цепочек вызовов реальных CRM-инструментов (воронка, проекты, звонки, архитектурная задача на синхронизацию двух источников истины).
Результаты
| Задача | Pro | Flash (off) | Flash (thinking) |
|---|---|---|---|
| 1. Даты | Ошибка: 48/34 (верно 49/35), 0.00021 | Верно: 35/49,0.00237 | Верно: 49/35, 0.00068 |
| 2. Воронка-математика | Верно: 136/16/3/0,0.00074 | Верно: 136/16/3/0, 0.00228 | Верно: 136/16/3/0,0.00033 |
| 3. Архитектура WP↔Laravel | Верно: полный разбор, 0.00959 | Верно: полный разбор,0.00296 | Верно: полный разбор, 0.00130 |
| 4. Воронка — узкое место | Верно: 145/Дожать-Аудит,0.00913 | Верно: 145/Дожать-Аудит (совпало с pro), 0.00378 | Неоднозначно: 291/Перезвонить (другая интерпретация),0.00715 |
| 5. Проекты без движения | Верно: нашёл [клиент А], 0.02170 | Верно: нашёл др. проблемные,0.00825 | Верно: нашёл [клиент А] (совпало с pro), 0.00728 |
| 6. Просроченные созвоны | Ошибка: проверил только 1 таблицу, вывода не дал,0.00245 | Верно: докопался до 35 просроченных, разбивка по 12 менеджерам, 0.00468 | Верно: нашёл виновных менеджеров (другой формулировкой),0.01029 |
| 7. Логика — дедлайны | Ошибка: день недели и выходные посчитаны неверно, опоздание на 2 дня вместо 1, 0.00082 | Верно: 1 день опоздания,0.00024 | Верно: 1 день опоздания, 0.00234 |
Счёт по задачам: Pro — 4 из 7 без ошибок, Flash без thinking — 7 из 7, Flash с thinking — 6 из 7 (в задаче 4 у Flash с thinking не ошибка, а другая интерпретация воронки).
Дорогая модель оказалась не «почти такой же по качеству за меньшую цену» — она оказалась менее надёжной, чем дешёвая. Провалила три задачи из семи: не справилась с датами, не докопалась до конца в разборе просроченных созвонов, ошиблась в подсчёте дедлайна с учётом выходных. Обычный Flash без единого включённого размышления справился со всеми семью.
Итог по семи задачам: Pro — 4 из 7 без ошибок, Flash без thinking — 7 из 7, Flash с включённым thinking — 6 из 7. Модель в четыре раза дороже (Pro) ошиблась чаще, чем обычный дешёвый Flash без единого включённого размышления.
Экономика
Тест я гонял 25 июля 2026 на версии DeepSeek v4 Pro, которая тогда ещё была в бете. Цены ниже — официальный прайс DeepSeek на тот момент (за 1M токенов), именно по нему считалась экономика теста:
| Модель | cache-hit input | cache-miss input | output |
|---|---|---|---|
| v4-flash / reasoner | 0.0028 | 0.14 | 0.28 |
| v4-pro | 0.003625 | 0.435 | 0.87 |
Обычный Flash стоил в четыре раза дешевле Pro. Размышляющий Flash за счёт выходных токенов тратит примерно в два раза больше токенов, чем обычный Flash, — то есть цена у него в два раза выше обычного Flash. В итоге математика теста такая: Pro дороже в четыре раза, размышляющий Flash тратит в два раза больше токенов, чем обычный, — и получается модель, которая выполняет те же задачи, но в два раза дешевле Pro.
Отдельный технический нюанс: reasoning-токены (сам ход размышления) биллятся по той же ставке, что output, — отдельного тарифа на thinking нет. Счёт растёт из-за объёма токенов, не из-за более высокой ставки.
С тех пор цены сильно выросли, и это отдельная история от результатов теста. 13 августа 2026 DeepSeek выпустил v4 Pro из беты в полный релиз, а 16 августа ввёл новый прайсинг с разделением на пиковые и непиковые часы:
| Модель | output, было (25.07, бета) | output, пик (с 16.08) | output, вне пика (с 16.08) |
|---|---|---|---|
| v4-pro | 0.87 | 3.96 | 1.98 |
| v4-flash | 0.28 | 1.32 | 0.66 |
Источник: официальный анонс DeepSeek, см. также разбор у Ghacks и Engadget. Пропорция между Pro и Flash при этом почти не изменилась — Pro всё так же примерно в три раза дороже Flash. Но это цены на GA-версию модели, которую я не тестировал: сам замер надёжности выше (7 из 7 у Flash против 4 из 7 у Pro) сделан на бета-версии до релиза и привязан к поведению моделей на конкретных задачах, а не к их цене. Если DeepSeek что-то поменял в самой модели между бетой и релизом, разница в качестве могла и сместиться — текущие цифры экономики я привожу только как контекст, не как часть самого теста.
Тест 25 июля считался по бета-прайсу DeepSeek: Pro дороже Flash в четыре раза, размышляющий Flash — вдвое дороже обычного, но всё равно вдвое дешевле Pro. С 16 августа 2026 DeepSeek поднял цены (пиковые часы для Pro выросли с0.87 до $3.96 за 1M токенов output), но пропорция между Pro и Flash сохранилась — Pro всё так же примерно втрое дороже Flash.
Как теперь настроен роутинг
Для определённых инструментов использую исключительно Pro. Для выбора цепочки — размышляющий Flash. Отдельно в системный промпт добавил конкретные наборы цепочек — те сложные случаи, которые модель сама могла бы не собрать правильно и где раньше требовалась Pro. Для повседневных задач этого хватило с головой.
По ощущениям (это уже субъективно, не измерено) — текста в чате при общении с агентом стало примерно в два раза меньше. Мне так комфортнее: когда просишь не отчёт, а краткую информацию, хочешь получить именно информацию, а не портянку текста, которую часто выдаёт большая модель. Для отчётов и по-настоящему крупных задач всё равно использую модели Anthropic.
Отдельно стоит сказать: Pro в моём агенте в большинстве случаев вообще не был обязателен для самого выбора цепочки инструментов — потому что цепочки уже были хорошо прописаны в самих инструментах. Этот же агент — тот бэкенд, что стоит за инструментами нашей CRM в студии, и раз уж мы сами так плотно работаем с кастомной разработкой на базе ИИ — разработку сайтов и систем под конкретные задачи бизнеса делаем тем же подходом: свой код, без лишних прицепов. Про устройство агента и его инструменты расскажу в другой раз — это отдельная большая тема.
Роутинг теперь разделён по типу задачи: Pro — только для отдельных инструментов, размышляющий Flash — для выбора цепочки вызовов, а сложные наборы цепочек прописаны прямо в системном промпте. Для большинства повседневных задач Pro вообще не понадобился — цепочки уже хорошо описаны в самих инструментах.
Вывод
Раньше я всегда использовал либо Flash, либо Pro. Теперь для большинства задач, где раньше я бы использовал Pro, буду использовать Flash с включённым thinking — и не ради экономии, а по результатам собственных бенчмарков.
Но семь задач — это ещё не статистика. Полную картину по надёжности можно будет собрать только через несколько месяцев реального использования. Это уже будет отдельная статья.
Вывод из семи задач: для большинства сценариев, где раньше требовалась дорогая Pro, теперь достаточно размышляющего Flash — дешевле в два раза и без потери надёжности на этой выборке. Семь задач — не статистика, полную картину даст только длительное реальное использование.
Какие модели используете для агентских задач вы? Делитесь в комментариях. А о том, как нейросети сканируют и цитируют веб-ресурсы, читайте в разборе почему ТОП-1 сайт может отсутствовать в ответах ИИ.

