Логотип FastUp.byFastUp.by

Проверил DeepSeek Pro, Flash и Flash с thinking на семи задачах своего агента

Обновлено

DeepSeek Flash без единого включённого размышления справился со всеми семью задачами теста. DeepSeek Pro — модель в четыре раза дороже — ошиблась в трёх из семи. Ниже разбор: какие задачи, какие ошибки и что это поменяло в моей настройке агента.

Какую модель выбрать для AI-агента — дорогую или дешёвую?

Если коротко: на простых задачах (счёт, агрегация данных без обращения к инструментам) разница между дорогой и дешёвой моделью не проявилась вообще — обе справились одинаково верно. На сложных многошаговых задачах (несколько вызовов инструментов подряд, свод данных из разных источников) дешёвая модель рискует не пройти всю цепочку, а тихо ответить из памяти прошлого запроса — формально похоже на ответ, а на деле не проверка, а угадывание. Дорогая модель в этом тесте тоже не была без проблем: она чаще ошибалась в конкретных задачах (даты, разбор просроченных созвонов, подсчёт дедлайна) и один раз не уложилась в таймаут провайдера. Прямого победителя «дороже = надёжнее» не получилось — выбор модели — это конкретный компромисс между стоимостью и риском тихого пропуска проверки, а не абстрактная настройка «подешевле = похуже».

Недавно я решил внедрить в бизнес агента на базе OpenClaw. Модель для него выбрал сразу — DeepSeek: на момент выхода последняя версия держалась примерно на уровне 80% от Claude Opus 4/4.8, но стоила примерно в 30 раз дешевле. Цена-качество плюс не нужен прокси.

Какое-то время Pro-модель прекрасно справлялась со всеми рядовыми задачами агента. Для по-настоящему сложных исследований и отчётов я работал напрямую через Claude Code с топовыми моделями Anthropic, а DeepSeek отвечал за обычную рутину.

Потом я случайно наткнулся на статью со сравнением: DeepSeek Flash High (с включёнными размышлениями) по эффективности почти сравнивается с большой моделью. Меня это зацепило — я до этого вообще не слышал про Flash Hi, привык, что обычный Flash работает без размышлений по умолчанию. И решил проверить это сам, на своём агенте — на реальных задачах и реальных инструментах, а не на абстрактных синтетических тестах. Свои инструменты для агента я, кстати, тоже пишу сам — про то, как я написал платформу утилит на чистом PHP без БД, отдельная история.

Каталог не знал про thinking у Flash

В конфиге OpenClaw модели deepseek-v4-pro и deepseek-v4-flash были захардкожены с "reasoning": false — то есть каталог просто не знал про параметр reasoning_effort, хотя по докам DeepSeek он поддерживается через anthropic-messages API (output_config.effort). Это была недоработка конфигурации, а не ограничение самой модели.

Пришлось лезть в models.providers.deepseek в openclaw.json и патчить конфиг руками: reasoning: true + compat: { thinkingFormat: "deepseek", supportedReasoningEfforts: [...] } — нашёл точный шаблон в официальной документации провайдера. Сначала прогнал dry-run на VPS, чтобы проверить, что патч валиден, потом применил на проде. Заодно добавил в whitelist третью модель — deepseek-reasoner, у которой thinking всегда включён по умолчанию (в отличие от pro/flash, где это регулируемый параметр).

Каталог моделей OpenClaw не знал о параметре reasoning у DeepSeek Flash — это была ошибка конфигурации, а не ограничение самой модели. После ручного патча конфига (плюс добавление в whitelist модели deepseek-reasoner) размышляющий Flash стал доступен как полноценный режим.

Как я чуть не испортил тест

Цепочки задач тянут в модель реальные данные из CRM — имена и ID лидов. Первая мысль была — не тестировать бенчмарк на реальных данных, но раз это тот же рабочий агент, который и так имеет к ним доступ в проде, решил не городить синтетику.

Дальше поймал себя на другой ошибке: в первой формулировке задачи я явно называл модели инструменты, которые нужно вызвать. Но смысл теста был в том, что обычный пользователь не знает названий инструментов и не должен их знать — модель сама обязана понять, какую цепочку вызовов выбрать. Пришлось переформулировать все задачи как обычные пользовательские запросы, без единого упоминания названий функций.

Тест гонял на реальных, а не синтетических данных того же рабочего CRM-агента. Задачи сформулировал как обычные пользовательские запросы, без упоминания названий инструментов — модель должна была сама решить, какую цепочку вызовов выбрать, как это делает обычный пользователь.

Семь задач, три модели

Тестировал по нарастающей сложности — от простого счёта до многошаговых цепочек вызовов инструментов:

  1. Даты. Посчитать количество рабочих дней между 15.07 и 01.09.
  2. Воронка-математика. Посчитать лидов по условию — без вызова инструментов, просто счёт по данным в контексте.
  3. Архитектура. Спроектировать защищённую от гонок синхронизацию стадии лида между двумя источниками истины — полем _crm_stage в WordPress и статусом сделки в Laravel CRM (у меня они периодически расходятся: лид может быть подписан на бумаге, а stage в WP так и остаётся meeting2). Нужно было расписать: откуда истина по умолчанию для каждого поля, как обнаруживать дрейф, как обеспечить идемпотентность при повторных вебхуках, и псевдокод cron-джобы reconcile.
  4. Воронка — узкое место. Обойти воронку лидов через реальные инструменты и найти, где скопление.
  5. Проекты без движения. Обойти активные проекты, проверить ленту активности и задачи по каждому, найти проблемные.
  6. Просроченные созвоны. Разобраться, кто из менеджеров срывает сроки по звонкам.
  7. Логика. Посчитать дедлайн разработчика с учётом дня недели и выходных.

Тест собран из семи задач по нарастающей сложности — от простого счёта до многошаговых цепочек вызовов реальных CRM-инструментов (воронка, проекты, звонки, архитектурная задача на синхронизацию двух источников истины).

Результаты

ЗадачаProFlash (off)Flash (thinking)
1. ДатыОшибка: 48/34 (верно 49/35), 0.00021Верно: 35/49,0.00237Верно: 49/35, 0.00068
2. Воронка-математикаВерно: 136/16/3/0,0.00074Верно: 136/16/3/0, 0.00228Верно: 136/16/3/0,0.00033
3. Архитектура WP↔LaravelВерно: полный разбор, 0.00959Верно: полный разбор,0.00296Верно: полный разбор, 0.00130
4. Воронка — узкое местоВерно: 145/Дожать-Аудит,0.00913Верно: 145/Дожать-Аудит (совпало с pro), 0.00378Неоднозначно: 291/Перезвонить (другая интерпретация),0.00715
5. Проекты без движенияВерно: нашёл [клиент А], 0.02170Верно: нашёл др. проблемные,0.00825Верно: нашёл [клиент А] (совпало с pro), 0.00728
6. Просроченные созвоныОшибка: проверил только 1 таблицу, вывода не дал,0.00245Верно: докопался до 35 просроченных, разбивка по 12 менеджерам, 0.00468Верно: нашёл виновных менеджеров (другой формулировкой),0.01029
7. Логика — дедлайныОшибка: день недели и выходные посчитаны неверно, опоздание на 2 дня вместо 1, 0.00082Верно: 1 день опоздания,0.00024Верно: 1 день опоздания, 0.00234

Счёт по задачам: Pro — 4 из 7 без ошибок, Flash без thinking — 7 из 7, Flash с thinking — 6 из 7 (в задаче 4 у Flash с thinking не ошибка, а другая интерпретация воронки).

Дорогая модель оказалась не «почти такой же по качеству за меньшую цену» — она оказалась менее надёжной, чем дешёвая. Провалила три задачи из семи: не справилась с датами, не докопалась до конца в разборе просроченных созвонов, ошиблась в подсчёте дедлайна с учётом выходных. Обычный Flash без единого включённого размышления справился со всеми семью.

Итог по семи задачам: Pro — 4 из 7 без ошибок, Flash без thinking — 7 из 7, Flash с включённым thinking — 6 из 7. Модель в четыре раза дороже (Pro) ошиблась чаще, чем обычный дешёвый Flash без единого включённого размышления.

Экономика

Тест я гонял 25 июля 2026 на версии DeepSeek v4 Pro, которая тогда ещё была в бете. Цены ниже — официальный прайс DeepSeek на тот момент (за 1M токенов), именно по нему считалась экономика теста:

Модельcache-hit inputcache-miss inputoutput
v4-flash / reasoner0.00280.140.28
v4-pro0.0036250.4350.87

Обычный Flash стоил в четыре раза дешевле Pro. Размышляющий Flash за счёт выходных токенов тратит примерно в два раза больше токенов, чем обычный Flash, — то есть цена у него в два раза выше обычного Flash. В итоге математика теста такая: Pro дороже в четыре раза, размышляющий Flash тратит в два раза больше токенов, чем обычный, — и получается модель, которая выполняет те же задачи, но в два раза дешевле Pro.

Отдельный технический нюанс: reasoning-токены (сам ход размышления) биллятся по той же ставке, что output, — отдельного тарифа на thinking нет. Счёт растёт из-за объёма токенов, не из-за более высокой ставки.

С тех пор цены сильно выросли, и это отдельная история от результатов теста. 13 августа 2026 DeepSeek выпустил v4 Pro из беты в полный релиз, а 16 августа ввёл новый прайсинг с разделением на пиковые и непиковые часы:

Модельoutput, было (25.07, бета)output, пик (с 16.08)output, вне пика (с 16.08)
v4-pro0.873.961.98
v4-flash0.281.320.66

Источник: официальный анонс DeepSeek, см. также разбор у Ghacks и Engadget. Пропорция между Pro и Flash при этом почти не изменилась — Pro всё так же примерно в три раза дороже Flash. Но это цены на GA-версию модели, которую я не тестировал: сам замер надёжности выше (7 из 7 у Flash против 4 из 7 у Pro) сделан на бета-версии до релиза и привязан к поведению моделей на конкретных задачах, а не к их цене. Если DeepSeek что-то поменял в самой модели между бетой и релизом, разница в качестве могла и сместиться — текущие цифры экономики я привожу только как контекст, не как часть самого теста.

Тест 25 июля считался по бета-прайсу DeepSeek: Pro дороже Flash в четыре раза, размышляющий Flash — вдвое дороже обычного, но всё равно вдвое дешевле Pro. С 16 августа 2026 DeepSeek поднял цены (пиковые часы для Pro выросли с0.87 до $3.96 за 1M токенов output), но пропорция между Pro и Flash сохранилась — Pro всё так же примерно втрое дороже Flash.

Как теперь настроен роутинг

Для определённых инструментов использую исключительно Pro. Для выбора цепочки — размышляющий Flash. Отдельно в системный промпт добавил конкретные наборы цепочек — те сложные случаи, которые модель сама могла бы не собрать правильно и где раньше требовалась Pro. Для повседневных задач этого хватило с головой.

По ощущениям (это уже субъективно, не измерено) — текста в чате при общении с агентом стало примерно в два раза меньше. Мне так комфортнее: когда просишь не отчёт, а краткую информацию, хочешь получить именно информацию, а не портянку текста, которую часто выдаёт большая модель. Для отчётов и по-настоящему крупных задач всё равно использую модели Anthropic.

Отдельно стоит сказать: Pro в моём агенте в большинстве случаев вообще не был обязателен для самого выбора цепочки инструментов — потому что цепочки уже были хорошо прописаны в самих инструментах. Этот же агент — тот бэкенд, что стоит за инструментами нашей CRM в студии, и раз уж мы сами так плотно работаем с кастомной разработкой на базе ИИ — разработку сайтов и систем под конкретные задачи бизнеса делаем тем же подходом: свой код, без лишних прицепов. Про устройство агента и его инструменты расскажу в другой раз — это отдельная большая тема.

Роутинг теперь разделён по типу задачи: Pro — только для отдельных инструментов, размышляющий Flash — для выбора цепочки вызовов, а сложные наборы цепочек прописаны прямо в системном промпте. Для большинства повседневных задач Pro вообще не понадобился — цепочки уже хорошо описаны в самих инструментах.

Вывод

Раньше я всегда использовал либо Flash, либо Pro. Теперь для большинства задач, где раньше я бы использовал Pro, буду использовать Flash с включённым thinking — и не ради экономии, а по результатам собственных бенчмарков.

Но семь задач — это ещё не статистика. Полную картину по надёжности можно будет собрать только через несколько месяцев реального использования. Это уже будет отдельная статья.

Вывод из семи задач: для большинства сценариев, где раньше требовалась дорогая Pro, теперь достаточно размышляющего Flash — дешевле в два раза и без потери надёжности на этой выборке. Семь задач — не статистика, полную картину даст только длительное реальное использование.

Какие модели используете для агентских задач вы? Делитесь в комментариях. А о том, как нейросети сканируют и цитируют веб-ресурсы, читайте в разборе почему ТОП-1 сайт может отсутствовать в ответах ИИ.

Частые вопросы про выбор модели для AI-агента

Можно ли доверять дешёвой модели в агенте для критичных бизнес-задач?

С осторожностью. У дешёвой/быстрой модели есть отдельный, более опасный режим отказа: на сложной многошаговой задаче она может вообще не пройти цепочку инструментов, а ответить из памяти прошлого взаимодействия, решив, что свежая проверка не нужна. Формально ответ выглядит нормально и может даже случайно совпасть с правильным — но это не проверка, а угадывание, и на менее стабильных данных это дало бы устаревший результат. Для задач, где цена ошибки высока, стоит либо тратить больше на надёжную модель, либо явно требовать от дешёвой показать саму цепочку вызовов инструментов, а не доверять правдоподобному ответу.

Цены DeepSeek с августа 2026 выросли в разы — результаты бенчмарка из статьи ещё актуальны?

Сам замер надёжности (Flash без thinking — 7 задач из 7 верно, Pro — 4 из 7) сделан 25 июля на бета-версии v4 Pro и не зависит от цены — это поведение моделей на конкретных задачах. А вот экономика изменилась: 13 августа DeepSeek выпустил v4 Pro из беты в GA-релиз, 16 августа ввёл новый прайсинг с разделением на пиковые и непиковые часы — output у Pro вырос с $0.87 до $1.98–3.96 за 1M токенов, у Flash — с $0.28 до $0.66–1.32. Пропорция между Pro и Flash почти не изменилась (Pro всё так же примерно в 3 раза дороже). Но GA-версию Pro отдельно не тестировали — если DeepSeek что-то поменял в самой модели между бетой и релизом, разница в надёжности могла сместиться.

У FastUp есть готовая услуга по внедрению такого ИИ-агента клиентам?

Пока нет — это отдельное направление на будущее, не действующий пункт прайса. Внутри студии агент на базе OpenClaw уже работает каждый день как часть операционки (тот же бэкенд, что и за CRM-инструментами студии), и с ним же тестируется выбор моделей, о котором эта статья. Но продукт «подключаем такого агента к вашим данным» пока не оформлен в услугу.

Похожие записи

Математический стандарт FastUp GAS v1.4: формулы, шкалы и методика измерения видимости бренда в генеративном поиске

1. Введение: проблема измерения ИИ-выдачи Традиционные методы поисковой аналитики опирались на условно-детерминированные показатели: позицию в ТОП-10/20, видимость по частотному ядру, CTR сниппета и профиль обратных ссылок (PageRank). Появление генеративных поисковых интерфейсов — Яндекс.Нейро («Обзор от Алисы»), ChatGPT Search (с нативным веб-поиском) и Google AI Overviews (SGE) — привело к трем фундаментальным проблемам измерения: Стохастичность и […]

Превью статьи о том, почему в 2026 году SEO и GEO-продвижение в картах станут единой услугой.

SEO внутри GEO: почему в 2026 году нет смысла покупать две раздельные услуги

Если вы приходите за продвижением бизнеса, вам нередко предлагают две параллельные статьи расходов: классическое SEO-продвижение сайтов и оптимизацию под нейросети (GEO). С инженерной точки зрения в 2026 году это разделение потеряло смысл. В FastUp мы объединили эти направления: классическое SEO полностью интегрировано в сквозной регламент GEO-продвижения в нейросетях. Это исключает дублирование процессов и защищает бюджет […]

4 уровня подготовки сайта к рекомендациям в нейросетях

Как мы в FastUp делаем GEO-продвижение: 4 уровня подготовки сайта к рекомендациям в нейросетях

Когда речь заходит о чеках от 2 000 до 20 000+ BYN — будь то B2B-услуги, опт, заказная разработка сайтов, загородное строительство или комплексное лечение в частном медцентре — поведение клиента меняется. Лицо, принимающее решение, берет паузу, говорит «я подумаю» и идет проверять информацию. Только теперь он не просто гуглит и собирает таблицы подрядчиков вручную. […]

Хотите заказать разработку сайта?

Разберём задачу и пришлём расчёт. Отвечаем в течение рабочего дня.

FastUp.by
FastUp.by
Оставить заявку
Заявка успешно отправлена!
Изучим проект и свяжемся с вами в течение рабочего дня.