У клиента уже был настроенный AI-агент. Он консультировал пользователей, опирался на базу знаний, прогревал клиента, находил нужную модель мототехники на сайте, давал рекомендации и собирал номер телефона. Менеджеру оставалось подключиться к уже подготовленному лиду.
Сценарий был сильным, но экономика начинала проседать: при росте потока каждый лишний токен превращался в регулярные дополнительные расходы. Поэтому задача была не в полной пересборке бота, а в аккуратной технической оптимизации.
Исходная ситуация
Бот корректно отвечал, консультировал и вел пользователя к заявке. Проблема была в том, что для ответа он подтягивал слишком большой объем данных из базы знаний. На небольшом количестве обращений это почти незаметно, но на сотнях диалогов такая структура начинает стоить дорого.
- бот понимал запросы и давал полезные ответы;
- качество консультации было хорошим;
- стоимость диалога была выше, чем должна быть;
- целью было снизить расход хотя бы на 20-30%.
Что проверили на старте
Сначала разобрали промпт, базу знаний и настройки поиска. Была гипотеза, что перенос части данных в справочники снизит расход. Но тест показал обратное: в этой конкретной конфигурации справочники начали тратить больше токенов.
Главный вывод на этом этапе: универсального решения нет. Экономика AI-бота зависит от структуры данных, логики поиска и сценария общения.
Рабочее решение: перестроили базу знаний
Вместо пересборки бота с нуля вернулись к исходной базе знаний, которая уже хорошо работала по качеству. Внутри было около 15 баз с выжимками информации в JSON-формате. Когда бот отвечал на вопрос, он часто читал больше данных, чем требовалось для конкретного диалога.
- разбили крупные блоки на более мелкие;
- убрали лишние и дублирующиеся данные;
- добавили ключевые слова как маяки для поиска;
- сделали поиск по базе более точным;
- сократили объем контекста, который бот подтягивает без необходимости.
До оптимизации в настройках стояли «Число результатов 4» и «процент совпадений 10%». По сути, бот часто читал слишком много базы. После дробления материалов и настройки ключевых слов число результатов снизили до 3, а процент совпадений подняли до 35%.
База стала работать точнее: агент быстрее находил нужный фрагмент и не тащил в каждый диалог лишний контекст.
Проверка качества
После оптимизации владелец бота проверил основные сценарии: задавал типовые вопросы, сравнивал ответы с прежней версией и смотрел, не просело ли качество консультации.
Результат оказался сильнее ожиданий: бот сохранил корректность ответов, а в некоторых ситуациях начал отвечать точнее, потому что структура базы стала чище.
Боевой тест на реальных пользователях
После внутренней проверки изменения запустили в боевой режим. В течение 10 дней бот работал на реальных пользователях. На этом этапе оценивали уже не гипотезы, а фактический расход и качество под нагрузкой.
Изначально цель была снизить расход хотя бы на 20-30%. Фактическая экономия оказалась почти в два раза выше минимальной цели. При этом не пришлось ломать сильную часть системы: рабочую логику оставили, а слабое место - структуру базы знаний и точность поиска - доработали.
Вывод для бизнеса
Хороший ответ в чате еще не означает, что AI-агент работает выгодно. У бота могут быть скрытые потери: длинный промпт, перегруженная база знаний, дублирующиеся материалы, неудачная структура документов или лишние данные, которые каждый раз попадают в контекст.
В этом проекте расход упал на 46,2% за 10 дней при сохранении качества ответов. Для бизнеса это значит меньшую стоимость эксплуатации AI-агента, а для интегратора - понятный способ приносить ценность не только запуском новых ботов, но и оптимизацией уже работающих решений.