Команда уже подбирает товары для писем по правилам: предлагает популярное в нужной категории и исключает отсутствующее. Поставщик предлагает подключить модуль на основе искусственного интеллекта (AI) и обещает более точную персонализацию — подбор содержания и предложений с учётом данных конкретного клиента. Даже если рекомендации станут лучше, бизнесу нужно понять, хватит ли дополнительного результата, чтобы оплатить модуль, данные и сопровождение.

AI, или искусственный интеллект, — общее название технологий, которые выполняют задачи вроде создания текста, прогнозирования и выбора рекомендаций. Машинное обучение (ML) — один из подходов: модель находит закономерности в данных и использует их для новых прогнозов или решений. Обычное правило задаёт человек, например «показывать самые покупаемые доступные товары категории».

Под AI-модулем в этой статье понимается отдельная функция платформы, использующая такие технологии. Генератор текста, прогноз оттока — вероятности прекращения активности клиента — и подбор товаров решают разные задачи. Им нужны разные показатели качества и способы оценки пользы.

Разберём, как выбрать понятное действие для проверки, сравнить модуль с действующим правилом и рассчитать порог окупаемости — минимальный дополнительный результат, который покрывает дополнительные расходы. Google в руководстве по постановке ML-задач также рекомендует начинать с цели продукта и простого варианта для сравнения качества и затрат. [1] Дальнейшая модель расчёта — применение этого подхода к CRM от редакции CRM Lab.

Опишите решение которое будет принимать модуль

Фраза «увеличить персонализацию» не задаёт измеримой задачи. Конкретный вариант: выбрать три доступных товара для блока повторной покупки и увеличить вклад от заказов за 30 дней на подходящего клиента. Вклад — выручка после возвратов за вычетом согласованных переменных расходов, например себестоимости товара и комиссии за оплату. Стоимость AI-модуля в этом сравнении вычитается отдельно. Подходящие клиенты — те, кто соответствует заранее заданным условиям участия в проверке.

Укажите входные данные, допустимые действия и ограничения. Модель может ранжировать товары, но не должна предлагать отсутствующий товар, отменять запрет на канал или самостоятельно менять условия скидки вне утверждённых правил.

Если речь о генерации текста, финансовая логика другая. Сначала измерьте время подготовки и редактирования, количество дефектов и пригодность результата. Экономия чернового написания может исчезнуть, если проверка занимает столько же времени. Рост продаж от нового текста требует отдельного эксперимента.

Подготовьте сильный простой вариант

Для товарных рекомендаций это могут быть популярные доступные товары в подходящей категории с исключением уже купленного. Для пополнения — срок по категории и истории покупок. Для распределения канала — явное предпочтение и подтверждённая доступность.

Слабое правило создаёт завышенное впечатление о пользе AI. Если базовый вариант показывает отсутствующие товары, модель может выиграть только благодаря фильтру наличия. Тогда нужно понять, относится ли эффект к машинному обучению или к исправлению обычной логики.

Martin Zinkevich в Rules of Machine Learning советует начинать с простых решений и надёжной инфраструктуры, увеличивая сложность по мере появления оснований. [2] Это инженерный принцип, а не утверждение, что простое правило всегда лучше модели.

Проверьте данные и возможность действовать

Нужны признаки, которые действительно доступны в момент решения. Если модель обучается на информации о будущей покупке, её качество в исторической проверке будет выглядеть лучше, чем при реальном использовании. Это утечка информации из будущего.

Разделяйте прогноз склонности и дополнительный эффект воздействия. Клиент с высокой вероятностью покупки может купить без сообщения. Хороший прогноз покупки сам по себе не показывает, кому стоит дать скидку. Для выбора воздействия нужна проверка результата разных действий или подходящая причинная модель.

Убедитесь также, что система может использовать ответ вовремя. Если рекомендация приходит после формирования письма или не учитывает текущую доступность товара, точность модели в отдельном отчёте не решает задачу CRM.

Карточка эксперимента для сравнения с правилом

Дизайн эксперимента — заранее определённые правила сравнения: кого включаем, как распределяем по группам, что измеряем и когда заканчиваем. В этом примере подходящих клиентов случайно распределяют между действующим правилом и AI. Такой способ называется рандомизацией и помогает избежать намеренного или случайного отбора более выгодной аудитории в одну из групп. Идентификатор (ID) — постоянный код клиента — позволяет сохранять назначение при повторных обращениях.

ПараметрУсловный дизайн проверки
Единица распределенияКлиент с устойчивым ID
ГруппыДействующее правило и AI-модуль
Момент назначенияДо первого подходящего решения
Основная метрика — показатель для итогового решенияВклад от заказов на назначенного клиента за 30 дней
Состав вкладаВыручка после возвратов минус согласованные переменные расходы, без стоимости самого модуля
ОграниченияОдинаковые разрешения, частота и доступность товаров
Дополнительные показателиОтписки, жалобы, ошибки, время ответа
ЗавершениеПосле заранее определённых набора участников и окна наблюдения

Стоимость модуля в этом дизайне вычитается на следующем этапе финансового расчёта, чтобы не учитывать её дважды. Если AI меняет частоту или канал, эти изменения становятся частью тестируемой политики; связанные переменные расходы также нужно учесть.

Время, за которое учитываются заказы каждого участника, называют окном наблюдения; здесь это 30 дней. Анализируйте всех назначенных подходящих участников согласно дизайну, а не только открывших письмо или получивших успешную рекомендацию. Иначе качество технической работы модуля может исчезнуть из оценки. Если нужно измерить пользу коммуникации относительно её отсутствия, добавьте отдельную контрольную группу, которая не получает проверяемое сообщение. Выборка — участники, по которым проводится сравнение; их должно хватать для необходимой точности оценки.

Условный расчёт порога окупаемости

В месяц решение можно применить к 240 тысячам подходящих клиентов. AI стоит 180 тысяч рублей, сопровождение — ещё 40 тысяч. Работа обычного правила стоит 60 тысяч. Дополнительные регулярные расходы равны 160 тысячам рублей.

Внедрение AI обходится в 600 тысяч. Для упрощённой оценки на год распределим эту сумму на 12 месяцев: ещё 50 тысяч. Итого модулю нужно покрывать 210 тысяч рублей в месяц сверх стоимости правила. При указанном охвате порог составляет 0,875 рубля дополнительного вклада на клиента.

Это управленческая модель, а не бухгалтерское правило амортизации. Для бюджета сохраняются реальные сроки выплат, а для полноценной оценки учитываются изменение охвата и длительность использования.

Как читать неопределённый результат

Точечная оценка выражает измеренное преимущество одним числом. На другой случайной выборке полученное число могло бы отличаться. Доверительный интервал добавляет к оценке нижнюю и верхнюю границы, чтобы показать её неточность из-за случайного состава выборки. Уровень 95% относится к надёжности метода: при многократном повторении сопоставимых исследований и выполнении его условий около 95% построенных интервалов включали бы истинный средний эффект. Это не обещание будущей прибыли. [3]

Предположим, учебный эксперимент дал оценку преимущества AI 1,4 рубля на клиента с 95-процентным доверительным интервалом от −0,2 до 3 рублей. Числа заданы условно для объяснения решения и не относятся к исследованию конкретного продукта.

Если перенести точечную оценку на сопоставимый месячный охват, получим 336 тысяч рублей дополнительного вклада. После 210 тысяч дополнительных расходов остаётся 126 тысяч. Но диапазон неопределённости эффекта включает значения ниже порога окупаемости и даже отрицательный эффект.

При тех же упрощающих допущениях границы расчётного результата после расходов составят от −258 до 510 тысяч рублей в месяц. Такой диапазон показывает неопределённость экономического решения; он не означает, что будущая прибыль с вероятностью 95% попадёт в эти границы. Перенос на другой месяц дополнительно зависит от состава аудитории, сезонности и стабильности модели.

Решением может быть продолжение проверки, ограниченный запуск или отказ от покупки по текущей цене. Нельзя объявлять окупаемость доказанной только потому, что средняя оценка положительна.

Включите эксплуатацию в условия покупки

Уточните, кто отслеживает ухудшение результата, как обновляется модель, можно ли воспроизвести принятое решение и что происходит при недоступности сервиса. Нужен запасной вариант, например возвращение к проверенному правилу с сохранением всех ограничений.

Национальный институт стандартов и технологий США (NIST) в AI RMF — руководстве по управлению рисками искусственного интеллекта — рассматривает измерение и наблюдение за работой AI на протяжении его использования. [4] В CRM это означает регулярную проверку данных, результата и ошибок, а не однократную приёмку красивого демо.

Согласуйте право остановить модуль и получить необходимые данные для независимого измерения. Покупка становится обоснованной, когда известны дополнительный эффект относительно текущего способа работы, его неопределённость, полные расходы и порядок действий при ухудшении результата.

Источники

[1] Google. Understand the problem. Machine Learning Problem Framing. Google for Developers.

[2] Zinkevich, Martin. Rules of Machine Learning: Best Practices for ML Engineering. Google for Developers.

[3] NIST/SEMATECH. e-Handbook of Statistical Methods. Confidence Limits for the Mean, раздел 1.3.5.2.

[4] National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework AI RMF 1.0. NIST AI 100-1, 2023. Раздел AI RMF Core.