Рекламная платформа знает, кто увидел объявление, и может сравнить конверсию с теми, кто не видел. Почти всегда показанная группа выглядит лучше. Но показ не назначается случайно: реклама чаще достаётся активным пользователям, подходящим аукционам, определённым устройствам и моментам высокого намерения. Разница в конверсии может существовать и без кампании.

Золотой стандарт — случайно выделенная контрольная группа, которой рекламу не показывают. В англоязычной практике такой тест называют holdout. Участники тестовой и контрольной групп изначально сопоставимы, а главное различие между ними создаёт сама реклама. Так можно честно оценить, что произошло бы без кампании. Однако эксперимент доступен не всегда: платформа может его не поддерживать, кампания уже могла закончиться, выборка бывает слишком маленькой, а бизнес — не готов оставлять часть аудитории без показов.

Подход Near Impressions в маркетинговой аналитике и рекламе — это метод использования наблюдательных данных для оценки причинно-следственного влияния рекламы на конверсии и продажи без проведения полноценных рандомизированных экспериментов

Исследование и границы вывода

Что изучали. Использование событий «почти показа» для улучшения наблюдательной оценки рекламного эффекта и сравнение с результатами экспериментов.

Что получили. Ошибка была ниже или равна базовой в 89% экспериментальных сравнений. Медианная стандартизированная ошибка — 0,2 против 0,8 в единицах стандартной ошибки экспериментальной оценки.

Чего результат не доказывает. Это не проценты ошибки и не гарантия точности новой кампании. Сопоставимость зависит от отбора возможностей показа и наблюдаемых признаков; неизвестные различия могут сохраняться.

Практическое применение CRM Lab

Далее — редакционное применение результатов к CRM-задачам. Рекомендации и учебные примеры требуют проверки на данных конкретного бизнеса; они не являются дополнительными результатами авторов исследования.

Почему обычное сравнение систематически смещено

Человек, который увидел рекламу авиабилета, мог только что искать направление. Другой не видел её, потому что вообще не заходил в интернет. Их последующие покупки различаются не только из-за объявления.

Даже сложная модель по полу, возрасту и другим постоянным характеристикам не устраняет непроизвольный отбор. Намерение купить часто проявляется в быстро меняющихся сигналах: поисковом запросе, содержании открытой страницы, времени суток или недавнем посещении сайта. Если аналитика не видит эти признаки, она сравнивает людей с разной исходной готовностью к покупке и обычно завышает эффект рекламы.

Атрибуция последнего клика решает другую задачу — назначает кредит касанию. Она не отвечает, произошла бы покупка без рекламы. Высокая атрибутированная выручка может сопровождаться нулевым инкрементальным результатом.

Что такое Near Impression

Near impression можно перевести как «почти показ». Пользователь был активен, подходил под условия кампании и оказался в ситуации, где объявление могло появиться, но фактического показа не произошло. Например, рекламодатель проиграл аукцион, исчерпал дневной бюджет или не получил доступный рекламный слот. Важно, что показ сорвался из-за механизма доставки, а не потому, что человек вообще не заходил в интернет и не создавал возможности для контакта.

Такая аудитория лучше воспроизводит opportunity to see — реальную возможность увидеть рекламу. И показанный пользователь, и человек с «почти показом» находились в подходящем месте и прошли значительную часть одного и того же отбора. Поэтому они обычно ближе друг к другу по текущей активности и намерению, чем показанный пользователь и любой случайный человек без показа.

По сути, аналитики ищут на границе рекламного аукциона людей, которые могли бы показать, что случилось бы без рекламы. Но «почти получил показ» не означает «случайно не получил». Победа зависит от ставки, качества объявления, конкуренции и признаков пользователя, которые также могут быть связаны с покупкой.

Почему метод может работать лучше

Обычный контроль из всех непоказанных включает множество людей, которые никогда не создавали возможности для контакта. Near impressions ограничивают сравнение на более совместимую область.

Если два пользователя одновременно подходили для кампании, но один показ состоялся, а другой был близок к показу, их контекст вероятнее схож. Затем модель дополнительно корректирует наблюдаемые различия.

В исследовании подход Near impressions сравнивался с экспериментальными оценками и чаще давал близкий результат, чем базовый наблюдательный метод. Оценка метода с near impressions находилась внутри 95%-го доверительного интервала экспериментального результата в 88% сравнений; для базового метода доля составляла 75%.

Эти цифры показывают улучшение в рассмотренных условиях, а не гарантированную точность любой кампании.

Какие предпосылки остаются

Во-первых, причина непоказа не должна напрямую определять будущую конверсию после учёта признаков. Если высокоценных пользователей систематически выигрывает более высокая ставка, группы останутся разными.

Во-вторых, в тесте и контроле должны быть достаточно похожие люди. В аналитике это условие называют overlap, или областью пересечения. Если все пользователи определённого типа всегда получают рекламу, а похожих людей без показа нет, модель не сможет надёжно оценить для них сценарий «без рекламы». Она будет вынуждена гадать за пределами доступных данных.

В-третьих, события должны измеряться одинаково. Разная идентификация устройств, окна конверсии или потеря офлайн-покупок создают смещение, которое модель не исправит.

В-четвёртых, Near Impressions не должны получать то же воздействие через другой канал или кампанию без учёта. Иначе контроль загрязнён.

Эксперимент остаётся эталоном

Рандомизация разрывает связь между назначением рекламы и исходными характеристиками в среднем. Наблюдательный метод пытается измерить и скорректировать эти характеристики, но не может гарантировать учёт неизвестного.

Поэтому Near Impressions полезны в трёх случаях: оценить уже прошедшую кампанию без контрольной группы, дополнить эксперимент при ограниченных условиях и отслеживать результат между полноценными тестами. Но метод не должен становиться оправданием отказа от случайного эксперимента, если тот доступен.

Лучший процесс регулярно калибрует наблюдательную модель на экспериментах. Если оценки систематически расходятся по типу кампаний, вводятся поправки или область применения сужается.

Как построить измерение на практике

Метод требует журналов состоявшихся и несостоявшихся возможностей показа. Обычной выгрузки рекламного кабинета с показами, кликами и конверсиями может быть недостаточно. Доступность этих данных нужно проверить до выбора метода.

Сначала определяется единица воздействия: пользователь, аккаунт, домохозяйство или география. Она должна соответствовать идентификации покупки и исключать перетекание.

Затем фиксируется opportunity: условия, при которых пользователь мог участвовать в аукционе. Логируются время, площадка, устройство, запрос или контекст, кампания, ставка, бюджет, причина непоказа и предсказанные платформой показатели.

После этого задаётся одинаковое окно, в котором будут измеряться покупки или другие результаты у показов и «почти показов». Для выравнивания групп используют только признаки, которые существовали до рекламы: прошлые покупки, прежнюю активность, устройство или контекст аукциона. Клики и другое поведение после показа использовать для такой коррекции нельзя. Они уже могли измениться из-за рекламы, поэтому их учёт способен удалить часть настоящего эффекта или создать новое смещение.

После такого выравнивания модель оценивает разницу в результатах. Рядом обязательно показывают, насколько хорошо пересекались и были сбалансированы группы, а также насколько вывод может измениться из-за неучтённых различий между людьми.

Что считать исходом

Покупка — не единственный вариант, но метрика должна быть значимой для бизнеса. Можно измерять инкрементальные заявки, посещения, подписки, выручку или маржу. Для рекламы на существующую базу важны повторная покупка и CLV.

Выручка без маржи переоценивает кампании с дорогими скидками и возвратами. Конверсия без оценки качества лида поощряет дешёвые, но бесполезные действия. Брендовые показатели требуют отдельного экспериментального опроса.

Окно выбирается до анализа. Слишком короткое теряет отложенный эффект, слишком длинное включает посторонние воздействия. Для разных продуктов оно может отличаться.

Относительный рост и абсолютная ценность

Если базовая конверсия составляет 0,1%, а после рекламы — 0,12%, относительный рост равен внушительным 20%. Но в абсолютных цифрах разница составляет 0,02 процентного пункта: две дополнительные покупки на каждые десять тысяч человек. При миллионах показов даже такой эффект может быть ценным, однако решение нужно принимать по прибыли, а не по красивому проценту.

Инкрементальное число конверсий умножается на маржу, затем вычитаются медиа, скидки, производство и переменные расходы. Отдельно оценивается неопределённость. Кампания может иметь положительную точечную оценку, но интервал включать убыток.

Также полезно считать стоимость инкрементальной конверсии, а не атрибутированной. Расхождение показывает, насколько атрибутированный результат отличается от оценки причинного прироста. Само по себе оно не идентифицирует конкретные органические покупки.

Неоднородность эффекта

Средний прирост может скрывать противоположные результаты в сегментах. Реклама способна помогать новым пользователям, но лишь приписывать себе естественные покупки постоянных; работать на одной площадке и вредить на другой; создавать эффект при низкой частоте и усталость при высокой.

Сегменты следует задавать заранее или подтверждать на новой выборке. Наблюдательный поиск «победителей» особенно подвержен смещению. Модель таргетинга должна проходить рандомизированную проверку как политика.

Для CRM ценны группы, у которых реклама действительно меняет поведение, а не просто те, кто и без неё охотно покупает. В этом состоит различие между прогнозом обычного отклика и прогнозом дополнительного эффекта, который специалисты называют uplift.

Диагностика, которую нельзя пропускать

До публикации результата нужно проверить, насколько похожи характеристики групп, сколько людей осталось без сопоставимых аналогов, почему им не показали рекламу и сохраняется ли вывод при разумных вариантах расчёта. Особенно полезна проверка на периоде до рекламы, которую называют placebo-тестом. В это время кампания ещё не могла повлиять на поведение. Если модель всё равно «находит эффект», значит, целевая и контрольная группы остались несопоставимыми, а оценке после запуска доверять опасно.

Полезно сравнивать несколько контрольных конструкций и проводить отрицательные контрольные исходы, на которые реклама не должна влиять. Сильная чувствительность — сигнал осторожности.

Отчёт должен явно разделять данные, допущения и вывод. Даже слово «причинный» в названии метода не отменяет того, что точность результата зависит от выполненных предпосылок.

Организационная польза

Near impressions требуют от медиа и аналитики общего словаря. Платформа должна сохранять не только фактические показы, но и возможности, коммерческая команда — давать маржу, CRM — соединять покупки по клиенту.

Так измерение меняет оптимизацию. Бюджет переносится от кампаний с высокой атрибуцией к кампаниям с доказанным приростом. Снижается ретаргетинг людей, которые и так готовы купить, и появляются тесты на аудитории с реальным потенциалом изменения.

Иерархия доказательств для медиарешений

Первый уровень — клики и платформенная атрибуция: они помогают управлять доставкой, но не доказывают дополнительный прирост.

Второй уровень — сравнение увидевших рекламу со всеми, кто её не видел; оно легко искажается разницей в активности.

Третий уровень — более близкая наблюдательная контрольная группа, включая «почти показы».

Четвёртый уровень — квазиэксперименты.

Пятый и самый надёжный уровень — случайно выделенная контрольная группа без рекламы.

Уровень определяет силу формулировки. Наблюдательная оценка может быть «совместима с эффектом при таких предпосылках», а экспериментальная — более уверенным причинным выводом.

Практический порядок внедрения

Сначала стоит провести небольшой тест со случайной контрольной группой и одновременно рассчитать Near Impressions. Так станет видно, насколько наблюдательная оценка ошибается именно в условиях кампании. Затем модель можно применять между экспериментами к похожим кампаниям, сохраняя периодические контрольные тесты. При смене аукциона, идентификации, стратегии ставок или состава площадок сравнение нужно повторить. Такой порядок использует масштаб наблюдательных данных, но не теряет экспериментальную опору. Модель становится системой измерения с оценённой на проверенных кампаниях ошибкой, а не чёрным ящиком причинности.

Все изменения логики доставки фиксируются как возможный разрыв ряда.

При расчёте экономики каждую затрату учитывают один раз. Если выручка уже отражает скидки и возвраты, повторно их не вычитают. Если маржинальный доход уже включает логистику, обслуживание или коммуникации, эти расходы не списывают ещё раз.

Карточка проверки на данных бизнеса

Ниже предложен дизайн проверки CRM Lab. Указанные сроки — стартовые ориентиры; их уточняют по циклу покупки и расчёту размера выборки до запуска.

Кого распределяем. Для контрольного эксперимента — пользователи или географии; наблюдательная оценка строится на тех же кампаниях и окнах.

Какие группы сравниваем. Рандомизированный holdout без изучаемой рекламы и тестовая политика; параллельно — расчёт по журналам показов и near impressions.

Основная метрика. Одинаковый рекламный эффект на конверсию или маржу для обеих оценок.

Горизонт. Единое окно, например 30 дней; достаточность длительности проверяют по циклу покупки.

Ограничения. Нужны журналы возможностей показа и признаки до воздействия. Проверять баланс, пересечение, чувствительность и расхождение с экспериментом; это не обычное сравнение увидевших и не увидевших рекламу.

До запуска зафиксируйте минимальный эффект, ради которого имеет смысл менять политику, и достаточный размер выборки. В отчёте показывайте размер эффекта и доверительный интервал, а не только статус статистической значимости.

Вывод

Near Impressions улучшают сценарий сравнения, потому что сопоставляют увидевших рекламу не со всеми непоказанными, а с теми, кто тоже мог получить объявление, но по технической или аукционной причине остался без него. В исследовании метод значительно чаще приближался к результату эксперимента, чем базовый подход.

Для CRM Lab это полезный инструмент, когда случайная контрольная группа недоступна, но не стоит заявлять причинность без оговорок. Эксперимент остаётся эталоном, а наблюдательная модель — приближением, качество которого нужно регулярно проверять. Цель измерения — не найти способ приписать рекламе больше продаж, а оценить дополнительную маржу, которой не было бы без воздействия.

Источник

Stephanie Sapp; Jon Vaver; Jon Schuringa; Steven Dropsho. Near Impressions for Observational Causal Ad Impact. Google Inc. / Google Research. 2017.