журналопыт и цифрыавтор

директор и машина · маркетинг · заметка с планёрки · запись № 046 · · Давид Герштейн

Почему часть лидов теряет UTM-метку — и как ИИ восстанавливает источник

10–15% лидов без источника, до 30% в декабре, ~18 лидов/мес теряют разметку (оценка)
Коротко · суть разбора

Часть лидов приходит без UTM-меток из-за блокировщиков рекламы и очистки куки — обычно 10–15%, в декабре доходит до 30%. Ручной разбор занимает у маркетолога неделю в месяц; ИИ восстанавливает вероятный источник по косвенным признакам за минуты, но не заменяет решение — только ускоряет черновую сортировку.

Содержание · 3 разделов
  1. Что обычно делают с лидами без UTM — и почему это не работает
  2. Что попробовали: ИИ вместо ручной разметки лидов
  3. Что получилось, а что — ещё нет: точность и дедупликация

Суммы в разборе пересчитаны на условную компанию — пропорции, механика и выводы реальные.

Планёрка, вторник, отчёт по лидам за месяц. Оля показывает воронку — и в самом низу таблицы строка «источник: —», то есть без UTM-метки. Пятнадцать процентов. Все молчат секунды три, потом кто-то спрашивает: «Это баг?»

Не баг. Это люди, которые почистили куки, включили блокировщик рекламы или зашли с приватной вкладки. UTM-метка теряется ещё до того, как форма отправлена. В обычный месяц таких 10–15%. В декабре, когда трафик другой и часть заявок идёт через мессенджеры без ссылки на конкретное объявление, доля подскочила до 30%. Треть лидов — и мы не знаем, откуда они.

Дальше выясняется вторая часть проблемы, ещё неприятнее первой: часть лидов, наоборот, размечена — но два-три раза. Одна точка входа плодит дубликаты в CRM, и конверсия по отчёту падает день ото дня, хотя реальная ситуация не меняется. Руководитель нашёл это случайно, листая утренний отчёт: цифры не бились, а виноват оказался не отдел продаж, а склейка данных.

Что обычно делают с лидами без UTM — и почему это не работает

Первый инстинкт — доразметить руками. Оля неделю сидела и вручную сопоставляла заявки без метки с рекламным кабинетом: смотрела время визита, страницу входа, текст обращения, пыталась угадать источник по стилю формулировок. Неделя рабочего времени маркетолога — это примерно 40 часов. По ставке около 1 000 ₽/час (оценка) — 40 000 ₽ в месяц уходит просто на то, чтобы понять, откуда пришли люди, которые и так уже стали лидами.

При этом решение неточное: человек угадывает источник по интуиции, а не по системе признаков. И в отчёт всё равно попадает пометка «предположительно», которую руководитель на планёрке видит как повод не доверять цифре целиком. Один из участников тогда прямо сказал: «Отсутствие информации — это отсутствие рычагов давления, и это меня прям очень сильно бесит». По сути — без источника нельзя ни хвалить канал, ни резать его бюджет с уверенностью.

Разделить конверсию по каналам (условно Директ и Яндекс) без нормальной атрибуции вообще не получается — и это одна из причин, почему лиды есть, а куда уходят деньги между маркетингом и продажами — непонятно. Здесь же речь только про один узкий кусок: что делать с лидами, у которых просто нет метки.

Что попробовали: ИИ вместо ручной разметки лидов

Решили не гадать руками, а отдать черновую сортировку модели. Идея простая: у лида без UTM всё равно остаётся след — referrer, user agent, страница входа, время визита, текст заявки. По этим косвенным признакам модель не восстановит метку дословно, но может дать вероятностную гипотезу источника и объяснить, почему так решила. Дальше маркетолог смотрит только на те случаи, где уверенность низкая, а не разбирает всю пачку заново.

Технически это выгрузка из amoCRM по вебхуку — каждый новый лид без поля utm_source уходит в отдельную обработку. На входе — JSON с полями, которые CRM и так собирает:

Ты — аналитик атрибуции лидов. На вход поступает лид без UTM-метки.
Твоя задача: оценить наиболее вероятный источник трафика и указать
уровень уверенности. Не выдумывай источник, если признаков недостаточно —
в этом случае честно ставь "unknown".

Данные лида (JSON):
{
  "lead_id": "8842",
  "created_at": "2026-08-12T14:03:00",
  "referrer": "android-app://com.google.android.gm",
  "landing_page": "/uslugi/otsenka",
  "device": "mobile",
  "form_text": "интересует расчёт стоимости, хочу успеть до конца месяца",
  "utm_source": null,
  "utm_campaign": null
}

Верни JSON строго по схеме:
{
  "lead_id": string,
  "probable_source": string,   // например: "email", "organic", "paid_social", "direct", "unknown"
  "confidence": number,        // от 0 до 1
  "reasoning": string          // короткое объяснение на основе признаков
}

Пример ответа модели на этот лид:

{
  "lead_id": "8842",
  "probable_source": "email",
  "confidence": 0.62,
  "reasoning": "Referrer указывает на переход из Gmail-приложения, формулировка заявки похожа на отклик на рассылку, а не на рекламный оффер. Уверенность средняя — нет данных о конкретной кампании."
}

Отдельным промптом та же модель ищет дубликаты: сравнивает email, телефон и временной интервал между заявками с одной точки входа — и тут стоит помнить, что из этих данных можно отправлять в нейросеть, а что нельзя. Помеченные повторы не считаются отдельными лидами в отчёте по конверсии.

Что получилось, а что — ещё нет: точность и дедупликация

Из пятнадцати процентов «ничьих» лидов модель уверенно (confidence выше 0.7) размечает примерно половину — дальше это ложится в отчёт с пометкой источника, а не прочерком. Остальные так и остаются «unknown», и это честно: лучше открытый пробел, чем красиво угаданная неправда. На отдел с полутора сотнями лидов в месяц это означает, что из примерно 18 неразмеченных заявок (оценка, 12% от 150) девять получают вероятный источник автоматически, а не ждут, пока у Оли будет свободная неделя.

Дедупликация сработала быстрее и понятнее: за первый же месяц отчёт по конверсии перестал «проседать» из-за задвоенных карточек — это было видно сразу, без сложных расчётов. А вот с восстановлением источника мы пока в процессе: часть гипотез модели маркетолог перепроверяет вручную, потому что «reasoning» иногда цепляется не за тот признак. Ещё не знаем, стабилизируется ли точность на новых данных или придётся дообучать промпт под конкретные паттерны трафика.

Где ломается: если отдавать модели решение об оптимизации бюджета на основе «вероятного» источника без пометки уверенности — можно урезать рабочий канал только потому, что модель ошиблась в гипотезе. Вероятностная разметка годится для отчёта и для сортировки задач, но не для автоматического перераспределения денег между кампаниями без человека в контуре — это тот самый случай, когда автоматизация требует надзора.

Вывод для себя такой: ИИ не заменяет UTM-метки и не чинит блокировщики кук — это вообще не про него. Он снимает самую нудную часть работы — не сидеть и не гадать по каждому лиду вручную, а получать пачку гипотез сразу с пометкой, где модель уверена, а где нет. По деньгам это та самая неделя маркетолога в месяц, около 40 000 ₽ (оценка) — и это без учёта того, сколько на самом деле стоит сам ИИ в месяц — именно эффект от разметки, без остальных изменений в отделе.

#аналитика и отчётность #ии и нейросети #автоматизация

Дальше читать подобрано по направлению и темам
008
Сквозная аналитика своими руками: аудит данных вместо покупки BI-сервиса
10–15% лидов не атрибутируется (в декабре — 30%) · дубли давали 2-3 копии на лид · конверсия органики упала с 17% до 10% за 4 месяца
021
Куда утекают деньги между маркетингом и продажами, если лиды исправно идут
44 лида → 1-2 продажи · конверсия упала с 33% до 6% · брак лидов втрое выше плановых 20%
015
Как считать стоимость лида, чтобы не платить за брак
конверсия 33%→6% после смены текста объявления · доля качественных лидов 40% вместо плановых 80% · одна точка входа даёт до 3 дублей на лид