директор и машина · контроль качества · запись № 037 · · Давид Герштейн
Речевая аналитика на практике: 7139 оценок, $300 в месяц — и один отзыв
Конвейер на нейросети оценивает 100% звонков — 7139 за месяц — за $300, дешевле любого ОКК. Но за весь период руководители оставили один отзыв на оценки, и без еженедельного разбора эффект в деньгах равен нулю. При обороте 9 млн ₽/мес и 10% зависающих из-за звонка сделок риск оценивается в ≈900 000 ₽/мес — и конвейер сам по себе его не снижает.
Содержание · 10 разделов
- Сколько стоит речевая аналитика на нейросети
- Цифры
- Как устроен конвейер
- Промт: как модель оценивает звонок
- Что выводить на дашборд, чтобы им реально пользовались
- Инженерная обвязка: очередь, ретраи, деньги
- Экономика
- Почему это не окупилось — честная часть
- Считать ли это провалом
- Чек-лист на понедельник, если хотите повторить
Суммы в разборе пересчитаны на условную компанию — пропорции, механика и выводы реальные.
Сколько разговоров ваших менеджеров с клиентами вы слышали за последний месяц? Скорее всего, ноль. И это нормально: у директора есть занятия поважнее. Ненормально другое — что их не слышал вообще никто, включая руководителя отдела.
Если вы прямо сейчас не можете назвать, сколько разговоров разобрали в вашем отделе на прошлой неделе и что после этого изменилось, — контроля качества у вас нет. Есть ощущение контроля. Разница между этими двумя состояниями стоит денег, и ниже я посчитаю, сколько именно.
Несколько месяцев назад я поставил в отделе продаж конвейер, который слушает все сто процентов звонков и оценивает каждый по чек-листу. Это разбор работающей системы, а не обзор сервисов: реальные цифры, устройство, промт — и главный вывод, который дороже всей технической части. На седьмой тысяче оценок я понял, что построил дорогую бессмыслицу. Вот это, честно говоря, полезнее всего остального.
Сколько стоит речевая аналитика на нейросети
Оценка всего потока разговоров обходится около $300 в месяц: за период машина поставила 7 139 оценок там, где вручную закрывалось четверть звонков. Это дешевле одной ставки контролёра.
Но цена — не главный вопрос. За тот же период руководители оставили один отзыв на все 7 139 оценок. Контур, чьи результаты не превращаются в решения, стоит ровно $300 в месяц и не приносит ничего.
Цифры
Конвейер оценивает 100% звонков отдела — 7139 за отчётный период, около 177 в день, — и стоит около $300 в месяц. Это дешевле одного дня работы штатного контролёра качества. Но за тот же период руководители оставили на оценки ровно один отзыв, и это число говорит о системе больше, чем все остальные.
| Показатель | Значение |
|---|---|
| Оценено разговоров за период | 7139 |
| Средний темп | ~177 разговоров в день |
| Себестоимость обработки | ~$300 в месяц |
| Охват | 100% звонков, а не выборка |
| Отзывов от руководителей на оценки | 1 (один) за весь период |
Последняя строка — самая важная в этой таблице. К ней и придём.
Как устроен конвейер
Описываю подробно, чтобы вы могли прикинуть, что из этого есть у вас, а чего не хватает. Ничего экзотического в схеме нет — она собирается из того, что уже стоит в большинстве компаний.
Схема воспроизводима в любой CRM с телефонией: запись → расшифровка → оценка по чек-листу → агрегация в дашборд. Три технических этапа и один управленческий, который в нашем случае так и не заработал. Каждый узел этой цепочки разобран отдельно — выгрузка, транскрибация, чек-листы, калибровка и экономика контроля.
Записи звонков из телефонии складываются в хранилище. Первый этап — расшифровка: речь в текст, с разделением по говорящим. Второй — оценка: языковая модель получает расшифровку и чек-лист (приветствие, выявление потребности, работа с возражением, следующий шаг — у вас будет свой) и возвращает структурированную оценку с цитатами. Третий — агрегация: оценки складываются в базу, руководитель видит сводку по менеджерам и может провалиться в конкретный разговор.
Что важно из неочевидного:
- Не экономьте на расшифровке. Ошибки распознавания речи умножаются на этапе оценки: модель уверенно оценивает то, чего человек не говорил. Дешёвая расшифровка — главный источник несправедливых оценок, а несправедливая оценка — самый быстрый способ настроить менеджеров против системы.
- Чек-лист должен быть короче, чем хочется. Пять-семь пунктов, по которым возможен однозначный ответ. Пункты вида «менеджер был доброжелателен» порождают споры, пункты «менеджер назвал следующий шаг и дату» — нет.
- Оценка обязана цитировать. Каждый балл — с цитатой из разговора. Без цитат разбор превращается в спор с роботом.
Отдельный вопрос — хранение. Записи и расшифровки 7139 звонков в месяц — это не просто база для оценки, а полноценный архив разговоров с клиентами, к которому со временем накапливаются вопросы доступа: кто может слушать записи, сколько они хранятся, кто отвечает за их удаление по истечении срока. Мы решили это заранее — доступ к аудио есть только у руководителя отдела и у самого менеджера по его звонкам, доступ к текстовым оценкам — шире, у коммерческого директора. Если этот вопрос не закрыть на старте, он всплывёт в худший момент — когда записи понадобятся для разбора конфликтной ситуации с клиентом, а выяснится, что их уже удалили по умолчанию через 30 дней.
рассылка журнала
Разборы про качество обслуживания — на почту
Оценка разговоров, чек-листы, калибровка машины против людей.
Промт: как модель оценивает звонок
Вся оценка держится на одном промте, который получает расшифровку и чек-лист и возвращает структурированный JSON с баллом, цитатой и флагом риска по каждому пункту — без этого промта дальнейшая агрегация не имеет смысла, и его можно скопировать целиком.
В нашей связке источник данных — amoCRM. После завершения звонка прилетает вебхук примерно такого вида:
{"call_id":"c-88213","lead_id":12345,"manager":"Иванов","audio_url":"https://.../rec.mp3","duration_sec":312}
Сервис скачивает запись, прогоняет через распознавание речи с разметкой по говорящим и подставляет расшифровку в промт ниже вместо плейсхолдера {transcript}.
Ты — контролёр качества звонков в отделе продаж услуг для бизнеса.
Тебе дана расшифровка телефонного разговора менеджера с клиентом.
Говорящие размечены как [Менеджер] и [Клиент].
Оцени разговор строго по чек-листу. По каждому пункту:
- балл 1 (выполнено) или 0 (не выполнено);
- обязательная цитата из расшифровки, подтверждающая балл;
- если пункт неприменим (например, клиент бросил трубку раньше) — балл "н/п" и причина.
Чек-лист:
1. Приветствие и представление (имя менеджера, компания).
2. Выявление потребности (минимум один открытый вопрос о задаче клиента).
3. Работа с возражением (если возражение прозвучало — было ли оно отработано, а не проигнорировано).
4. Следующий шаг назначен (конкретная дата или действие, а не "я перезвоню").
Не придумывай реплик, которых нет в расшифровке. Если сомневаешься — ставь "н/п" и объясняй почему.
Верни только JSON без пояснений вне структуры:
{
"call_id": "строка из входных данных",
"manager": "строка из входных данных",
"scores": [
{"criterion": "...", "score": 0|1|"н/п", "quote": "...", "comment": "..."}
],
"total_score": число,
"risk_flag": true|false
}
Расшифровка:
{transcript}
Пример ответа модели на реальный (обезличенный) звонок:
{
"call_id": "c-88213",
"manager": "Иванов",
"scores": [
{"criterion": "Приветствие", "score": 1, "quote": "Здравствуйте, Иванов, компания...", "comment": ""},
{"criterion": "Выявление потребности", "score": 0, "quote": "", "comment": "Открытых вопросов не задано"},
{"criterion": "Следующий шаг", "score": 1, "quote": "Отправлю КП до пятницы", "comment": ""}
],
"total_score": 2,
"risk_flag": true
}
risk_flag — единственное поле, ради которого весь промт и затевался: это фильтр, по которому руководитель может за минуту отсортировать 7139 звонков и открыть только проблемные, не слушая остальные.
Что выводить на дашборд, чтобы им реально пользовались
Здесь вы можете сэкономить себе месяц: дашборд, который никто не открывает, — самый частый результат таких проектов. Правило простое: если вашему руководителю отдела нужно больше двух кликов, чтобы понять, что делать сегодня, — вы построили витрину, а не инструмент.
Дашборд должен отвечать на один вопрос за один взгляд: «кого разбирать на этой неделе» — а не превращаться в ещё один отчёт, который открывают раз в квартал перед советом директоров. Мы ошиблись именно здесь: изначально вывели общий средний балл по отделу и красивый график динамики, но ни то, ни другое не подсказывает, что делать в понедельник утром.
Рабочий минимум — четыре виджета: количество звонков с risk_flag: true за неделю по каждому менеджеру; топ-3 худших звонка недели со ссылкой на аудио и цитатой из оценки; доля выполнения по каждому пункту чек-листа отдельно (не общий балл, а именно «выявление потребности — X%», «следующий шаг — Y%»), потому что общий балл смешивает разные проблемы в одно число и прячет, что именно чинить; и счётчик «дней с последнего разбора» — простая метрика-триггер, которая делает пропуск ритуала заметным, а не тихим. Именно последний счётчик, если бы он у нас стоял на видном месте с первого дня, вероятно, не позволил бы месяцу тишины остаться незамеченным.
Инженерная обвязка: очередь, ретраи, деньги
Настройка конвейера заняла около 20 часов: 8 часов — распознавание речи и хранение записей, 8 часов — промт и тестирование чек-листа на живых звонках, 4 часа — интеграция с amoCRM и вывод результатов в таблицу (оценка).
Из невидимого снаружи, но важного для устойчивости: очередь на обработку звонков должна переживать пиковые часы без потерь, а на сбои ASR и модели нужны ретраи с ограничением попыток (у нас — три), иначе часть звонков молча выпадает из статистики и руководитель видит неполную картину, даже не подозревая об этом. Второй момент — лимиты запроса: модель вызывается на каждый звонок отдельно, и при росте штата стоимость растёт линейно, а не скачками, что как раз и держит счёт в районе $300 при нынешнем объёме.
Третий момент, который мы недооценили на старте, — длинные звонки. Разговор на 40–50 минут не помещается в один запрос к модели целиком без потери качества оценки: расшифровку приходится резать на смысловые куски и оценивать чек-лист по всей склейке, а не по последнему фрагменту. Решение простое — отправлять модели полную расшифровку, но с явным указанием в промте оценивать разговор целиком, а не последнюю реплику; в этом и есть весь фокус, специальная логика разбиения не потребовалась.
Экономика
Сравнивайте не с нулём, а со своей текущей ситуацией: сколько у вас стоит человек, который слушает четверть потока, и во что обходится один сорванный контракт, который никто не услышал вовремя.
Настройка обошлась примерно в 20 часов работы, эксплуатация — около 27 000 ₽ в месяц (доллары по текущему курсу), а фактический эффект в деньгах за всё время работы — 0 ₽, потому что оценки никто не разбирал с менеджерами. При 7139 оценённых звонках это около 3,8 ₽ за звонок — конвейер сам по себе дешёвый, вопрос не в нём.
Возьмём отдел из 8 менеджеров при обороте 9 млн ₽ в месяц и среднем чеке 180 тыс. ₽ — это около 50 сделок в месяц. Если 10% зависает именно из-за плохо отработанного звонка (не назначен следующий шаг, проигнорировано возражение), это 5 сделок и риск ≈ 900 000 ₽ в месяц (оценка). Конвейер этот риск сам не снижает — он только помечает флагом, в каких из 7139 звонков риск есть. Снижает риск разбор: 30 минут в неделю с каждым из 8 менеджеров — это около 16 часов управленческого времени в месяц при ставке руководителя ~1500 ₽/час, то есть 24 000 ₽ в месяц. Это на порядок дешевле риска в 900 000 ₽, но требует ритуала, которого у нас не было.
Что мы не считаем эффектом: раньше звонки слушали выборочно и время на это никто не фиксировал — «экономию» этой ручной практики в деньгах мы не пересчитываем, потому что это просто исчезнувшее действие, а не высвобожденные часы сотрудника. Если разбор всё же заработает и повлияет на конверсию, сдвиг даст связка ИИ-оценки и управленческого ритуала целиком — вклад одной только модели отдельно выделить будет нельзя.
бесплатный курс · телеграм
Поставить оценку 100% разговоров у себя
В курсе — как собрать оценку качества от выгрузки до отчёта руководителю: чек-листы, калибровка, приёмка. То, что у нас работает за сотни долларов в месяц.
Начать курс бесплатно →открывается в Telegram · доступ по подписке на канал
Почему это не окупилось — честная часть
Система оценивает 177 разговоров в день. Раньше выборочно слушали единицы. Казалось бы — прорыв. Но за весь период работы руководители оставили на оценки один отзыв, а калибровка критериев (совместный разбор спорных оценок, поправки в чек-лист) оборвалась через месяц.
Оценка звонка меняет что-то в одном-единственном случае: когда руководитель садится с менеджером и разбирает конкретный разговор. Этот ритуал не был спроектирован. Все считали, что достаточно дать доступ к экрану с оценками. Недостаточно: у руководителя есть текущая работа, и новый экран сам в неё не встраивается — про эту же ловушку я писал в разборе того, почему внедрение ИИ не приживается, там она общая для любых инструментов, не только для звонков.
Отдельно стоит сказать про сопротивление менеджеров, которое почти всегда возникает на старте таких систем и которое мы недооценили. Первая реакция — не «удобно», а «меня теперь слушает робот». Это снимается только практикой: если оценки первое время используют исключительно для наказаний, саботаж гарантирован; если первые недели показывают, что оценка помогает получить конкретный совет («на этом месте стоило спросить про бюджет») — сопротивление проходит за 2–3 недели. У нас этой фазы толком не было, потому что не было и самих разборов — отсюда и один отзыв за весь период вместо постепенного привыкания.
Считать ли это провалом
Отвечу так, как ответил бы вам за столом: технически — нет, управленчески — да. И если вы будете строить у себя похожий контур, я бы хотел, чтобы вы вынесли отсюда именно эту часть, а не цифры про охват.
Технически — нет: конвейер стабилен, дёшев и точен. Управленчески — да: он несколько месяцев производил оценки, которые никто не читал. Разрыв между «технология работает» и «люди работают по-другому» — это самая частая причина того, что цифры из отчёта не превращаются в деньги; о том, как вообще правильно считать эффект ИИ-проектов, чтобы не путать поток с разовым запасом, я подробно писал в отдельном разборе про окупаемость ИИ-проектов.
И вот что я вынес для себя лично. Довести машинную оценку до разговора с живым человеком — это отдельный навык руководителя, такой же осваиваемый, как чтение отчёта о прибылях. Раньше он не требовался: данных о работе людей было мало, добывались они вручную и поштучно. Теперь данных больше, чем управленческого времени, и руководитель, который умеет превращать поток машинных оценок в еженедельные решения, стоит дороже руководителя, который умеет только раздавать задачи. Я этим навыком в тот момент не владел — и никакая настройка промта этого не компенсировала.
Я публикую этот разбор именно потому, что таких историй в открытом доступе почти нет — все продают кейсы успеха, и у читателя складывается ощущение, что у всех работает, а у него одного нет. Не у всех.
Чек-лист на понедельник, если хотите повторить
Порядок для вас — с поправкой на мою ошибку: приёмку ставим первой, а не последней.
- Сначала договоритесь с руководителем отдела: полчаса в неделю на разбор трёх худших и одного лучшего разговора. Письменно, с датой первой встречи. Только потом стройте конвейер — иначе получите точную систему без единого пользователя.
- Первую неделю оценивайте вручную вместе с системой — это калибровка чек-листа и прививка доверия к оценкам.
- Показывайте менеджерам их собственные оценки сразу: система, которую от людей прячут, воспринимается как слежка и саботируется.
- Раз в месяц пересматривайте чек-лист: продажи меняются, критерии отстают.
- Назначьте владельца ритуала разбора — не «руководитель отдела в целом», а конкретный человек с этим пунктом в еженедельном плане.
- Поставьте на дашборд счётчик «дней с последнего разбора» — если он есть на видном месте, месяц тишины заметят раньше, чем через месяц.
Стоимость всей затеи — сотни долларов в месяц, а не миллионы на проект. В деньгах это доступно любому среднему бизнесу; в дисциплине — не любому. Дисциплина и есть цена.
Если после этой статьи вы сделаете одну вещь — пусть это будет не запуск контура, а простой вопрос руководителю отдела продаж: «сколько звонков ты послушал на прошлой неделе и что после этого изменилось?». Ответ покажет, нужна ли вам вообще автоматика или сначала нужна управленческая привычка.
Потому что машина, как выяснилось на моём опыте, отлично производит оценки — и совершенно не умеет заставлять людей ими пользоваться. Это по-прежнему ваша работа. Как выстроить и то и другое — в бесплатном курсе для руководителей.
Частые вопросы
Сколько стоит речевая аналитика на нейросети?
Около $300 в месяц на 7139 оценённых разговоров (100% звонков отдела) — это примерно 3,8 ₽ за звонок при курсе ~90 ₽/$.
Что дороже: ИИ-оценка звонков или ручной ОКК?
Ручной контролёр физически прослушивает выборку в разы меньше 7139 звонков в месяц; ИИ-конвейер дешевле и даёт 100% охват, но не заменяет разбор оценок с менеджерами.
Почему речевая аналитика не окупается?
Чаще всего не из-за качества модели, а потому что оценки никто не разбирает с менеджерами: без еженедельного ритуала разбора они просто копятся в базе.
#ии и нейросети #контроль и надёжность #аналитика и отчётность
Присылаю новый разбор в день выхода — с цифрами, которые можно подставить в свою таблицу. Без дайджестов ради дайджестов: нет статьи — нет письма.