Отраслевые хабы и кейсы

Как клиника тестировала робота на пилоте: дневник

Пилот — это не «включили и смотрим», а структурированный эксперимент на несколько недель: с гипотезами, замерами и правками по ходу. Чтобы показать, как он устроен изнутри, мы собрали условный дневник тестирования голосового робота в клинике — обобщённую хронику типичного пилота, а не отчёт конкретного заказчика. В нём видно, что происходит на каждой неделе, какие цифры замеряют, где сценарий приходится подкручивать и как в итоге принимают решение о полном запуске. Такой дневник полезен как шаблон: по нему легко спланировать собственный пилот и не упустить важные шаги.

Как клиника тестировала робота на пилоте: дневник

Дневник пилота — это хроника четырёхнедельного теста, в котором клиника проверяет гипотезы про голосового робота на реальных звонках. Каждую неделю снимают метрики, слушают диалоги и правят сценарий, а в конце сравнивают цифры с целями и решают, запускать ли робота на весь поток. Ниже — обобщённый, условный дневник такого теста.

Смысл пилота — не поверить обещаниям, а измерить факт на небольшом объёме, где ошибка стоит дёшево. Структура «гипотеза — замер — правка» превращает тест из наблюдения в управляемый эксперимент с понятным итогом.

Пройдём по дневнику неделя за неделей: от подготовки и первых звонков до финального замера и решения.

Зачем клинике вообще пилот

Пилот нужен, чтобы проверить робота на своих реальных звонках до того, как доверить ему весь поток. Обещания вендора и демонстрации — это одно, а поведение на живых пациентах конкретной клиники — другое. Ограниченный тест ловит несовпадения на малом объёме, где их легко исправить, а цена ошибки невелика.

Вторая задача пилота — собрать честные цифры для решения. Без замера «до» и «после» спор о пользе робота остаётся вкусовым, а с данными он становится арифметикой, с которой трудно поспорить даже скептику в команде.

Поэтому пилот — это и проверка качества, и сбор доказательной базы одновременно.

Подготовка: гипотезы и метрики до старта

Нулевая неделя уходит на подготовку: клиника формулирует гипотезы и выбирает метрики. Гипотезы звучат конкретно — например, «робот ответит на большинство звонков в нерабочее время» и «доля недозвонов в час пик снизится». Под каждую подбирают цифру, которую будут мерить, чтобы потом было с чем сравнивать.

Одновременно снимают базовые показатели «до»: сколько звонков теряется, какова скорость ответа, сколько записей делается в день. Без этой отправной точки любой результат пилота нельзя будет честно оценить — не с чем сравнить.

Хорошая подготовка экономит недели: чётко заданные гипотезы и метрики превращают пилот в измеримый эксперимент, а не в размытое наблюдение.

Неделя первая: первый поток звонков

Первая неделя — робот встаёт на 20–30% потока, обычно на нерабочее время или на конкретный тип звонков. Команда каждый день слушает записи диалогов и отмечает, где робот отвечает уверенно, а где путается. Это самый насыщенный на находки период: всплывает то, что не видно ни в демонстрации, ни в теории.

Первые дни почти всегда обнажают мелкие огрехи сценария: непонятая формулировка, лишняя ветка, неудачная реплика. Это нормально и именно ради этого пилот и затевался — поймать такое на малом объёме, а не на всём потоке сразу.

К концу недели складывается список правок, которые внесут дальше, и первое ощущение, где робот уже полезен.

Неделя вторая: правки сценария

Вторая неделя посвящена корректировкам: команда переписывает неудачные реплики, укорачивает длинные ветки, добавляет ответы на вопросы, которых не предусмотрели. После каждой правки снова слушают звонки и смотрят, стало ли лучше. Диалог на глазах становится теплее и точнее, а доля обращений «дайте человека» падает.

Здесь виден главный принцип пилота — быстрый цикл «замер, правка, замер». Одна итерация за 1–2 дня ощутимо двигает качество, потому что правки опираются на реальные звонки, а не на догадки о том, как будут говорить пациенты.

К концу второй недели сценарий обычно перестаёт спотыкаться на типовых обращениях и держит их уверенно, а команда начинает доверять роботу более сложные и разнообразные звонки.

Неделя третья: ночь и часы пик

Третья неделя проверяет робота на нагрузке: его пускают на ночные звонки и на пиковые часы, все 24 часа в сутки, когда живая регистратура захлёбывается. Здесь смотрят не столько на отдельные диалоги, сколько на способность держать поток — отвечать параллельно, не терять обращения и корректно распределять записи.

Именно на этой неделе часто впервые видно денежный смысл: ночные звонки, которые раньше пропадали, теперь превращаются в записи, а в час пик исчезают короткие гудки. Цифры недозвонов заметно расходятся с базовой линией «до».

Как раскрыть ночной поток полнее, показывает разбор про выбор голосового бота под задачи клиники.

Неделя четвёртая: замер результата

Четвёртая неделя — финальный замер. Команда собирает те же метрики, что снимала «до», и кладёт их рядом: доля отвеченных звонков, число записей роботом, сокращение недозвонов, возвращённая выручка. Сравнение с отправной точкой и есть итог пилота — оно показывает, оправдались ли гипотезы в цифрах.

На этой неделе стараются не менять сценарий, чтобы замер получился чистым: любые правки в разгар финального измерения смазали бы картину и лишили бы итог доказательной силы. Робот работает в устоявшемся режиме, а команда просто фиксирует показатели за полную неделю и готовит сравнительную таблицу.

Результат ложится в основу решения — с фактами, а не с ощущениями.

Что показали цифры пилота

К концу пилота на руках оказывается таблица «до и после» по каждой гипотезе. Обычно она показывает рост доли отвеченных звонков, снижение недозвонов в пик и ненулевой поток записей из нерабочего времени, которого раньше не было вовсе. Даже осторожный результат чаще всего перекрывает стоимость сервиса.

Ценность такой таблицы в том, что она снимает споры: вместо «мне кажется, стало лучше» появляется «недозвоны упали на столько-то, записей ночью — столько-то». С этими цифрами разговор о полном запуске идёт быстро и по делу.

Как перевести показатели пилота в деньги и окупаемость, разобрано в материале про ROI голосового бота.

Какие правки внесли по ходу теста

За четыре недели типичный пилот накапливает десятки мелких правок: переписанные реплики, добавленные ответы на неожиданные вопросы, уточнённая передача сложных случаев человеку, донастроенное распределение записей. Ни одна из них по отдельности не велика, но вместе они и превращают сырой сценарий в рабочий.

Важное наблюдение пилота — почти все правки рождаются из реальных звонков, а не из планов. Пациенты спрашивают не то и не так, как ожидалось, и именно эта разница между теорией и практикой и есть главная ценность теста.

Поэтому дневник правок сам по себе полезен: он показывает, каким станет сценарий к моменту полного запуска.

Ошибки, которые заметили в пилоте

Пилот подсвечивает не только силу робота, но и организационные слабые места клиники. По ходу теста часто всплывает, что услуги в системе описаны неполно, расписание ведётся неаккуратно, а часть вопросов пациентов вообще не имеет готового ответа. Робот работает зеркалом, отражая неразбериху в данных.

Это ценный побочный эффект: клиника наводит порядок в собственных процессах, потому что робот требует точных данных для корректной работы. Многие огрехи, которые терпели годами, всплывают и чинятся именно на пилоте.

Смежные грабли собраны в разборе про ошибки при внедрении бота.

Как приняли решение по итогам пилота

Решение о полном запуске принимают, положив рядом цели и факт: если ключевые гипотезы подтвердились в цифрах и результат перекрывает стоимость, робота расширяют на весь поток. Если часть гипотез не сошлась, смотрят, дело в сценарии, который ещё дорабатывается, или в неверных ожиданиях, заданных на старте.

Ценность заранее заданных метрик здесь максимальна: решение опирается на согласованные до пилота мерки, а не на послевкусие. Никто не может задним числом переставить планку, потому что цель была зафиксирована в самом начале.

Так пилот заканчивается не спором, а управленческим выводом на основе данных.

Чек-лист запуска собственного пилота

Собственный пилот легко спланировать по короткому чек-листу, собранному из этого дневника. Он удерживает тест в рамках управляемого эксперимента и не даёт скатиться в бесцельное наблюдение без выводов. Пройдите пункты до старта — и четыре недели дадут ясный ответ вместо расплывчатых впечатлений.

  • Сформулированы конкретные гипотезы про пользу робота.
  • Сняты базовые метрики «до»: недозвоны, скорость ответа, записи.
  • Определён ограниченный участок потока для теста.
  • Заложен цикл «замер — правка — замер» с еженедельным разбором.
  • Финальная неделя идёт без правок для чистого замера.
  • Критерии решения о запуске согласованы заранее.

Когда эти пункты закрыты, пилот превращается из размытого наблюдения в измеримое доказательство, на которое можно спокойно опереться при решении о полном запуске робота в клинике.

S

Команда Stexa AI

Команда разработки голосового AI-оператора Stexa. Пишем о голосовых ботах, AI-технологиях и автоматизации звонков с 2025 года.

Часто задаваемые вопросы

Этот дневник — про конкретную клинику?
Нет, дневник условный и обобщённый: он собирает типичную хронику пилота, а не пересказывает реального заказчика с именами или отзывами. Цифры и наблюдения иллюстративны. Задача дневника — служить шаблоном, по которому удобно спланировать собственный тест, а не отчётом конкретного внедрения.
Сколько должен длиться пилот робота?
Обычно достаточно нескольких недель: недели на подготовку и замер базы, пары недель на отладку сценария по реальным звонкам и финальной недели на чистый замер результата. Главное — не длительность сама по себе, а прохождение цикла «гипотеза — замер — правка» и наличие метрик до и после.
Что измерять во время пилота?
Те же показатели до и после: доля отвеченных звонков, число записей роботом, сокращение недозвонов в час пик, поток обращений из нерабочего времени и итоговая возвращённая выручка. Базовые метрики снимают до старта, иначе результат не с чем будет честно сравнить в финале.
Почему на финальной неделе нельзя править сценарий?
Чтобы замер был чистым. Если менять диалог в разгар итогового измерения, показатели смажутся и станет непонятно, что на них повлияло — работа робота или свежие правки. Поэтому последнюю неделю робот работает в устоявшемся режиме, а команда лишь фиксирует цифры за полный период.
Как решить, запускать ли робота на весь поток?
Положить рядом заранее заданные цели и фактические цифры пилота. Если ключевые гипотезы подтвердились и результат перекрывает стоимость — расширять. Если нет, разобраться, дело в дорабатываемом сценарии или в завышенных ожиданиях на старте. Заранее согласованные метрики не дают переставить планку задним числом.
Стоит попробовать

Хватит читать — попробуйте Stexa на деле

7 дней бесплатно, без карты. Подключение к вашему номеру за 15 минут.