Что именно нужно тестировать
Точность NLU (Natural Language Understanding)
Основа всего: насколько точно агент распознаёт намерения пользователей. Тест должен включать: типовые запросы (должна быть 95%+ точность), синонимы и перефразировки, запросы с ошибками и опечатками, смешанные запросы (несколько интентов в одном сообщении), медицинский сленг и разговорную лексику.
Корректность диалогового сценария
Каждый сценарий тестируется как самостоятельный путь: все ветки диалога, все edge cases, правильность финального действия (запись, передача оператору, предоставление информации). Метод: пользовательские истории (user stories) + таблица тест-кейсов.
Интеграционное тестирование
Агент корректно читает расписание из МИС? Запись фиксируется без дублирования? Данные пациента передаются корректно? Это тестируется на реальных (тестовых) данных, не на mock-объектах.
Граничные и аварийные сценарии
Особое внимание — к критическим ситуациям: экстренные медицинские запросы ("мне очень плохо", "сильная боль в груди"), суицидальные высказывания, агрессивные или оскорбительные сообщения. Агент должен корректно эскалировать или перенаправлять, не пытаясь обработать самостоятельно.
Методологии тестирования
Redline-тестирование
Команда намеренно пытается "сломать" агента: задаёт провокационные вопросы, вводит некорректные данные, пытается получить медицинский совет, выходящий за пределы компетенции агента. Всё, что не обработано корректно — это задача для доработки.
A/B-тестирование сценариев
При наличии нескольких вариантов диалогового сценария — тестируйте их параллельно на реальных пользователях малой аудитории. Конверсия в запись и NPS-взаимодействия — ваши метрики выбора лучшего варианта.
UAT (User Acceptance Testing) с операторами
Операторы — лучшие тестировщики: они знают нетипичные запросы, которые не придут в голову аналитику. Проведите структурированное UAT-тестирование с командой КЦ за 2 недели до запуска.
Критерии готовности к запуску
- Точность NLU на тестовой выборке: 90%+ для основных интентов, 80%+ для редких
- 100% корректная обработка критических сценариев (экстренные случаи, некорректные запросы)
- Интеграционные тесты пройдены без ошибок на реальных данных
- Операторы прошли обучение и подтвердили готовность
- Процедуры мониторинга и эскалации задокументированы и протестированы
- Юридическая экспертиза: соответствие 152-ФЗ подтверждено
Мониторинг после запуска
Тестирование не заканчивается запуском. Критические метрики для ежедневного мониторинга: процент эскалаций (рост = сигнал проблем), точность по интентам в реальных диалогах, жалобы пациентов на взаимодействие с агентом, аномалии в паттернах использования.
Хорошая новость: современные ИИ-платформы предоставляют инструменты автоматического мониторинга, которые алертят при отклонении метрик. Это позволяет реагировать на проблемы до того, как они затронут значимое число пациентов.