ИИ для бизнеса
Как оценивать качество работы ИИ-сотрудника
Как оценивать качество ИИ-сотрудника: тестовые сценарии, точность, ошибки, handoff, human approval, KPI процесса и регулярный контроль.
Красивый диалог на демо не доказывает, что цифровой сотрудник готов к работе.
Качество нужно проверять на реальных сценариях и метриках конкретного процесса.
Начните с тестового набора
Соберите реальные случаи.
Не только простые.
Нужны:
- обычные;
- неполные;
- неоднозначные;
- конфликтные;
- выходящие за роль;
- требующие approval;
- требующие handoff;
- случаи с ошибкой интеграции.
Проверяйте весь процесс
Например, Максимус может правильно ответить клиенту, но забыть создать лид.
Поэтому нужно смотреть:
- ответ;
- использованный источник;
- классификацию;
- действие;
- запись в CRM;
- handoff;
- approval;
- итог.
Фактическая точность
Особенно важна для:
- цен;
- условий;
- статусов;
- документов;
- юридических положений.
Ошибка в стиле менее критична, чем выдуманная цена.
Handoff
Хороший ИИ умеет передавать задачу.
Поэтому метрика "как можно меньше handoff" неправильная сама по себе.
Нужно смотреть, был ли handoff уместным.
Approval
Полезно анализировать:
- долю подтвержденных действий;
- долю отклоненных;
- причины отказа.
Если предложение регулярно отклоняется, правило нужно менять.
Метрики процесса
Продажи
- скорость ответа;
- полнота квалификации;
- ошибки по фактам;
- качество передачи лида.
Поддержка
- решение без оператора;
- правильность ответа;
- повторные обращения;
- причины handoff.
Внутренний ассистент
- найден ли источник;
- актуален ли документ;
- сколько запросов без ответа.
Документы
- пропущенные изменения;
- ложные замечания;
- время проверки человеком.
Технические ошибки
Нужно отдельно считать:
- timeout;
- ошибки API;
- отсутствие прав;
- сбой внешней системы;
- некорректные параметры;
- дубли действий.
Это не то же самое, что ошибка модели.
Регулярная переоценка
Качество может измениться после:
- обновления базы;
- смены модели;
- изменения промпта;
- новой интеграции;
- изменения процесса;
- добавления инструмента.
Поэтому тестовый набор стоит запускать повторно после важных изменений.
Не ищите одну универсальную метрику
"Точность 95%" мало о чем говорит без определения.
95% чего?
Классификации? Фактов? Действий? Полей?
Лучше использовать несколько метрик, связанных с реальной работой.
Связь с экономикой
Сначала нужно добиться приемлемого качества.
Только затем оценивать экономию.
Дешевый ИИ, который создает много ручных исправлений, может ухудшить процесс.