Постановка задачи
Распознать «здравствуйте» в записи — задача, которая в целом решена. Труднее понять, кому это «здравствуйте» сказано, кто именно стоит у кассы в данный момент, и было ли приветствие вообще, если клиент коротко ответил «ага» на фоне работающего холодильника.
Дано: сеть АЗС, где ручной аудит покрывает несколько процентов смен. Всё остальное — «слепая зона»: смены без проверки, нарушения чек-листа без последствий. Заказчик хотел закрыть её с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования — только то, что уже есть на точках.
Асимметрия голосов
Ограничение, которое определило всю архитектуру, оказалось не техническим, а поведенческим. Кассир стоит у микрофона и говорит громко, развёрнутыми фразами — называет сумму, предлагает карту лояльности, прощается. Клиент отвечает коротко, тихо — и иногда вообще ограничивается кивком.
Стандартный ASR-пайплайн из этой пары слышит только одну сторону — ту, что у микрофона. Задача «засчитано ли приветствие» превращается в пространственно-временную: прежде чем разбирать речь, нужно понять, кто произнёс слово и был ли второй человек у кассы в этот момент.
Видео как фундамент
Из этого следует прямой вывод: видео первично. Без стабильного идентификатора клиента и чётких временных границ сессии аудиоаналитика работает вхолостую — она получает звуковой поток без понимания того, кто и когда стоял перед кассой.
Начали с трекинга. Видеопоток стал основным источником разметки: именно он даёт временные границы каждой сессии обслуживания и идентификацию участников. Аудиоаналитика подключается вторым слоем — уже после того, как видео выстраивает пространственный контекст.