Голосовая биометрия используется в телефонных банковских операциях, разблокировке устройств и персонализации помощника. Все это основано на одном предположении: ваш голос достаточно стабилен, чтобы машина могла его распознавать. Я провел контролируемый эксперимент, чтобы найти...
Голосовая биометрия используется в телефонных банковских операциях, разблокировке устройств и персонализации помощника. Все это основано на одном предположении: ваш голос достаточно стабилен, чтобы машина могла его распознавать. Я провел контролируемый эксперимент, чтобы выяснить, какая часть этого предположения сохраняется при контакте с человеком, который простужен, устал или просто говорит немного иначе, чем обычно.
Четыре динамика, одинаковые предложения, контролируемые изменения высоты звука, фонации и артикуляции, фиксированное положение и усиление микрофона. Каждое высказывание проецировалось через три различные архитектуры кодирования — ECAPA-TDNN, кодер динамика ResNet и WavLM-base-plus-sv.
Результат
Голос одного оратора был на 0,7 полутона ниже его нормального тона. Это ниже порога, при котором слушатель вообще надежно слышит любые изменения. Его проверочный балл упал на 0,238 по всем восьми предложениям.
Его волновало не поле. Его отношение гармоник к шуму упало с 10,63 до 8,39 дБ за тот же блок. Кодировщик реагировал на фонацию — на то, как вибрировали голосовые связки, — и число тонов оказалось именно тем, что оказалось легко измерить.
На протяжении всего эксперимента все 30 ячеек динамика × состояния × кодера были отрицательными.