Конвейер предварительной обработки в каждом учебнике НЛП — строчные буквы, удаление знаков препинания, удаление стоп-слов, основы — был разработан для того, чтобы заставить работать модель разреженного набора слов. Подайте его вывод в языковую модель, и вы зря удалили сигнал...
Конвейер предварительной обработки в каждом учебнике НЛП — строчные буквы, удаление знаков препинания, удаление стоп-слов, основы — был разработан для того, чтобы заставить работать модель разреженного набора слов. Подайте его вывод в языковую модель, и вы зря удалили сигнал.
Трубопровод, которому вас учили
Каноническая последовательность: декодирование в текст, строчные буквы, удаление знаков препинания, токенизация по пробелам, удаление стоп-слов, основа, затем подсчет. Каждый шаг существует для сокращения словарного запаса. В 2005 году это имело огромное значение: модель «мешка слов» со словарем из 200 000 терминов и более чем миллионом документов представляла собой настоящую проблему с памятью, а объединение функций «Выполнение, выполнение и выполнение» в одну функцию делало матрицу меньше, а подсчеты — плотнее. Шаги представляли собой сжатие, и они соответствовали своей цели.
Ничего из этих рассуждений не переносится на модель с изученным словарем подслов. Словарный запас фиксирован и составляет от 30 000 до 200 000 единиц независимо от того, что вы отправляете, регистр — это часть информации, на которой обучалась модель, а пунктуация несет в себе синтаксис. Вы ничего не сжимаете; вы удаляете доказательства.
Какие токенизаторы подслов сделали бессмысленными
Нижний регистр. Он уничтожает самый сильный сигнал для обнаружения объектов в