Классификация — это задачи языковых моделей, к которым чаще всего привыкают и реже всего того заслуживают. Помещение документа в одну из восьми корзин — это проблема закрытого вывода, для которой и были созданы классические методы, и пробел в...
Классификация — это задачи языковых моделей, к которым чаще всего привыкают и реже всего того заслуживают. Помещение документа в одну из восьми корзин — это задача закрытого вывода, для которой и были созданы классические методы, а разрыв в эксплуатационных расходах составляет три порядка.
Четыре подхода
1. Правила
Списки ключевых слов и регулярные выражения в порядке приоритета. Нулевые обучающие данные, нулевые затраты на выводы, полностью проверяемые, и вы можете исправить конкретную ошибку в одной строке. Они не справляются с синонимами, отрицанием и всем, что требует суждения, и накапливают исключения до тех пор, пока никто не прикоснется к файлу. Тем не менее, это правильный ответ для нескольких однозначных, высокоточных категорий — и всегда стоит сначала написать, потому что их создание покажет вам, что на самом деле представляют собой категории.
2. Линейная модель по разреженным функциям
TF-IDF или символьные n-граммы в логистическую регрессию или линейную SVM. Обучается на ноутбуке за секунды, прогнозирует менее чем за миллисекунду, а изученные веса можно напрямую проверить — вы можете распечатать двадцать функций, управляющих классом. Книга Ванга и Мэннинга «Базовые линии и биграммы» (ACL 2012) является постоянным напоминанием о том, что тщательно созданная версия этого rem