TF-IDF — это две идеи, перемноженные вместе, и обе они — это то, во что вы уже верите о языке. Стоит реализовать один раз с нуля, потому что версия в вашей библиотеке имеет четыре варианта конфигурации, меняющие цифры...
TF-IDF — это две идеи, перемноженные вместе, и обе они — это то, во что вы уже верите о языке. Это стоит реализовать один раз с нуля, потому что версия в вашей библиотеке имеет четыре варианта конфигурации, которые меняют числа и обычно оставляются по умолчанию, которые никто не читает.
Две интуиции
Первое: термин, который часто встречается в документе, вероятно, и есть то, о чем этот документ. Это частота термина, и он сам по себе ранжирует каждый документ по тому, сколько раз в нем встречается этот термин.
Второе исправляет это: термин, который встречается почти в каждом документе, ничего не говорит вам о том, какой документ вам нужен. Карен Сперк Джонс изложила это в книге «Статистическая интерпретация специфичности термина и ее применение при поиске» (Journal of Documentation, 1972), и предложенная ею система взвешивания — масштабирование веса термина пропорционально количеству документов, содержащих его — до сих пор используется всеми. Этой идее пятидесятилетней давности, которая с тех пор пережила все изменения в представлении, и она достаточно необычна, чтобы на нее стоит обратить внимание.
Умножьте их, и каждый термин в каждом документе получит высокий вес только в том случае, если этот термин часто встречается здесь и редко встречается в других местах. Документ становится разреженным вектором по словарю.