Каждому бизнесу нравится представлять свои данные в виде чистых строк в электронной таблице, аккуратно размеченных и готовых к анализу. Реальность выглядит совсем не так. Данные поступают в виде отсканированных счетов с пятнами кофе, электронных писем клиентов, полных опечаток, электронных таблиц...
Каждому бизнесу нравится представлять свои данные в виде чистых строк в электронной таблице, аккуратно размеченных и готовых к анализу. Реальность выглядит совсем не так. Данные поступают в виде отсканированных счетов с пятнами от кофе, электронных писем клиентов, полных опечаток, электронных таблиц с объединенными ячейками, PDF-файлов, в которых текст идет боком, и баз данных, в которых половина полей пуста. Это неструктурированные данные, с которыми предприятиям фактически приходится работать каждый день.
Чтобы системы искусственного интеллекта были полезны в реальном мире, им необходимо справляться с этим хаосом и не разваливаться. Вот как современный ИИ обрабатывает беспорядочные, неструктурированные данные и почему эти возможности важнее, чем грубая вычислительная мощность.
Почему беспорядочные данные ломают традиционные системы
Традиционное программное обеспечение работает по жестким правилам. Если программа ожидает дату в формате ДД/ММ/ГГГГ и вместо этого получает ММ-ДД-ГГ, она часто терпит неудачу или выдает ошибку. Системы обработки данных, основанные на правилах, работают хорошо, когда входные данные предсказуемы, но реальные данные редко остаются предсказуемыми в течение длительного времени.
В почтовом ящике службы поддержки могут быть сообщения на трех языках, неполные предложения и сарказм, который полностью меняет смысл предложения. Пакет счетов может прийти от двадцати разных поставщиков, каждый из которых