Публичные веб-данные становятся более практичным источником данных для обучения мультимодальных моделей. Команды используют его для создания или обновления наборов изображений и текста, сбора регионального контента о продуктах, отслеживания изменений общедоступных страниц и сбора более реалистичных оценок...
Публичные веб-данные становятся более практичным источником данных для обучения мультимодальных моделей.
Команды используют его для создания или обновления наборов изображений и текста, сбора регионального контента о продуктах, отслеживания изменений общедоступных страниц и сбора более реалистичных наборов оценок. Ценность очевидна: Интернет обеспечивает масштаб, разнообразие и свежесть, чего зачастую не могут обеспечить статические внутренние наборы данных.
Но есть разница между однократным сбором данных и поддержанием стабильности конвейера сбора с течением времени.
Эта разница становится очень заметной, как только рабочая нагрузка возрастает.
Настоящим узким местом часто является не синтаксический анализ.
Во многих мультимодальных рабочих процессах первое успешное сканирование — не самая сложная часть. Самое сложное начинается, когда конвейер расширяется:
больше целевых доменов
больше географических регионов
более динамичные страницы
больше повторяющихся заданий обновления
повышенная чувствительность к рендерингу страниц и непрерывности сеанса
В этот момент команды часто обнаруживают, что уровень извлечения не является главной проблемой. Основная проблема – стабильность приобретения.
Почему это важно для мультимодальных наборов данных
Для мультимодального обучения запрос не должен полностью провалиться, чтобы создать слабую выборку.
Задание может по-прежнему возвращать данные, неся при этом скрытые проблемы, например