При создании приложений LLM мы часто спешим передать пользовательские данные непосредственно в наши запросы или базы данных RAG. Но что происходит, когда этими данными являются паспорт, водительские права или медицинская карта? Отправка необработанных документов, удостоверяющих личность, через внешний...
При создании приложений LLM мы часто спешим передать пользовательские данные непосредственно в наши запросы или базы данных RAG. Но что происходит, когда этими данными являются паспорт, водительские права или медицинская карта? Отправка необработанных документов, удостоверяющих личность, через внешнюю границу доверия в LLM API представляет собой огромный риск для конфиденциальности.
В этом руководстве мы создаем SecureKiosk AI, «периферийный привратник» с открытым исходным кодом. Мы будем использовать локальное компьютерное зрение и НЛП для перехвата документов, удостоверяющих личность, извлечения текста и детерминированной маскировки личной информации (PII), прежде чем она когда-либо достигнет LLM.
Вот технологический стек, который мы будем использовать:
OpenCV и Tesseract (компьютерное зрение и распознавание символов): для очистки изображения от шума и локального извлечения необработанного текста.
Microsoft Presidio & SpaCy (NLP): для обнаружения и удаления конфиденциальных личных данных в памяти.
LangGraph (оркестровка): для управления конвейером как устойчивым конечным автоматом.
Streamlit: создать чистый интерактивный интерфейс.
Трубопроводная архитектура
Вместо того, чтобы полагаться на линейные, хрупкие скрипты Python, которые аварийно завершают работу, когда извлечение текста дает плохие результаты, конвейер работает как конечный автомат:
Архитектурный конвейер
Давайте начнем!
Шаг 1: Настройка среды
Потому что мы
