Медицинский / исследовательский проект: нужно готовить выписки, заключения и архивы документов для аналитики, внутренних отчётов или обучения моделей — но без риска утечки персональных данных пациентов.
Исходные материалы: PDF-выписки и заключения (текстовые файлы и сканы), в том числе многостраничные. В документах — ФИО, телефоны, адреса, даты рождения, номера полисов и другие идентификаторы.
Задача: автоматизировать подготовку «чистых» копий вместо ручной правки каждого файла администратором. Работа с чувствительными данными — передача через защищённый канал, NDA по запросу. Юридическое соответствие 152-ФЗ — зона ответственности заказчика; с моей стороны — техническая обработка по согласованным правилам.
Разработал Python-пайплайн обработки медицинских документов под задачу заказчика:
• извлечение текста из PDF; для сканов — распознавание (OCR);
• автоматический поиск персональных данных по согласованному списку полей;
• замена или удаление ФИО, телефонов, email, адресов, дат рождения, номеров полисов и других идентификаторов;
• единый формат результата: PDF, Word, TXT или JSON — по ТЗ;
• пакетная обработка архива (сотни страниц за один прогон);
• отчёт аудита: сколько документов обработано, сколько полей заменено, спорные случаи для ручной проверки;
• опционально — скрипт для повторной обработки новых файлов по тем же правилам.
Стек: Python, обработка PDF, pandas, OCR при необходимости. Архитектура позволяет добавлять новые типы документов через настройку правил, без переписывания всего кода.
• Рабочий пайплайн, который заказчик использует повторно на новых партиях документов;
• обработанные файлы без персональных данных — пригодны для аналитики, исследований и внутреннего архива;
• прозрачный отчёт аудита по каждой партии (что и сколько заменено);
• снижение ручного труда: вместо часов ручной правки — автоматическая обработка пакета;
• масштабируемость: новые типы выписок подключаются через правила, без полной переделки системы.