Задача. Организовать и автоматизировать сбор, сверку, коррекцию и накопление медиаданных из десятков источников — парсинг сайтов, почты, электронных таблиц. Данные на входе сильно отличаются: своя кодировка, структура, опечатки, повторы, локализованное время. Ошибки в данных необходимо минимизировать.
Решение. Конвейер принимает данные из почты, парсит сайты, разбирает в единую структуру, вычищает текст, сверяет с первоисточником. Данные сохраняются в базе, обрабатываются на сервере. Проверки на каждом шаге ищут расхождения с источником, разрывы последовательности и дубли: оператору уходит сигнал, запись попадает в отчёт, наружу ошибка не выходит.
Результат. Ежедневная отгрузка данных клиентам по запросу из десятков первоисточников — и всё это почти без ручного труда. Клиенты получают данные в нужном им формате. Ручное участие остаётся там, где требуется оценка оператора.