Подготовлю и размечу данные для обучения или работы нейросети — то, на что обычно не хватает рук.
Что делаю: собираю разрозненные данные в единый формат, чищу от дублей, мусора и битых строк, привожу к нужной структуре (CSV, JSON, таблица), размечаю — категории, теги, классы, разметка текста или таблиц по вашим правилам. Готовлю датасет так, чтобы его можно было сразу подать в модель или в аналитику.
Совмещаю скрипты и ручную проверку: автоматика делает объём, глазами проверяю края и спорные случаи, потому что грязный датасет это модель, которая учится на мусоре.
Честно развожу "пусто" и "не распозналось": в отчёте видно, сколько размечено уверенно, а что ушло в ручную проверку. Скрытых потерь не будет.
Базовый кворк это чистка и приведение к формату небольшого набора. Большие объёмы и сложную разметку по правилам считаю по факту.