Разработка ML-модуля для AI-платформы Primitive AI, предназначенной для автоматизации анализа девелоперских участков и предварительной feasibility-проверки объектов недвижимости.
До внедрения модуля значительная часть анализа выполнялась вручную: специалисту требовалось изучать изображения участка, определять объекты и зоны интереса, оценивать пространственные параметры и переносить результаты в структурированный формат.
Моей задачей было спроектировать end-to-end пайплайн, который принимает изображение, выполняет Computer Vision анализ, дополняет результаты через Vision LLM и возвращает данные в строгом структурированном виде для дальнейшего использования другими сервисами платформы.
Я спроектировал модуль обработки по схеме:
Image → Computer Vision → Vision LLM → Structured Output
Пайплайн включал:
— предварительную обработку и нормализацию изображений;
— выделение областей интереса — ROI;
— сегментацию объектов и отдельных зон;
— детекцию значимых элементов изображения;
— оценку глубины и пространственных отношений;
— интерпретацию сцены через Vision LLM;
— нормализацию и объединение результатов разных моделей;
— преобразование вывода моделей в типизированные структуры данных.
Для сегментации использовался SAM, для depth estimation — MiDaS. Vision LLM применялась для семантического анализа изображения и извлечения параметров, которые сложно получить только классическими CV-моделями.
Inference был вынесен в отдельный микросервисный API. Это позволило независимо обновлять модели, масштабировать обработку и подключать модуль к основной платформе без жёсткой зависимости между компонентами.
Для взаимодействия сервисов я ввёл строгие Pydantic-контракты. Они обеспечивали валидацию данных, предсказуемый structured output и упрощали замену отдельных ML-моделей без изменения всей системы.
Также была предусмотрена обработка неполных ответов моделей, некорректных координат, отсутствующих объектов и расхождений между результатами разных этапов пайплайна.
Создан работающий ML-модуль, автоматизирующий обработку изображений девелоперских участков и подготовку структурированных данных для дальнейшего анализа.
Ручной процесс был преобразован в воспроизводимый автоматизированный пайплайн, объединяющий сегментацию, depth estimation, Computer Vision и Vision LLM.
Микросервисная архитектура позволила независимо развивать ML-компоненты и масштабировать обработку на большое количество объектов. Типизированные Pydantic-контракты снизили количество ошибок при интеграции и упростили замену моделей и изменение формата результатов.
Мой вклад включал проектирование архитектуры ML-модуля, выбор и интеграцию моделей, разработку пайплайна обработки изображений, создание API-контрактов и интеграцию модуля с основной AI-платформой.
Евгений. ML разработчик. Делал чат-бота на основе моего модуля.
East Tyler. СЕО
Артём. Наш фронтендер