За 1 день проверю одну конфигурацию AI-бота, агента или RAG-системы на 10 сложных русскоязычных сценариях. Это короткий платный пилот: вы быстро увидите, где система ломается, прежде чем заказывать большой аудит.
Что проверю:
— точные и конфликтующие инструкции;
— отрицания и неоднозначность;
— длинный контекст;
— соблюдение приоритета инструкций;
— формат JSON/API;
— корректность отказов.
Что получите:
— таблицу 10 кейсов с входом, сырым ответом и вердиктом;
— итоговый score и разбивку по категориям;
— объяснение каждого провала;
— 3 приоритетных исправления;
— повторную проверку до 3 проваленных кейсов после ваших правок.
В фикс входят один endpoint, модель и конфигурация. Для старта нужны описание целевого поведения и тестовый endpoint либо готовые raw-ответы. Секретные ключи не нужны, данные должны быть обезличены. Если пилот полезен, расширю набор до 30–100 кейсов отдельным этапом.