Собственный исследовательский и инженерный проект: воспроизводимо проверить, где русскоязычный AI-агент или RAG-система нарушает точные условия, путается в конфликтующем контексте, неправильно отказывает или следует prompt injection. Это не оплаченный клиентский кейс, а открытый проверяемый eval-проект.
Создал 30 оригинальных синтетических hard-кейсов по 6 категориям, JSON Schema, детерминированный scorer без LLM-судьи, CLI, Markdown-отчёты и CI. Отдельно разделил смысловые ошибки и сбои output-протокола. Провёл контролируемые локальные прогоны моделей, сохранил raw outputs, параметры и provenance, затем сформировал план исправлений и повторных проверок.
Текущая версия проходит 12 автоматических тестов. На контролируемом прогоне Ornith 1.0 9B увеличение лимита ответа с 512 до 768 токенов подняло raw overall score с 0.4527 до 0.5481, а число завершений по length снизило с 5/30 до 1/30. Репозиторий содержит набор, scorer, результаты, границы доказательности и формат фиксированного 48-часового аудита. Это измерение конкретной конфигурации, а не общий рейтинг модели.