АБСАМАД МАНТУРОВ ABSAMADMANTUROV
Python, AI-автоматизация, API и порядок в данных
Рейтинг
63
№ 66 652 в каталоге
Отзывы
0
Профессионализм
-/10
Коммуникация
- /10
Город
Москва
На сайте с
2026 года
Юридический статус
Самозанятый

ru-hardness-30: аудит русскоязычных AI-агентов и RAG

Используемые навыки API Python Анализ данных Искусственный интеллект Тестирование API

Описание

Собственный исследовательский и инженерный проект: воспроизводимо проверить, где русскоязычный AI-агент или RAG-система нарушает точные условия, путается в конфликтующем контексте, неправильно отказывает или следует prompt injection. Это не оплаченный клиентский кейс, а открытый проверяемый eval-проект.

Решение

Создал 30 оригинальных синтетических hard-кейсов по 6 категориям, JSON Schema, детерминированный scorer без LLM-судьи, CLI, Markdown-отчёты и CI. Отдельно разделил смысловые ошибки и сбои output-протокола. Провёл контролируемые локальные прогоны моделей, сохранил raw outputs, параметры и provenance, затем сформировал план исправлений и повторных проверок.

Результат

Текущая версия проходит 12 автоматических тестов. На контролируемом прогоне Ornith 1.0 9B увеличение лимита ответа с 512 до 768 токенов подняло raw overall score с 0.4527 до 0.5481, а число завершений по length снизило с 5/30 до 1/30. Репозиторий содержит набор, scorer, результаты, границы доказательности и формат фиксированного 48-часового аудита. Это измерение конкретной конфигурации, а не общий рейтинг модели.

Оценили проект:

Другие проекты

Все проекты →
Веб-разработка и IT Сравнение прайсов поставщиков: Python + Excel-отчёт
Сравнение прайсов поставщиков: Python + Excel-отчёт
12
Дизайн и Брендинг Деловая презентация с финансовой моделью — демонстрационный кейс
Деловая презентация с финансовой моделью — демонстрационный кейс
5