Eval Harness
Фреймворк оценки качества Claude-сессий
О скиле
Формальный фреймворк для оценки качества сессий Claude Code на принципах EDD (Eval-Driven Development — разработка, управляемая оценками). Измеряет качество вывода агента, риски регрессий и точность выбора модели по конкретным задачам. Помогает понять: этот промпт стал лучше или хуже после изменений? Какая модель справляется точнее с вашими задачами? Если вы серьёзно работаете с AI-агентами, это инструмент для перехода от «чувствую что работает» к «измеряю что работает». Из ECC, 215k stars. Подключается к Claude Code.
Об источнике
Автор скила — affaan-m. Репозиторий проекта собрал 220k звёзд на GitHub. Распространяется под лицензией MIT. Открыть репозиторий.
Как установить
Установка
Разбираю скилы вроде этого и близкие по теме «Данные и ИИ»: где брать, как собирать и применять их на практике.
Похожие скилы
// продолжай по той же профессии или категорииСвязанные гайды
// как применять скилы Claude Code на практикеЧастые вопросы
- Что такое скил «Eval Harness»?
- Как установить скил «Eval Harness» в Claude Code?
- Бесплатен ли скил «Eval Harness»?
Больше вопросов про Agent Skills — общий FAQ маркетплейса