Llm Evaluation
Оценка качества LLM-приложений и агентов
О скиле
Учит Claude оценивать качество LLM-приложений — как проверить что ваш AI-агент или чат-бот отвечает правильно и стабильно. Скил охватывает бенчмарки для LLM, метрики RAGAS (для оценки RAG-систем), обнаружение галлюцинаций (когда AI выдумывает факты), скоринг качества ответов и построение evaluation pipeline. Также A/B тестирование промптов. Если вы строите AI-продукт — получите объективные метрики вместо ощущений кажется работает. Если ML-инженер — внедрите автоматическую проверку регрессий в AI-поведении. Работает с Claude Code.
Об источнике
Автор скила — rmyndharis. Репозиторий проекта собрал 881 звёзд на GitHub. Распространяется под лицензией MIT. Открыть репозиторий.
Как установить
Установка
Разбираю скилы вроде этого и близкие по теме «Данные и ИИ»: где брать, как собирать и применять их на практике.
Похожие скилы
// продолжай по той же профессии или категорииСвязанные гайды
// как применять скилы Claude Code на практикеЧастые вопросы
- Что такое скил «Llm Evaluation»?
- Как установить скил «Llm Evaluation» в Claude Code?
- Бесплатен ли скил «Llm Evaluation»?
Больше вопросов про Agent Skills — общий FAQ маркетплейса