MCP HubMCP Hub
SKILL·6B29BD

Evals

danielmiessler
Обновлено 2 months ago
8 просмотров
9,895
1,393
9,895
Посмотреть на GitHub
Тестированиеtesting

О программе

Evals — это фреймворк для оценки агентов, предназначенный для тестирования и бенчмаркинга Claude Code агентов, реализующий лучшие практики Anthropic. Используйте его для регрессионного тестирования, проверки возможностей и валидации поведения с помощью код-ориентированных, модельно-ориентированных оценок или оценок человеком. Он предоставляет запись транскриптов, метрики pass@k/pass^k и интегрируется с системой ALGORITHM.

Быстрая установка

Claude Code

Рекомендуется
Основной
npx skills add danielmiessler/Personal_AI_Infrastructure -a claude-code
Команда плагинаАльтернативный
/plugin add https://github.com/danielmiessler/Personal_AI_Infrastructure
Git клонированиеАльтернативный
git clone https://github.com/danielmiessler/Personal_AI_Infrastructure.git ~/.claude/skills/Evals

Скопируйте и вставьте эту команду в Claude Code для установки этого навыка

GitHub репозиторий

danielmiessler/Personal_AI_Infrastructure
Путь: Releases/v2.4/.claude/skills/Evals
0
aiaugmentationhumansproductivity
FAQ

Часто задаваемые вопросы

Что такое Skill Evals?

Evals — это Claude Skill от danielmiessler. Skills объединяют инструкции и ресурсы, которые Claude загружает по мере необходимости, чтобы выполнять задачи, связанные с Evals, без дополнительных запросов.

Как установить Evals?

Используйте команды установки на этой странице: добавьте Evals в Claude Code как плагин или клонируйте репозиторий в каталог skills, затем перезапустите Claude, чтобы загрузить Skill.

К какой категории относится Evals?

Evals относится к категории Тестирование.

Можно ли использовать Evals бесплатно?

Да. Evals размещён на AIMCP и доступен для бесплатной установки.

Похожие навыки

evaluating-llms-harness
Тестирование

Этот навык Claude запускает lm-evaluation-harness для тестирования LLM на более чем 60 стандартизированных академических задачах, таких как MMLU и GSM8K. Он предназначен для разработчиков, чтобы сравнивать качество моделей, отслеживать прогресс обучения или сообщать академические результаты. Инструмент поддерживает различные бэкенды, включая модели HuggingFace и vLLM.

Просмотреть навык
cloudflare-cron-triggers
Тестирование

Этот навык предоставляет обширные знания по реализации Cloudflare Cron Triggers для планирования запуска Workers с помощью cron-выражений. Он охватывает настройку периодических задач, заданий технического обслуживания и автоматизированных рабочих процессов, а также решение распространенных проблем, таких как неверные cron-выражения и ошибки часовых поясов. Разработчики могут использовать его для настройки планировщиков обработчиков, тестирования cron-триггеров и интеграции с Workflows и Green Compute.

Просмотреть навык
webapp-testing
Тестирование

Этот навык Claude предоставляет инструментарий на базе Playwright для тестирования локальных веб-приложений с помощью Python-скриптов. Он позволяет проводить проверку фронтенда, отладку интерфейса, создание скриншотов и просмотр логов, одновременно управляя жизненным циклом сервера. Используйте его для задач автоматизации браузера, но запускайте скрипты напрямую, вместо чтения их исходного кода, чтобы избежать загрязнения контекста.

Просмотреть навык
finishing-a-development-branch
Тестирование

Этот навык помогает разработчикам завершать готовую работу, проверяя прохождение тестов и предлагая структурированные варианты интеграции. Он направляет рабочий процесс по слиянию, созданию пул-реквестов или очистке веток после завершения реализации. Используйте его, когда ваш код готов и протестирован, чтобы систематически завершать процесс разработки.

Просмотреть навык