Evals
О программе
Навык Evals предоставляет фреймворк для оценки агентов, реализующий лучшие практики Anthropic по тестированию и бенчмаркингу ИИ-агентов. Используйте его, когда требуется оценить, провести сравнительный анализ или регрессионное тестирование поведения агента с поддержкой код-ориентированной, модельно-ориентированной и экспертной оценки. Ключевые функции включают запись транскриптов, метрики pass@k/pass^k и интеграцию с ALGORITHM.
Быстрая установка
Claude Code
Рекомендуетсяnpx skills add danielmiessler/Personal_AI_Infrastructure -a claude-code/plugin add https://github.com/danielmiessler/Personal_AI_Infrastructuregit clone https://github.com/danielmiessler/Personal_AI_Infrastructure.git ~/.claude/skills/EvalsСкопируйте и вставьте эту команду в Claude Code для установки этого навыка
GitHub репозиторий
Часто задаваемые вопросы
Что такое Skill Evals?
Evals — это Claude Skill от danielmiessler. Skills объединяют инструкции и ресурсы, которые Claude загружает по мере необходимости, чтобы выполнять задачи, связанные с Evals, без дополнительных запросов.
Как установить Evals?
Используйте команды установки на этой странице: добавьте Evals в Claude Code как плагин или клонируйте репозиторий в каталог skills, затем перезапустите Claude, чтобы загрузить Skill.
К какой категории относится Evals?
Evals относится к категории Тестирование.
Можно ли использовать Evals бесплатно?
Да. Evals размещён на AIMCP и доступен для бесплатной установки.
Похожие навыки
Этот навык Claude запускает lm-evaluation-harness для тестирования LLM на более чем 60 стандартизированных академических задачах, таких как MMLU и GSM8K. Он предназначен для разработчиков, чтобы сравнивать качество моделей, отслеживать прогресс обучения или сообщать академические результаты. Инструмент поддерживает различные бэкенды, включая модели HuggingFace и vLLM.
Этот навык предоставляет обширные знания по реализации Cloudflare Cron Triggers для планирования запуска Workers с помощью cron-выражений. Он охватывает настройку периодических задач, заданий технического обслуживания и автоматизированных рабочих процессов, а также решение распространенных проблем, таких как неверные cron-выражения и ошибки часовых поясов. Разработчики могут использовать его для настройки планировщиков обработчиков, тестирования cron-триггеров и интеграции с Workflows и Green Compute.
Этот навык Claude предоставляет инструментарий на базе Playwright для тестирования локальных веб-приложений с помощью Python-скриптов. Он позволяет проводить проверку фронтенда, отладку интерфейса, создание скриншотов и просмотр логов, одновременно управляя жизненным циклом сервера. Используйте его для задач автоматизации браузера, но запускайте скрипты напрямую, вместо чтения их исходного кода, чтобы избежать загрязнения контекста.
Этот навык помогает разработчикам завершать готовую работу, проверяя прохождение тестов и предлагая структурированные варианты интеграции. Он направляет рабочий процесс по слиянию, созданию пул-реквестов или очистке веток после завершения реализации. Используйте его, когда ваш код готов и протестирован, чтобы систематически завершать процесс разработки.
