MCP HubMCP Hub
SKILL·1536D0

evaluation-metrics

mattnigh
Обновлено 3 months ago
11 просмотров
22
1
22
Посмотреть на GitHub
Другоеaitestingautomationdata

О программе

Этот навык Claude автоматически активируется при оценке производительности языковых моделей, обеспечивая корректные метрики и тестирование. Он обрабатывает оценочные наборы данных, вычисляет метрики, обеспечивает A/B-тестирование и реализует схемы оценки "LLM-как-эксперт". Используйте его, когда требуется структурированное отслеживание экспериментов и строгая оценка производительности ваших LLM-приложений.

Быстрая установка

Claude Code

Рекомендуется
Основной
npx skills add mattnigh/skills_collection -a claude-code
Команда плагинаАльтернативный
/plugin add https://github.com/mattnigh/skills_collection
Git клонированиеАльтернативный
git clone https://github.com/mattnigh/skills_collection.git ~/.claude/skills/evaluation-metrics

Скопируйте и вставьте эту команду в Claude Code для установки этого навыка

GitHub репозиторий

mattnigh/skills_collection
Путь: collection/ricardoroche__ricardos-claude-code__claude__skills__evaluation-metrics__SKILL.md
0
FAQ

Часто задаваемые вопросы

Что такое Skill evaluation-metrics?

evaluation-metrics — это Claude Skill от mattnigh. Skills объединяют инструкции и ресурсы, которые Claude загружает по мере необходимости, чтобы выполнять задачи, связанные с evaluation-metrics, без дополнительных запросов.

Как установить evaluation-metrics?

Используйте команды установки на этой странице: добавьте evaluation-metrics в Claude Code как плагин или клонируйте репозиторий в каталог skills, затем перезапустите Claude, чтобы загрузить Skill.

К какой категории относится evaluation-metrics?

evaluation-metrics относится к категории Другое.

Можно ли использовать evaluation-metrics бесплатно?

Да. evaluation-metrics размещён на AIMCP и доступен для бесплатной установки.

Похожие навыки

model-selection
Другое

Этот навык Claude автоматически направляет выбор модели и провайдера для LLM-приложений. Он предоставляет шаблоны для оптимизации затрат, стратегии резервного переключения и маршрутизации между несколькими моделями у различных провайдеров, таких как OpenAI и Anthropic. Используйте его при внедрении сравнения моделей, отказоустойчивости провайдеров или балансировки между производительностью и затратами в вашей LLM-системе.

Просмотреть навык
agent-orchestration-patterns
Другое

Этот навык Claude автоматически направляет проектирование мультиагентных систем, обеспечивая корректное создание схем инструментов с помощью Pydantic, управление состояниями агентов и реализацию надёжной обработки ошибок. Он предоставляет шаблоны оркестрации для надёжных рабочих процессов вызова инструментов и маршрутизации агентов. Используйте его при создании сложных агентных систем для обеспечения поддерживаемого и структурированного взаимодействия.

Просмотреть навык
ai-security
Другое

Навык ai-security автоматически применяет средства защиты безопасности для приложений на основе ИИ/LLM. Он обеспечивает обнаружение инъекций в промпты, редактирование персональных данных, фильтрацию вывода и модерацию контента. Используйте этот навык при создании LLM-приложений, требующих встроенных защитных механизмов безопасности.

Просмотреть навык
model-selection
Другое

Этот навык автоматически направляет выбор модели и провайдера для LLM-приложений. Он предоставляет паттерны для оптимизации затрат, стратегии отката и маршрутизации между несколькими моделями у различных провайдеров, таких как OpenAI и Anthropic. Используйте его при внедрении сравнения моделей, отказоустойчивости провайдеров или оптимизации соотношения стоимости и производительности в вашей LLM-системе.

Просмотреть навык