SKILL·DBA15E

Evals

danielmiessler
更新于 2 months ago
7 次查看
9,895
1,393
9,895
在 GitHub 上查看
测试testing

关于

Evals is an agent evaluation framework for testing and benchmarking AI agents using Anthropic's best practices. It provides three grader types (code-based, model-based, human) with transcript capture and pass@k/pass^k metrics. Use it when you need to evaluate, benchmark, or regression test agent behavior and capabilities.

快速安装

Claude Code

推荐
主要方式
npx skills add danielmiessler/Personal_AI_Infrastructure -a claude-code
插件命令备选方式
/plugin add https://github.com/danielmiessler/Personal_AI_Infrastructure
Git 克隆备选方式
git clone https://github.com/danielmiessler/Personal_AI_Infrastructure.git ~/.claude/skills/Evals

在 Claude Code 中复制并粘贴此命令以安装该技能

GitHub 仓库

danielmiessler/Personal_AI_Infrastructure
路径: Releases/v2.5/.claude/skills/Evals
0
aiaugmentationhumansproductivity
FAQ

常见问题

什么是 Evals Skill?

Evals 是一个 Claude Skill,作者为 danielmiessler。Skill 将 Claude 按需加载的说明和资源打包,让 Claude 无需额外提示即可执行与 Evals 相关的任务。

如何安装 Evals?

使用本页的安装命令:将 Evals 作为插件添加到 Claude Code,或将其仓库克隆到 skills 目录,然后重启 Claude 以加载该 Skill。

Evals 属于哪个分类?

Evals 属于测试分类。

Evals 可以免费使用吗?

可以。Evals 已收录在 AIMCP,可免费安装。

相关推荐技能

evaluating-llms-harness
测试

该Skill通过60+个学术基准测试(如MMLU、GSM8K等)评估大语言模型质量,适用于模型对比、学术研究及训练进度追踪。它支持HuggingFace、vLLM和API接口,被EleutherAI等行业领先机构广泛采用。开发者可通过简单命令行快速对模型进行多任务批量评估。

查看技能
cloudflare-cron-triggers
测试

这个Claude Skill提供了关于Cloudflare Cron Triggers的完整知识库,用于通过cron表达式定时执行Workers。它支持配置周期性任务、维护作业和自动化工作流,并能处理常见的cron触发错误。开发者可以用它来设置定时任务、测试cron处理器,并集成Workflows和Green Compute功能。

查看技能
webapp-testing
测试

该Skill为开发者提供了基于Playwright的本地Web应用测试工具集,支持自动化测试前端功能、调试UI行为、捕获屏幕截图和查看浏览器日志。它包含管理服务器生命周期的辅助脚本,可直接作为黑盒工具运行而无需阅读源码。适用于需要快速验证本地Web应用界面和交互功能的开发场景。

查看技能
finishing-a-development-branch
测试

这个Skill用于开发分支完成后的集成决策,当代码实现完成且测试通过时,它会引导开发者选择合适的工作流。它首先验证测试状态,然后提供合并、创建PR或清理等结构化选项。核心价值在于确保代码质量的同时,标准化分支收尾流程。

查看技能