evaluating-llms-harness
关于
This Claude Skill runs the lm-evaluation-harness to benchmark LLMs across 60+ standardized academic tasks like MMLU and GSM8K. It's designed for developers to compare model quality, track training progress, or report academic results. The tool supports various backends including HuggingFace and vLLM models.
快速安装
Claude Code
推荐npx skills add zechenzhangAGI/AI-research-SKILLs -a claude-code/plugin add https://github.com/zechenzhangAGI/AI-research-SKILLsgit clone https://github.com/zechenzhangAGI/AI-research-SKILLs.git ~/.claude/skills/evaluating-llms-harness在 Claude Code 中复制并粘贴此命令以安装该技能
GitHub 仓库
常见问题
什么是 evaluating-llms-harness Skill?
evaluating-llms-harness 是一个 Claude Skill,作者为 zechenzhangAGI。Skill 将 Claude 按需加载的说明和资源打包,让 Claude 无需额外提示即可执行与 evaluating-llms-harness 相关的任务。
如何安装 evaluating-llms-harness?
使用本页的安装命令:将 evaluating-llms-harness 作为插件添加到 Claude Code,或将其仓库克隆到 skills 目录,然后重启 Claude 以加载该 Skill。
evaluating-llms-harness 属于哪个分类?
evaluating-llms-harness 属于测试分类。
evaluating-llms-harness 可以免费使用吗?
可以。evaluating-llms-harness 已收录在 AIMCP,可免费安装。
相关推荐技能
这个Claude Skill提供了关于Cloudflare Cron Triggers的完整知识库,用于通过cron表达式定时执行Workers。它支持配置周期性任务、维护作业和自动化工作流,并能处理常见的cron触发错误。开发者可以用它来设置定时任务、测试cron处理器,并集成Workflows和Green Compute功能。
该Skill为开发者提供了基于Playwright的本地Web应用测试工具集,支持自动化测试前端功能、调试UI行为、捕获屏幕截图和查看浏览器日志。它包含管理服务器生命周期的辅助脚本,可直接作为黑盒工具运行而无需阅读源码。适用于需要快速验证本地Web应用界面和交互功能的开发场景。
这个Skill用于开发分支完成后的集成决策,当代码实现完成且测试通过时,它会引导开发者选择合适的工作流。它首先验证测试状态,然后提供合并、创建PR或清理等结构化选项。核心价值在于确保代码质量的同时,标准化分支收尾流程。
该Skill帮助开发者在GitHub Actions中设置安全的npm发布流程,用OIDC可信发布替代传统的NPM_TOKEN密钥。它支持生成来源证明(provenance attestations)并包含单代码库配置指导,适用于迁移现有发布流程或建立新的安全发布管道。关键配置包括设置GitHub Actions的`id-token: write`权限和在npm中配置可信发布者。
