返回技能列表

evaluating-llms-harness

zechenzhangAGI
更新于 1 month ago
1721 次查看
62
2
62
在 GitHub 上查看
测试aitestingapi

关于

This Claude Skill runs the lm-evaluation-harness to benchmark LLMs across 60+ standardized academic tasks like MMLU and GSM8K. It's designed for developers to compare model quality, track training progress, or report academic results. The tool supports various backends including HuggingFace and vLLM models.

快速安装

Claude Code

推荐
主要方式
npx skills add zechenzhangAGI/AI-research-SKILLs -a claude-code
插件命令备选方式
/plugin add https://github.com/zechenzhangAGI/AI-research-SKILLs
Git 克隆备选方式
git clone https://github.com/zechenzhangAGI/AI-research-SKILLs.git ~/.claude/skills/evaluating-llms-harness

在 Claude Code 中复制并粘贴此命令以安装该技能

GitHub 仓库

zechenzhangAGI/AI-research-SKILLs
路径: 11-evaluation/lm-evaluation-harness
0
aiai-researchclaudeclaude-codeclaude-skillscodex

相关推荐技能

cloudflare-cron-triggers

测试

这个Claude Skill提供了关于Cloudflare Cron Triggers的完整知识库,用于通过cron表达式定时执行Workers。它支持配置周期性任务、维护作业和自动化工作流,并能处理常见的cron触发错误。开发者可以用它来设置定时任务、测试cron处理器,并集成Workflows和Green Compute功能。

查看技能

webapp-testing

测试

该Skill为开发者提供了基于Playwright的本地Web应用测试工具集,支持自动化测试前端功能、调试UI行为、捕获屏幕截图和查看浏览器日志。它包含管理服务器生命周期的辅助脚本,可直接作为黑盒工具运行而无需阅读源码。适用于需要快速验证本地Web应用界面和交互功能的开发场景。

查看技能

finishing-a-development-branch

测试

这个Skill用于开发分支完成后的集成决策,当代码实现完成且测试通过时,它会引导开发者选择合适的工作流。它首先验证测试状态,然后提供合并、创建PR或清理等结构化选项。核心价值在于确保代码质量的同时,标准化分支收尾流程。

查看技能

npm-trusted-publishing

测试

该Skill帮助开发者在GitHub Actions中设置安全的npm发布流程,用OIDC可信发布替代传统的NPM_TOKEN密钥。它支持生成来源证明(provenance attestations)并包含单代码库配置指导,适用于迁移现有发布流程或建立新的安全发布管道。关键配置包括设置GitHub Actions的`id-token: write`权限和在npm中配置可信发布者。

查看技能