evaluation AI Agent Skills

Browse 21 skills related to evaluation

evaluating-llms-harness

21.8k
davila7davila7

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace, vLLM, APIs.

EvaluationLM Evaluation HarnessBenchmarking+7
142 days ago

phoenix-observability

21.8k
davila7davila7

Open-source AI observability platform for LLM tracing, evaluation, and monitoring. Use when debugging LLM applications with detailed traces, running evaluations on datasets, or monitoring production AI systems with real-time insights.

ObservabilityPhoenixArize+5
142 days ago

langsmith-observability

21.8k
davila7davila7

LLM observability platform for tracing, evaluation, and monitoring. Use when debugging LLM applications, evaluating model outputs against datasets, monitoring production systems, or building systematic testing pipelines for AI applications.

ObservabilityLangSmithTracing+6
142 days ago

evaluating-code-models

21.8k
davila7davila7

Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics. Use when benchmarking code models, comparing coding abilities, testing multi-language support, or measuring code generation quality. Industry standard from BigCode Project used by HuggingFace leaderboards.

EvaluationCode GenerationHumanEval+6
142 days ago

nemo-evaluator-sdk

21.8k
davila7davila7

Evaluates LLMs across 100+ benchmarks from 18+ harnesses (MMLU, HumanEval, GSM8K, safety, VLM) with multi-backend execution. Use when needing scalable evaluation on local Docker, Slurm HPC, or cloud platforms. NVIDIA's enterprise-grade platform with container-first architecture for reproducible benchmarking.

EvaluationNeMoNVIDIA+8
142 days ago

trulens-evaluation-setup

3.1k
trueratruera

Configure feedback functions and selectors for TruLens evaluations

trulensllmevaluation+2
142 days ago

trulens-running-evaluations

3.1k
trueratruera

Execute TruLens evaluations and view results

trulensllmevaluation+2
142 days ago

trulens-dataset-curation

3.1k
trueratruera

Create and curate evaluation datasets with ground truth for TruLens

trulensllmevaluation+2
142 days ago

trulens-evaluation-workflow

3.1k
trueratruera

Systematically evaluate your LLM application with TruLens

trulensllmevaluation+2
142 days ago

evaluating-code-models

353
sangrokjungsangrokjung

Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics. Use when benchmarking code models, comparing coding abilities, testing multi-language support, or measuring code generation quality. Industry standard from BigCode Project used by HuggingFace leaderboards.

EvaluationCode GenerationHumanEval+6
142 days ago

evaluating-llms-harness

353
sangrokjungsangrokjung

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace, vLLM, APIs.

EvaluationLM Evaluation HarnessBenchmarking+7
142 days ago

skills-eval

196
atholaathola

Evaluate and improve Claude skill quality through auditing. Use when reviewing skill quality, preparing skills for production, or auditing existing skills. Do not use when creating new skills (use modular-skills) or writing prose (use writing-clearly-and-concisely). Use this skill before shipping any skill to production.

evaluationimprovementskills+4
142 days ago

methodology-curator

196
atholaathola

Surfaces expert frameworks and proven methodologies before creating OR evaluating skills, hooks, agents, or commands. Helps select approaches from domain masters. Use when starting creation workflows, evaluating methodology gaps, or seeking domain expertise. Do not use if you already have a specific methodology or are fixing syntax/structural issues.

methodologyframeworksexpertise+3
142 days ago

golden-dataset

97
yonatangrossyonatangross

Golden dataset lifecycle patterns for curation, versioning, quality validation, and CI integration. Use when building evaluation datasets, managing dataset versions, validating quality scores, or integrating golden tests into pipelines.

golden-datasetevaluationdataset-curation+3
142 days ago

assess

97
yonatangrossyonatangross

Assesses and rates quality 0-10 with pros/cons analysis. Use when evaluating code, designs, or approaches.

assessmentevaluationquality+3
142 days ago

scoring

30
SimHackerSimHacker

Motto: Style counts. Context matters. Story trumps numbers.

moollmachievementevaluation+2
142 days ago

evaluator

30
SimHackerSimHacker

Independent assessment without debate context — adversarial loop prevents gaming

moollmevaluationadversarial+2
142 days ago

rubric

30
SimHackerSimHacker

Measurable criteria translating qualitative debate to quantitative scores

moollmscoringcriteria+2
142 days ago

researcher-role-skill

9
enunoenuno

Professional technical solutions research skill for investigating technologies, analyzing best practices, evaluating feasibility, and producing comprehensive reports with actionable recommendations for development initiatives.

researchanalysisevaluation+2
142 days ago

gpd-training-evaluation

1
chuongdlbchuongdlb

Stable-Baselines3 PPO training pipeline — environment setup, callbacks, reward thresholds, model saving, evaluation, inference loop.

trainingpposb3+1
142 days ago

eval-harness

gabrielgadeagabrielgadea

Evaluation-driven development framework. Define measurable criteria, create a test harness, measure before/after. Use when quality must be quantified, not just asserted.

evaluationmeasurementquality+1
142 days ago