SkillEvaluator — fiche et historique

Multi-tier framework for evaluating AI agent skills with quality gates, semantic overlap detection, synthetic evaluation dataset generation, and live agent evaluation that measures how skills affect agent behavior.

Actif

Source canonique ↗

Langage
Python
Licence
Apache-2.0
Création
Dernière activité
Topics
  • agent-evaluation
  • agent-security
  • agent-skills
  • agentic-ai
  • benchmark
  • claude-code
  • codex
  • evaluate
  • evaluation
  • security-scanner
  • skill-eval
  • skill-evals
  • skill-evaluation
  • skill-evaluator
  • skills

Installer git clone https://github.com/NVIDIA/SkillEvaluator ~/.claude/skills/SkillEvaluator

Mesure actuelle

389étoiles GitHub+63 (+19.3 %)
progression mesurée

Le momentum utilise les relevés disponibles des 7 derniers jours : mesuré avec au moins deux relevés comparables, estimé sinon.

Historique des relevés

90 jours · 90 relevés maximum
DateValeurMétrique
389étoiles GitHub
363étoiles GitHub
351étoiles GitHub
348étoiles GitHub
332étoiles GitHub
326étoiles GitHub
305étoiles GitHub
293étoiles GitHub
266étoiles GitHub
245étoiles GitHub
209étoiles GitHub
168étoiles GitHub
94étoiles GitHub

Classements

Domaines
Type
Skills pour agents
Usages