Die Werkzeugbeschreibungen sind auf Englisch.
LLM-Beobachtbarkeit
Monitoring, Traces, Bewertung und Qualität von LLM-Anwendungen.
Anwendungsfall
Aktivität
Sortieren nach
116
Werkzeug-Rangliste
Nach gemessenem Wachstum und quellenübergreifend normalisiert sortiert. Rohwerte behalten ihr eigenes Zeitfenster; eine Änderung erfordert mindestens zwei Messungen in 7 Tagen.
- 1Ruhend
agenttap
AgentReal-time debugging proxy for Agent2Agent (A2A) multi-agent systems
githubgemessenes WachstumQuelle öffnen ↗
3GitHub-Sternestabil - 2Aktiv
axiom
SkillAxiom is a curated marketplace of shared plugins for Claude Code and Codex.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
git clone https://github.com/netopsengineer/axiom ~/.claude/skills/axiom5GitHub-Sternestabil - 3Aktiv
Claude Code plugin marketplace — agentic-engineering (spec-driven shape→decide→execute→measure→eval with adversarial review) + github-keeper (audit/elevate READMEs and make a repo open-source-ready).
githubgemessenes WachstumQuelle öffnen ↗
Installieren
/plugin marketplace add GiustoPiedimonte/agentic-engineering-marketplace13GitHub-Sternestabil - 4Aktiv
kubesphere
SkillThe container platform tailored for Kubernetes multi-cloud, datacenter, and edge management ⎈ 🖥 ☁️
githubgemessenes WachstumQuelle öffnen ↗
Installieren
git clone https://github.com/kubesphere/kubesphere ~/.claude/skills/kubesphere17 035GitHub-Sterne+2 (+0.01 %) - 5Ruhend
kiboserve
MCPOpen-source Python framework to deploy AI agents via HTTP, A2A, and MCP with built-in observability
githubgemessenes WachstumQuelle öffnen ↗
5GitHub-Sternestabil - 6Ruhend
eval-layer
SonstigeA Claude Code skill that adds a rubric-based eval layer to any agent project. Framework-agnostic — generates rubric, test cases, judge prompt, and harness. Returns a weighted score plus a judge-leniency signal.
githubgemessenes WachstumQuelle öffnen ↗
13GitHub-Sternestabil - 7Aktiv
Amazon Bedrock AgentCore enterprise platform accelerator with AWS CDK, Terraform organization guardrails, MCP/A2A agents, security, memory, and observability.
githubgemessenes WachstumQuelle öffnen ↗
6GitHub-Sterne+2 (+50.0 %) - 8Aktiv
AgentStack
AgentProvide clear documentation for AgentStack’s MCP protocol, plugins, and ecosystem API with usage examples and tool references.
githubgemessenes WachstumQuelle öffnen ↗
0GitHub-Sternestabil - 9Aktiv
memroos
AgentMemroOS / memroos: memory OS and governance layer for AI agents, agent workflows, dispatch, proof, and context continuity.
githubgemessenes WachstumQuelle öffnen ↗
7GitHub-Sternestabil - 10Aktiv
ai-dev-stack
SkillProduction-grade AI coding rules for Cursor and Claude Code. 15 rules + 9 doc templates + skills + agents + MCP setup. Drop into any project.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
git clone https://github.com/aiagentwithdhruv/ai-dev-stack ~/.claude/skills/ai-dev-stack10GitHub-Sterne+1 (+11.1 %) - 11Aktiv
SkillEvaluator
SkillMulti-tier framework for evaluating AI agent skills with quality gates, semantic overlap detection, synthetic evaluation dataset generation, and live agent evaluation that measures how skills affect agent behavior.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
git clone https://github.com/NVIDIA/SkillEvaluator ~/.claude/skills/SkillEvaluator399GitHub-Sterne+51 (+14.7 %) - 12Ruhend
adaptive-harness
SkillA self-improving harness router for Claude Code.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
/plugin marketplace add SeongwoongCho/adaptive-harness8GitHub-Sternestabil - 13Aktiv
skill-graveyard
SkillAudit which Claude Code skills you actually use — surface dead installs and hallucinated invocations from your session logs.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
/plugin marketplace add sfrangulov/skill-graveyard10GitHub-Sterne+1 (+11.1 %) - 14Aktiv
anchor
SkillAnchor — the production-grade AGENTS.md template for AI coding agents. 51 sections of battle-tested rules. Keep your agents grounded.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
git clone https://github.com/peva3/anchor ~/.claude/skills/anchor8GitHub-Sternestabil - 15Aktiv
bakeoff
SkillTurn one decision into a judged tournament of solutions, then pick the best — a Claude Code skill that generates candidates, auto-derives the rubric, judges independently, and returns a defensible winner.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
/plugin marketplace add CoriChui/bakeoff10GitHub-Sternestabil - 16Aktiv
galdor
SonstigeA Go-native framework for LLM agents, with OpenTelemetry observability built in.
githubgemessenes WachstumQuelle öffnen ↗
10GitHub-Sternestabil - 17Aktiv
Architecture-first Python scaffold for an auditable multi-agent corporate credit desk using A2A, MCP, deterministic credit policies, model routing, and OpenTelemetry.
githubgemessenes WachstumQuelle öffnen ↗
0GitHub-Sternestabil - 18Aktiv
claude-code-karma
SkillDashboard for monitoring claude code sessions.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
/plugin marketplace add JayantDevkar/claude-code-karma323GitHub-Sterne+2 (+0.62 %) - 19Ruhend
agentanvil
AgentContract-based testing for LLM agents: hybrid evaluation, multi-agent + A2A, deterministic replay.
githubgemessenes WachstumQuelle öffnen ↗
0GitHub-Sternestabil - 20Aktiv
aura
MCPAURA is a production-tested SRE agent platform you can deploy in minutes. AURA handles the guardrails, APIs, state management, streaming, and failure handling required to put AI to work safely on production infrastructure.
githubgemessenes WachstumQuelle öffnen ↗
291GitHub-Sterne+33 (+12.8 %) - 21Aktiv
agent-mmm
SkillMarketing Mix Model expert agent plugin for Claude Code - pymc-marketing v0.18.2+
githubgemessenes WachstumQuelle öffnen ↗
Installieren
/plugin marketplace add Yakoub-ai/agent-mmm4GitHub-Sternestabil - 22Ruhend
A Python proof-of-concept for tracing multi-turn Agent-to-Agent (A2A) conversations as a single unified MLflow trace for LLM observability and evaluation.
githubgemessenes WachstumQuelle öffnen ↗
0GitHub-Sternestabil - 23Aktiv
langfuse-docs
Skill🪢 Langfuse documentation -- Langfuse is the open source LLM Engineering Platform. Observability, evals, prompt management, playground and metrics to debug and improve LLM apps
githubgemessenes WachstumQuelle öffnen ↗
Installieren
git clone https://github.com/langfuse/langfuse-docs ~/.claude/skills/langfuse-docs239GitHub-Sterne+3 (+1.3 %) - 24Aktiv
green-agent
AgentA2A green-agent orchestrator for evaluating agents on the AppWorld benchmark, built on the AgentBeats SDK
githubgemessenes WachstumQuelle öffnen ↗
0GitHub-Sternestabil - 25Aktiv
idun-agent-platform
Skill🟪 Open-source runtime that ships any LangGraph or Google ADK agent as a production-ready FastAPI service. Bundled , AG-UI copilotkit API, chat UI, 15+ guardrails, MCP, OpenTelemetry, OIDC. One pip install. Self-hosted, no vendor lock-in.
githubgemessenes WachstumQuelle öffnen ↗
Installieren
git clone https://github.com/Idun-Group/idun-agent-platform ~/.claude/skills/idun-agent-platform199GitHub-Sternestabil