Die Werkzeugbeschreibungen sind auf Englisch.

LLM-Beobachtbarkeit

Monitoring, Traces, Bewertung und Qualität von LLM-Anwendungen.

Anwendungsfall

Aktivität

Sortieren nach

116

Werkzeug-Rangliste

Nach gemessenem Wachstum und quellenübergreifend normalisiert sortiert. Rohwerte behalten ihr eigenes Zeitfenster; eine Änderung erfordert mindestens zwei Messungen in 7 Tagen.

  1. 1

    Agent
    Ruhend

    Real-time debugging proxy for Agent2Agent (A2A) multi-agent systems

    githubgemessenes WachstumQuelle öffnen ↗

    3GitHub-Sternestabil
  2. 2

    Skill
    Aktiv

    Axiom is a curated marketplace of shared plugins for Claude Code and Codex.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/netopsengineer/axiom ~/.claude/skills/axiom

    5GitHub-Sternestabil
  3. 3
    Aktiv

    Claude Code plugin marketplace — agentic-engineering (spec-driven shape→decide→execute→measure→eval with adversarial review) + github-keeper (audit/elevate READMEs and make a repo open-source-ready).

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add GiustoPiedimonte/agentic-engineering-marketplace

    13GitHub-Sternestabil
  4. 4

    Skill
    Aktiv

    The container platform tailored for Kubernetes multi-cloud, datacenter, and edge management ⎈ 🖥 ☁️

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/kubesphere/kubesphere ~/.claude/skills/kubesphere

    17 035GitHub-Sterne+2 (+0.01 %)
  5. 5

    MCP
    Ruhend

    Open-source Python framework to deploy AI agents via HTTP, A2A, and MCP with built-in observability

    githubgemessenes WachstumQuelle öffnen ↗

    5GitHub-Sternestabil
  6. 6

    Sonstige
    Ruhend

    A Claude Code skill that adds a rubric-based eval layer to any agent project. Framework-agnostic — generates rubric, test cases, judge prompt, and harness. Returns a weighted score plus a judge-leniency signal.

    githubgemessenes WachstumQuelle öffnen ↗

    13GitHub-Sternestabil
  7. 7
    Aktiv

    Amazon Bedrock AgentCore enterprise platform accelerator with AWS CDK, Terraform organization guardrails, MCP/A2A agents, security, memory, and observability.

    githubgemessenes WachstumQuelle öffnen ↗

    6GitHub-Sterne+2 (+50.0 %)
  8. 8

    Agent
    Aktiv

    Provide clear documentation for AgentStack’s MCP protocol, plugins, and ecosystem API with usage examples and tool references.

    githubgemessenes WachstumQuelle öffnen ↗

    0GitHub-Sternestabil
  9. 9

    Agent
    Aktiv

    MemroOS / memroos: memory OS and governance layer for AI agents, agent workflows, dispatch, proof, and context continuity.

    githubgemessenes WachstumQuelle öffnen ↗

    7GitHub-Sternestabil
  10. 10

    Skill
    Aktiv

    Production-grade AI coding rules for Cursor and Claude Code. 15 rules + 9 doc templates + skills + agents + MCP setup. Drop into any project.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/aiagentwithdhruv/ai-dev-stack ~/.claude/skills/ai-dev-stack

    10GitHub-Sterne+1 (+11.1 %)
  11. 11
    Aktiv

    Multi-tier framework for evaluating AI agent skills with quality gates, semantic overlap detection, synthetic evaluation dataset generation, and live agent evaluation that measures how skills affect agent behavior.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/NVIDIA/SkillEvaluator ~/.claude/skills/SkillEvaluator

    399GitHub-Sterne+51 (+14.7 %)
  12. 12
    Ruhend

    A self-improving harness router for Claude Code.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add SeongwoongCho/adaptive-harness

    8GitHub-Sternestabil
  13. 13
    Aktiv

    Audit which Claude Code skills you actually use — surface dead installs and hallucinated invocations from your session logs.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add sfrangulov/skill-graveyard

    10GitHub-Sterne+1 (+11.1 %)
  14. 14

    Skill
    Aktiv

    Anchor — the production-grade AGENTS.md template for AI coding agents. 51 sections of battle-tested rules. Keep your agents grounded.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/peva3/anchor ~/.claude/skills/anchor

    8GitHub-Sternestabil
  15. 15

    Skill
    Aktiv

    Turn one decision into a judged tournament of solutions, then pick the best — a Claude Code skill that generates candidates, auto-derives the rubric, judges independently, and returns a defensible winner.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add CoriChui/bakeoff

    10GitHub-Sternestabil
  16. 16

    Sonstige
    Aktiv

    A Go-native framework for LLM agents, with OpenTelemetry observability built in.

    githubgemessenes WachstumQuelle öffnen ↗

    10GitHub-Sternestabil
  17. 17
    Aktiv

    Architecture-first Python scaffold for an auditable multi-agent corporate credit desk using A2A, MCP, deterministic credit policies, model routing, and OpenTelemetry.

    githubgemessenes WachstumQuelle öffnen ↗

    0GitHub-Sternestabil
  18. 18
    Aktiv

    Dashboard for monitoring claude code sessions.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add JayantDevkar/claude-code-karma

    323GitHub-Sterne+2 (+0.62 %)
  19. 19

    Agent
    Ruhend

    Contract-based testing for LLM agents: hybrid evaluation, multi-agent + A2A, deterministic replay.

    githubgemessenes WachstumQuelle öffnen ↗

    0GitHub-Sternestabil
  20. 20

    MCP
    Aktiv

    AURA is a production-tested SRE agent platform you can deploy in minutes. AURA handles the guardrails, APIs, state management, streaming, and failure handling required to put AI to work safely on production infrastructure.

    githubgemessenes WachstumQuelle öffnen ↗

    291GitHub-Sterne+33 (+12.8 %)
  21. 21

    Skill
    Aktiv

    Marketing Mix Model expert agent plugin for Claude Code - pymc-marketing v0.18.2+

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add Yakoub-ai/agent-mmm

    4GitHub-Sternestabil
  22. 22
    Ruhend

    A Python proof-of-concept for tracing multi-turn Agent-to-Agent (A2A) conversations as a single unified MLflow trace for LLM observability and evaluation.

    githubgemessenes WachstumQuelle öffnen ↗

    0GitHub-Sternestabil
  23. 23
    Aktiv

    🪢 Langfuse documentation -- Langfuse is the open source LLM Engineering Platform. Observability, evals, prompt management, playground and metrics to debug and improve LLM apps

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/langfuse/langfuse-docs ~/.claude/skills/langfuse-docs

    239GitHub-Sterne+3 (+1.3 %)
  24. 24

    Agent
    Aktiv

    A2A green-agent orchestrator for evaluating agents on the AppWorld benchmark, built on the AgentBeats SDK

    githubgemessenes WachstumQuelle öffnen ↗

    0GitHub-Sternestabil
  25. 25
    Aktiv

    🟪 Open-source runtime that ships any LangGraph or Google ADK agent as a production-ready FastAPI service. Bundled , AG-UI copilotkit API, chat UI, 15+ guardrails, MCP, OpenTelemetry, OIDC. One pip install. Self-hosted, no vendor lock-in.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/Idun-Group/idun-agent-platform ~/.claude/skills/idun-agent-platform

    199GitHub-Sternestabil