Die Werkzeugbeschreibungen sind auf Englisch.

LLM-Beobachtbarkeit

Monitoring, Traces, Bewertung und Qualität von LLM-Anwendungen.

Anwendungsfall

Aktivität

Sortieren nach

111

Werkzeug-Rangliste

Nach gemessenem Wachstum und quellenübergreifend normalisiert sortiert. Rohwerte behalten ihr eigenes Zeitfenster; eine Änderung erfordert mindestens zwei Messungen in 7 Tagen.

  1. 1
    Aktiv

    MCP server for Langfuse LLM observability — trace and observation analysis.

    mcpgemessenes WachstumQuelle öffnen ↗

    Installieren claude mcp add langfuse -- npx langfuse-observability-mcp-server

    78GitHub-Sternestabil
  2. 2

    Sonstige
    Aktiv

    AgentX python SDK. Build multi-agent AI workforce. Run evaluation. Trace your agent. Full Observability.

    githubgemessenes WachstumQuelle öffnen ↗

    68GitHub-Sternestabil
  3. 3
    Aktiv

    Open benchmark for Claude Code SEO skills — real headless execution against fixture sites with planted-defect answer keys. Deterministic scoring, pre-registered rubric.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/aleclindz/seo-skill-bench ~/.claude/skills/seo-skill-bench

    51GitHub-Sterne-5 (-8.9 %)
  4. 4

    Skill
    Aktiv

    Agent skills for Arize — datasets, experiments, and traces via the ax CLI

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/Arize-ai/arize-skills ~/.claude/skills/arize-skills

    47GitHub-Sternestabil
  5. 5
    Aktiv

    Make Claude Opus 4.8 behave like Claude Fable 5 — doctrine output style, drift-catching hooks, and an eval loop against golden Fable transcripts. Claude Code plugin.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add rennf93/opus-fable-playbook

    33GitHub-Sternestabil
  6. 6
    Ruhend

    🔍 AI observability skill for Claude Code. Debug LangChain/LangGraph agents by fetching execution traces from LangSmith Studio directly in your terminal.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/OthmanAdi/langsmith-fetch-skill ~/.claude/skills/langsmith-fetch-skill

    27GitHub-Sternestabil
  7. 7

    Agent
    Ruhend

    Policy-enforced observability and fail-closed guardrails for MCP/A2A multi-agent systems.

    githubgemessenes WachstumQuelle öffnen ↗

    26GitHub-Sternestabil
  8. 8
    Aktiv

    Sentry instrumentation skill for system-behavior tracking

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/tortastudios/sentry-instrumentation ~/.claude/skills/sentry-instrumentation

    24GitHub-Sternestabil
  9. 9

    Sonstige
    Aktiv

    AI-detector auditing toolkit: measures how often a detector flags genuine human writing, how stable its verdict is across seeds, and whether that verdict survives meaning-preserving edits. Detector-in-the-loop measurement harness. Claude…

    githubgemessenes WachstumQuelle öffnen ↗

    18GitHub-Sternestabil
  10. 10

    Skill
    Aktiv

    Measure prompt and skill improvements with blind A/B comparison.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add shinpr/rashomon

    18GitHub-Sternestabil
  11. 11
    Aktiv

    Two Claude Code skills for adversarial code review (single-model PAR and multi-model MMAR with cross-critique to catch hallucinations), plus a fixture-based eval suite.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add prime-radiant-inc/parallel-adversarial-review

    17GitHub-Sternestabil
  12. 12
    Aktiv

    Make Claude write clearly, for everyone.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add stefanobaghino/simple-output-styles

    16GitHub-Sternestabil
  13. 13
    Aktiv

    Claude Code plugin marketplace — agentic-engineering (spec-driven shape→decide→execute→measure→eval with adversarial review) + github-keeper (audit/elevate READMEs and make a repo open-source-ready).

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add GiustoPiedimonte/agentic-engineering-marketplace

    13GitHub-Sternestabil
  14. 14

    Sonstige
    Ruhend

    A Claude Code skill that adds a rubric-based eval layer to any agent project. Framework-agnostic — generates rubric, test cases, judge prompt, and harness. Returns a weighted score plus a judge-leniency signal.

    githubgemessenes WachstumQuelle öffnen ↗

    13GitHub-Sternestabil
  15. 15
    Aktiv

    Query Spanlens LLM observability from Cursor, Claude Desktop, or Continue via MCP.

    mcpgemessenes WachstumQuelle öffnen ↗

    Installieren claude mcp add mcp-server -- npx @spanlens/mcp-server

    12GitHub-Sternestabil
  16. 16

    Skill
    Aktiv

    Turn one decision into a judged tournament of solutions, then pick the best — a Claude Code skill that generates candidates, auto-derives the rubric, judges independently, and returns a defensible winner.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add CoriChui/bakeoff

    10GitHub-Sternestabil
  17. 17

    Sonstige
    Aktiv

    A Go-native framework for LLM agents, with OpenTelemetry observability built in.

    githubgemessenes WachstumQuelle öffnen ↗

    10GitHub-Sternestabil
  18. 18

    Skill
    Aktiv

    Anchor — the production-grade AGENTS.md template for AI coding agents. 51 sections of battle-tested rules. Keep your agents grounded.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/peva3/anchor ~/.claude/skills/anchor

    8GitHub-Sternestabil
  19. 19
    Ruhend

    A self-improving harness router for Claude Code.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren /plugin marketplace add SeongwoongCho/adaptive-harness

    8GitHub-Sternestabil
  20. 20

    Agent
    Aktiv

    MemroOS / memroos: memory OS and governance layer for AI agents, agent workflows, dispatch, proof, and context continuity.

    githubgemessenes WachstumQuelle öffnen ↗

    7GitHub-Sternestabil
  21. 21

    MCP
    Ruhend

    Open-source Python framework to deploy AI agents via HTTP, A2A, and MCP with built-in observability

    githubgemessenes WachstumQuelle öffnen ↗

    5GitHub-Sternestabil
  22. 22

    Skill
    Aktiv

    Axiom is a curated marketplace of shared plugins for Claude Code and Codex.

    githubgemessenes WachstumQuelle öffnen ↗

    Installieren git clone https://github.com/netopsengineer/axiom ~/.claude/skills/axiom

    5GitHub-Sternestabil

Lern- und Referenzressourcen

Nach gemessenem Wachstum und quellenübergreifend normalisiert sortiert. Diese Ressourcen bleiben getrennt zugänglich und fließen nicht in die Hauptwertung ein.

  1. 1
    AktivQuelle öffnen ↗

    Curated + scored map of official MCP servers and agents for DevOps, Cloud, SRE, and Platform Engineering — every entry rated on production access, approval gates, and audit evidence.

    githubRessourcegemessenes Wachstum
    77GitHub-Sternestabil
  2. 2
    AktivQuelle öffnen ↗

    My complete journey to becoming an Agentic AI Engineer through structured learning, projects, experiments, and production-ready implementations of modern AI systems.

    githubRessourcegemessenes Wachstum
    18GitHub-Sternestabil
  3. 3

    tunelab

    Skill
    AktivQuelle öffnen ↗

    Claude Code plugin for LLM fine-tuning, distillation, and evaluation — decide whether you need fine-tuning at all, distill your LLM logs into small local models (MLX/LoRA), evaluate with held-out discipline, and learn the why at every step.

    github

    Installieren /plugin marketplace add rchaz/tunelab

    Ressourcegemessenes Wachstum
    6GitHub-Sternestabil