observability AI Agent Skills

Browse 26 skills related to observability

phoenix-observability

21.8k
davila7davila7

Open-source AI observability platform for LLM tracing, evaluation, and monitoring. Use when debugging LLM applications with detailed traces, running evaluations on datasets, or monitoring production AI systems with real-time insights.

ObservabilityPhoenixArize+5
142 days ago

langsmith-observability

21.8k
davila7davila7

LLM observability platform for tracing, evaluation, and monitoring. Use when debugging LLM applications, evaluating model outputs against datasets, monitoring production systems, or building systematic testing pipelines for AI applications.

ObservabilityLangSmithTracing+6
142 days ago

sentry-desktop-setup

376
a5c-aia5c-ai

Configure Sentry for comprehensive desktop application crash reporting, error monitoring, performance tracking, and release health for Electron and native desktop apps

desktopmonitoringcrash-reporting+3
142 days ago

observability-testing-patterns

215
proffesor-for-testingproffesor-for-testing

Observability and monitoring validation patterns for dashboards, alerting, log aggregation, APM traces, and SLA/SLO verification. Use when testing monitoring infrastructure, dashboard accuracy, alert rules, or metric pipelines.

observabilitymonitoringkibana+5
142 days ago

Logging Patterns

127
DicklesworthstoneDicklesworthstone

Common logging patterns and practices. This skill is designed to be included in composite skills via the 'includes' feature.

loggingobservabilityexample
142 days ago

monitoring-observability

97
yonatangrossyonatangross

Monitoring and observability patterns for Prometheus metrics, Grafana dashboards, Langfuse LLM tracing, and drift detection. Use when adding logging, metrics, distributed tracing, LLM cost tracking, or quality drift monitoring.

monitoringobservabilityprometheus+6
142 days ago

OpenTelemetry Testing

71
PramodDuttaPramodDutta

Testing distributed tracing and observability instrumentation with OpenTelemetry including span verification, metric collection, and log correlation.

opentelemetrytracingobservability+2
142 days ago

Testing in Production Patterns

71
PramodDuttaPramodDutta

Safe testing-in-production strategies including feature flags, shadow traffic, canary releases, dark launches, and observability-driven development.

production-testingshadow-trafficcanary+2
142 days ago

Sentry Error Monitoring & Testing

71
PramodDuttaPramodDutta

Integration testing with Sentry for error tracking, performance monitoring, and release health verification in production environments.

sentrymonitoringerror-tracking+1
142 days ago

dag-performance-profiler

43
curiositechcuriositech

Profiles DAG execution performance including latency, token usage, cost, and resource consumption. Identifies bottlenecks and optimization opportunities. Activate on 'performance profile', 'execution metrics', 'latency analysis', 'token usage', 'cost analysis'. NOT for execution tracing (use dag-execution-tracer) or failure analysis (use dag-failure-analyzer).

dagobservabilityperformance+2
142 days ago

dag-failure-analyzer

43
curiositechcuriositech

Performs root cause analysis on DAG execution failures. Traces failure propagation, identifies systemic issues, and generates actionable remediation guidance. Activate on 'failure analysis', 'root cause', 'why did it fail', 'debug failure', 'error investigation'. NOT for execution tracing (use dag-execution-tracer) or performance issues (use dag-performance-profiler).

dagobservabilitydebugging+2
142 days ago

dag-execution-tracer

43
curiositechcuriositech

Traces complete execution paths through DAG workflows. Records timing, inputs, outputs, and state transitions for all nodes. Activate on 'execution trace', 'trace execution', 'execution path', 'debug execution', 'execution log'. NOT for performance analysis (use dag-performance-profiler) or failure investigation (use dag-failure-analyzer).

dagobservabilitytracing+2
142 days ago

dag-pattern-learner

43
curiositechcuriositech

Learns from DAG execution history to improve future performance. Identifies successful patterns, detects anti-patterns, and provides recommendations. Activate on 'learn patterns', 'execution patterns', 'what worked', 'optimize based on history', 'pattern analysis'. NOT for failure analysis (use dag-failure-analyzer) or performance profiling (use dag-performance-profiler).

dagobservabilitylearning+2
142 days ago

golang-observability-opentelemetry

15
bobmatnycbobmatnyc

Instrumenting Go applications with OpenTelemetry for distributed tracing, Prometheus for metrics, and structured logging with slog

observabilitygolangopentelemetry+5
142 days ago

golang-grpc

15
bobmatnycbobmatnyc

Production gRPC in Go: protobuf layout, codegen, interceptors, deadlines, error codes, streaming, health checks, TLS, and testing with bufconn

golanggrpcprotobuf+4
142 days ago

OpenTelemetry

15
bobmatnycbobmatnyc

OpenTelemetry observability patterns: traces, metrics, logs, context propagation, OTLP export, Collector pipelines, and troubleshooting

observabilityopentelemetrytracing+3
142 days ago

Datadog Observability

15
bobmatnycbobmatnyc

Full-stack observability with Datadog APM, logs, metrics, synthetics, and RUM. Use when implementing monitoring, tracing, alerting, or cost optimization for production systems.

observabilitymonitoringapm+5
142 days ago

monitoring-observability

13
williamzujkowskiwilliamzujkowski

Master monitoring and observability for distributed systems

monitoringobservabilityprometheus+6
141 days ago

service-mesh

13
williamzujkowskiwilliamzujkowski

A service mesh is an infrastructure layer that provides transparent service-to-service communication with built-in observability, traffic management, and security features without requiring application code changes.

istiolinkerdenvoy+3
141 days ago

aws-advanced-patterns

13
williamzujkowskiwilliamzujkowski

Orchestration & Events:

awsstep-functionseventbridge+3
142 days ago

Observability with Prometheus & Grafana

10
bobmatnycbobmatnyc

Production-grade observability stack with Prometheus metrics, Grafana dashboards, PromQL query language, alerting rules, and AI-powered anomaly detection for modern cloud-native applications

observabilitymonitoringprometheus+7
142 days ago

logging-and-monitoring

7
louloulinlouloulin

Comprehensive logging, monitoring, and observability expert for distributed systems

loggingmonitoringobservability+1
142 days ago

implementing-runtime-security-with-tetragon

2
mukul975mukul975

Implement eBPF-based runtime security observability and enforcement in Kubernetes clusters using Cilium Tetragon for kernel-level threat detection and policy enforcement.

tetragonebpfruntime-security+6
142 days ago

Agent Dashboard

1
hanabi-jpnhanabi-jpn

Real-time agent monitoring with health scoring, cost tracking, and web dashboard

monitoringdashboardanalytics+2
142 days ago

newrelic-cli-skills

vince-winkintelvince-winkintel

Monitor, query, and manage New Relic observability data via the newrelic CLI. Covers NRQL queries, APM performance triage, deployment markers, alert management, infrastructure monitoring, and agent diagnostics. Use when user asks about application performance, error rates, slow transactions, deployment tracking, or New Relic configuration.

newrelicobservabilityapm+3
142 days ago

senior-observability

arielperez82arielperez82

Comprehensive observability skill for monitoring, logging, distributed tracing, alerting, and SLI/SLO implementation across distributed systems. Includes dashboard generation, alert rule creation, error budget calculation, and metrics analysis. Use when implementing monitoring stacks, designing alerting strategies, setting up distributed tracing, or defining SLO frameworks.

observabilitymonitoringlogging+14
142 days ago