slo-implementation

29.9k
wshobsonwshobson

Define and implement Service Level Indicators (SLIs) and Service Level Objectives (SLOs) with error budgets and alerting. Use when establishing reliability targets, implementing SRE practices, or measuring service performance.

192 days ago

prompt-engineering-patterns

29.9k
wshobsonwshobson

Master advanced prompt engineering techniques to maximize LLM performance, reliability, and controllability in production. Use when optimizing prompts, improving LLM outputs, or designing production prompt templates.

192 days ago

error-handling-patterns

29.9k
wshobsonwshobson

Master error handling patterns across languages including exceptions, Result types, error propagation, and graceful degradation to build resilient applications. Use when implementing error handling, designing APIs, or improving application reliability.

192 days ago

agent-evaluation

21.8k
davila7davila7

Testing and benchmarking LLM agents including behavioral testing, capability assessment, reliability metrics, and production monitoring—where even top agents achieve less than 50% on real-world benchmarks Use when: agent testing, agent evaluation, benchmark agents, agent reliability, test agent.

192 days ago

it-operations

21.8k
davila7davila7

Manages IT infrastructure, monitoring, incident response, and service reliability. Provides frameworks for ITIL service management, observability strategies, automation, backup/recovery, capacity planning, and operational excellence practices.

192 days ago

autonomous-agents

21.8k
davila7davila7

Autonomous agents are AI systems that can independently decompose goals, plan actions, execute tools, and self-correct without constant human guidance. The challenge isn't making them capable - it's making them reliable. Every extra decision multiplies failure probability. This skill covers agent loops (ReAct, Plan-Execute), goal decomposition, reflection patterns, and production reliability. Key insight: compounding error rates kill autonomous agents. A 95% success rate per step drops to 60% b

192 days ago

devops-iac-engineer

21.8k
davila7davila7

Implements infrastructure as code using Terraform, Kubernetes, and cloud platforms. Designs scalable architectures, CI/CD pipelines, and observability solutions. Provides security-first DevOps practices and site reliability engineering guidance.

192 days ago

database-admin

18.0k
sickn33sickn33

Expert database administrator specializing in modern cloud databases, automation, and reliability engineering. Masters AWS/Azure/GCP database services, Infrastructure as Code, high availability, disaster recovery, performance optimization, and compliance. Handles multi-cloud strategies, container databases, and cost optimization. Use PROACTIVELY for database architecture, operations, or reliability engineering.

192 days ago

agent-orchestration-multi-agent-optimize

18.0k
sickn33sickn33

Optimize multi-agent systems with coordinated profiling, workload distribution, and cost-aware orchestration. Use when improving agent performance, throughput, or reliability.

192 days ago

observability-monitoring-slo-implement

18.0k
sickn33sickn33

You are an SLO (Service Level Objective) expert specializing in implementing reliability standards and error budget-based practices. Design SLO frameworks, define SLIs, and build monitoring that balances reliability with delivery velocity.

192 days ago

slo-implementation

18.0k
sickn33sickn33

Define and implement Service Level Indicators (SLIs) and Service Level Objectives (SLOs) with error budgets and alerting. Use when establishing reliability targets, implementing SRE practices, or measuring service performance.

192 days ago

Verification & Quality Assurance

17.8k
ruvnetruvnet

Comprehensive truth scoring, code quality verification, and automatic rollback system with 0.95 accuracy threshold for ensuring high-quality agent outputs and codebase reliability.

verificationtruth-scoringquality+3
192 days ago

claude-skills

13.2k
2025Emma2025Emma

Claude Skills meta-skill: extract domain material (docs/APIs/code/specs) into a reusable Skill (SKILL.md + references/scripts/assets), and refactor existing Skills for clarity, activation reliability, and quality gates.

192 days ago

skill-evaluator

1.8k
openclawopenclaw

Evaluate Clawdbot skills for quality, reliability, and publish-readiness using a multi-framework rubric (ISO 25010, OpenSSF, Shneiderman, agent-specific heuristics). Use when asked to review, audit, evaluate, score, or assess a skill before publishing, or when checking skill quality. Runs automated structural checks and guides manual assessment across 25 criteria.

192 days ago

code-review

1.6k
LibPDF-jsLibPDF-js

Brutally honest code review assessing security, reliability, performance, and taste

192 days ago

retellai-reliability-patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Retellai Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Retellai Reliability Patterns

Implement Retell AI reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant Retell AI integrations, implementing retry strategies, or adding resilience to production Retell AI services. Trigger with phrases like "retellai reliability", "retellai circuit breaker", "retellai idempotent", "retellai resilience", "retellai fallback", "retellai bulkhead".

191 days ago

clay-reliability-patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Clay Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Clay Reliability Patterns

Implement Clay reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant Clay integrations, implementing retry strategies, or adding resilience to production Clay services. Trigger with phrases like "clay reliability", "clay circuit breaker", "clay idempotent", "clay resilience", "clay fallback", "clay bulkhead".

191 days ago

customerio-reliability-patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Customerio Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Customerio Reliability Patterns

Implement Customer.io reliability patterns. Use when building fault-tolerant integrations, implementing circuit breakers, or handling failures. Trigger with phrases like "customer.io reliability", "customer.io resilience", "customer.io circuit breaker", "customer.io fault tolerance".

191 days ago

supabase-reliability-patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Supabase Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Supabase Reliability Patterns

Implement Supabase reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant Supabase integrations, implementing retry strategies, or adding resilience to production Supabase services. Trigger with phrases like "supabase reliability", "supabase circuit breaker", "supabase idempotent", "supabase resilience", "supabase fallback", "supabase bulkhead".

191 days ago

windsurf-reliability-patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Windsurf Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Windsurf Reliability Patterns

Implement Windsurf reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant Windsurf integrations, implementing retry strategies, or adding resilience to production Windsurf services. Trigger with phrases like "windsurf reliability", "windsurf circuit breaker", "windsurf idempotent", "windsurf resilience", "windsurf fallback", "windsurf bulkhead".

191 days ago

Exa Reliability Patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Exa Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Exa Reliability Patterns

Implement Exa reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant Exa integrations, implementing retry strategies, or adding resilience to production Exa services. Trigger with phrases like "exa reliability", "exa circuit breaker", "exa idempotent", "exa resilience", "exa fallback", "exa bulkhead".

191 days ago

sentry-reliability-patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Sentry Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Sentry Reliability Patterns

Build reliable Sentry integrations. Use when handling SDK failures gracefully, implementing retry logic, or ensuring error tracking uptime. Trigger with phrases like "sentry reliability", "sentry failover", "sentry sdk failure handling", "resilient sentry setup".

192 days ago

vercel-reliability-patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Vercel Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Vercel Reliability Patterns

Implement Vercel reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant Vercel integrations, implementing retry strategies, or adding resilience to production Vercel services. Trigger with phrases like "vercel reliability", "vercel circuit breaker", "vercel idempotent", "vercel resilience", "vercel fallback", "vercel bulkhead".

192 days ago

perplexity-reliability-patterns

1.5k
jeremylongshorejeremylongshore

Implement Perplexity reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant Perplexity integrations, implementing retry strategies, or adding resilience to production Perplexity services. Trigger with phrases like "perplexity reliability", "perplexity circuit breaker", "perplexity idempotent", "perplexity resilience", "perplexity fallback", "perplexity bulkhead".

192 days ago

FireCrawl Reliability Patterns

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Firecrawl Reliability PatternsJeremylongshore Claude Code Plugins Plus Skills Firecrawl Reliability Patterns

Implement FireCrawl reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant FireCrawl integrations, implementing retry strategies, or adding resilience to production FireCrawl services. Trigger with phrases like "firecrawl reliability", "firecrawl circuit breaker", "firecrawl idempotent", "firecrawl resilience", "firecrawl fallback", "firecrawl bulkhead".

192 days ago

replit-reliability-patterns

1.5k
jeremylongshorejeremylongshore

Implement Replit reliability patterns including circuit breakers, idempotency, and graceful degradation. Use when building fault-tolerant Replit integrations, implementing retry strategies, or adding resilience to production Replit services. Trigger with phrases like "replit reliability", "replit circuit breaker", "replit idempotent", "replit resilience", "replit fallback", "replit bulkhead".

192 days ago

tracking-service-reliability

1.5k
Jeremylongshore Claude Code Plugins Plus Skills Sla Sli TrackerJeremylongshore Claude Code Plugins Plus Skills Sla Sli Tracker

This skill enables Claude to define and track Service Level Agreements (SLAs), Service Level Indicators (SLIs), and Service Level Objectives (SLOs) for improved service reliability. It is triggered when the user needs to establish, monitor, or analyze service performance metrics. Use this skill when the user mentions "SLA", "SLI", "SLO", "error budget", "service reliability", or "track service performance". The skill helps to define key metrics, set targets, and monitor performance against those targets.

192 days ago

using-agent-relay

534
AgentWorkforceAgentWorkforce

Use when coordinating multiple AI agents in real-time - provides inter-agent messaging via Rust PTY wrapper with file-based protocol and reliability features

192 days ago

queue

527
Joelhooks Swarm Tools QueueJoelhooks Swarm Tools Queue

Guide for job queue patterns in multi-agent coordination. Use when deciding between background jobs vs inline execution, submitting long-running tasks, monitoring job progress, and handling failures. Covers when to queue, job priority, retry strategies, and monitoring patterns.

queuebackground-jobsdistributed-work+2
192 days ago

detect-flaky-tests

462
Sovereign-LabsSovereign-Labs

Identify flaky tests by comparing failures across multiple CI runs. Use when the user suspects flaky tests, sees intermittent failures, or wants to analyze test reliability.

192 days ago

fail-fast-no-hedging

398
Taylorsatula Mira Oss Fail Fast No HedgingTaylorsatula Mira Oss Fail Fast No Hedging

Eliminate component hedging anti-patterns that mask infrastructure failures. Build systems that fail loudly when broken instead of limping along in degraded states. Critical for production reliability and operational visibility.

192 days ago

reliability-analysis

376
a5c-aia5c-ai

Component and system reliability prediction and analysis skill with MTBF/MTTF calculations, failure rate databases, FMEA/FMECA support, fault tree analysis, and accelerated life testing data analysis.

192 days ago

airflow-dag-analyzer

376
a5c-aia5c-ai

Analyzes, validates, and optimizes Apache Airflow DAGs for reliability, performance, and best practices adherence.

192 days ago

primary-source-evaluation

376
a5c-aia5c-ai

Authenticate, date, and critically assess historical documents for provenance, reliability, and bias with systematic source criticism methodology

192 days ago

psychometric-assessment

376
a5c-aia5c-ai

Develop, validate, and adapt measurement instruments including factor analysis, reliability testing, and cross-cultural validation

192 days ago

incident-responder

360
DokhacgiakhoaDokhacgiakhoa

Expert SRE incident responder specializing in rapid problem resolution, modern observability, and comprehensive incident management. Masters incident command, blameless post-mortems, error budget management, and system reliability patterns. Handles critical outages, communication strategies, and continuous improvement.

192 days ago

designing-distributed-systems

296
ancolemanancoleman

When designing distributed systems for scalability, reliability, and consistency. Covers CAP/PACELC theorems, consistency models (strong, eventual, causal), replication patterns (leader-follower, multi-leader, leaderless), partitioning strategies (hash, range, geographic), transaction patterns (saga, event sourcing, CQRS), resilience patterns (circuit breaker, bulkhead), service discovery, and caching strategies for building fault-tolerant distributed architectures.

192 days ago

review-react-best-practices

271
HeyvhuangHeyvhuang

Review or refactor React / Next.js code for performance and reliability using a prioritized rule library (waterfalls, bundle size, server/client data fetching, re-renders, rendering). Use when writing React components, Next.js pages (App Router), optimizing bundle size, improving performance, or doing a React/Next.js performance review.

192 days ago

Verification & Quality Assurance

215
proffesor-for-testingproffesor-for-testing

Comprehensive truth scoring, code quality verification, and automatic rollback system with 0.95 accuracy threshold for ensuring high-quality agent outputs and codebase reliability.

verificationtruth-scoringquality+3
192 days ago

qe-verification-quality

215
proffesor-for-testingproffesor-for-testing

Comprehensive truth scoring, code quality verification, and automatic rollback system with 0.95 accuracy threshold for ensuring high-quality agent outputs and codebase reliability.

verificationtruth-scoringquality+3
192 days ago

verification-quality-assurance

188
aiskillstoreaiskillstore

Comprehensive truth scoring, code quality verification, and automatic rollback system with 0.95 accuracy threshold for ensuring high-quality agent outputs and codebase reliability.

verificationtruth-scoringquality+3
192 days ago

payment-integration

132
MicrockMicrock

Expert payment integration specialist mastering payment gateway integration, PCI compliance, and financial transaction processing. Specializes in secure payment flows, multi-currency support, and fraud prevention with focus on reliability, compliance, and seamless user experience.

192 days ago

error-handling-patterns

132
MicrockMicrock

Master error handling patterns across languages including exceptions, Result types, error propagation, and graceful degradation to build resilient applications. Use when implementing error handling, designing APIs, or improving application reliability.

192 days ago

prompt-engineering-patterns

132
MicrockMicrock

Master advanced prompt engineering techniques to maximize LLM performance, reliability, and controllability in production. Use when optimizing prompts, improving LLM outputs, or designing production prompt templates.

192 days ago

slo-implementation

132
MicrockMicrock

Define and implement Service Level Indicators (SLIs) and Service Level Objectives (SLOs) with error budgets and alerting. Use when establishing reliability targets, implementing SRE practices, or measuring service performance.

192 days ago

testing-debugging

107
baz-scmbaz-scm

Ensuring software correctness and reliability by writing automated tests, using quality assurance tools, and systematically debugging issues.

192 days ago

gitlab-ci-best-practices

98
TheBushidoCollectiveTheBushidoCollective

Use when optimizing GitLab CI/CD pipelines for performance, reliability, or maintainability. Covers pipeline optimization and organizational patterns.

192 days ago

monitoring-observability

95
koralliskorallis

Implement comprehensive monitoring, logging, metrics, tracing, and alerting for production applications to ensure reliability and quick incident response. Use when setting up application monitoring, implementing structured logging, creating metrics and dashboards, setting up alerts, implementing distributed tracing, monitoring performance, tracking errors, or building observability into applications.

192 days ago