production AI Agent Skills

Browse 18 skills related to production

huggingface-tokenizers

21.8k
davila7davila7

Fast tokenizers optimized for research and production. Rust-based implementation tokenizes 1GB in <20 seconds. Supports BPE, WordPiece, and Unigram algorithms. Train custom vocabularies, track alignments, handle padding/truncation. Integrates seamlessly with transformers. Use when you need high-performance tokenization or custom tokenizer training.

TokenizationHuggingFaceBPE+7
142 days ago

tensorrt-llm

21.8k
davila7davila7

Optimizes LLM inference with NVIDIA TensorRT for maximum throughput and lowest latency. Use for production deployment on NVIDIA GPUs (A100/H100), when you need 10-100x faster inference than PyTorch, or for serving models with quantization (FP8/INT4), in-flight batching, and multi-GPU scaling.

Inference ServingTensorRT-LLMNVIDIA+8
142 days ago

training-llms-megatron

21.8k
davila7davila7

Trains large language models (2B-462B parameters) using NVIDIA Megatron-Core with advanced parallelism strategies. Use when training models >1B parameters, need maximum GPU efficiency (47% MFU on H100), or require tensor/pipeline/sequence/context/expert parallelism. Production-ready framework used for Nemotron, LLaMA, DeepSeek.

Megatron-CoreLarge-Scale TrainingNVIDIA+6
142 days ago

sentence-transformers

21.8k
davila7davila7

Framework for state-of-the-art sentence, text, and image embeddings. Provides 5000+ pre-trained models for semantic similarity, clustering, and retrieval. Supports multilingual, domain-specific, and multimodal models. Use for generating embeddings for RAG, semantic search, or similarity tasks. Best for production embedding generation.

Sentence TransformersEmbeddingsSemantic Similarity+7
142 days ago

serving-llms-vllm

21.8k
davila7davila7

Serves LLMs with high throughput using vLLM's PagedAttention and continuous batching. Use when deploying production LLM APIs, optimizing inference latency/throughput, or serving models with limited GPU memory. Supports OpenAI-compatible endpoints, quantization (GPTQ/AWQ/FP8), and tensor parallelism.

vLLMInference ServingPagedAttention+6
142 days ago

pinecone

21.8k
davila7davila7

Managed vector database for production AI applications. Fully managed, auto-scaling, with hybrid search (dense + sparse), metadata filtering, and namespaces. Low latency (<100ms p95). Use for production RAG, recommendation systems, or semantic search at scale. Best for serverless, managed infrastructure.

RAGPineconeVector Database+7
142 days ago

langchain

21.8k
davila7davila7

Framework for building LLM-powered applications with agents, chains, and RAG. Supports multiple providers (OpenAI, Anthropic, Google), 500+ integrations, ReAct agents, tool calling, memory management, and vector store retrieval. Use for building chatbots, question-answering systems, autonomous agents, or RAG applications. Best for rapid prototyping and production deployments.

AgentsLangChainRAG+7
142 days ago

langsmith-observability

21.8k
davila7davila7

LLM observability platform for tracing, evaluation, and monitoring. Use when debugging LLM applications, evaluating model outputs against datasets, monitoring production systems, or building systematic testing pipelines for AI applications.

ObservabilityLangSmithTracing+6
142 days ago

nemo-guardrails

21.8k
davila7davila7

NVIDIA's runtime safety framework for LLM applications. Features jailbreak detection, input/output validation, fact-checking, hallucination detection, PII filtering, toxicity detection. Uses Colang 2.0 DSL for programmable rails. Production-ready, runs on T4 GPU.

Safety AlignmentNeMo GuardrailsNVIDIA+7
142 days ago

crewai-multi-agent

21.8k
davila7davila7

Multi-agent orchestration framework for autonomous AI collaboration. Use when building teams of specialized agents working together on complex tasks, when you need role-based agent collaboration with memory, or for production workflows requiring sequential/hierarchical execution. Built without LangChain dependencies for lean, fast execution.

AgentsCrewAIMulti-Agent+7
142 days ago

qdrant-vector-search

21.8k
davila7davila7

High-performance vector similarity search engine for RAG and semantic search. Use when building production RAG systems requiring fast nearest neighbor search, hybrid search with filtering, or scalable vector storage with Rust-powered performance.

RAGVector SearchQdrant+6
142 days ago

Production Smoke Suite

71
PramodDuttaPramodDutta

Build lightweight production smoke test suites that verify critical user paths, API health, and third-party integrations after every deployment.

smoke-testingproductiondeployment-verification+3
142 days ago

ai-engineer

43
curiositechcuriositech

Build production-ready LLM applications, advanced RAG systems, and intelligent agents. Implements vector search, multimodal AI, agent orchestration, and enterprise AI integrations. Use PROACTIVELY for LLM features, chatbots, AI agents, or AI-powered applications.

llmragagents+3
142 days ago

fastapi-microservices-development

40
manutejmanutej

Comprehensive guide for building production-ready microservices with FastAPI including REST API patterns, async operations, dependency injection, and deployment strategies

fastapimicroservicesrest-api+3
142 days ago

express-microservices-architecture

40
manutejmanutej

Complete guide for building scalable microservices with Express.js including middleware patterns, routing strategies, error handling, production architecture, and deployment best practices

expressmicroservicesnodejs+5
142 days ago

Convex Best Practices

34
powroompowroom

Guidelines for building production-ready Convex apps covering function organization, query patterns, validation, TypeScript usage, error handling, and the Zen of Convex design philosophy

convexbest-practicestypescript+2
142 days ago

Express Production

15
bobmatnycbobmatnyc

Production-ready Express.js development covering middleware architecture, error handling, security hardening, testing strategies, and deployment patterns

expressnodejsproduction+5
142 days ago

database-migration

15
bobmatnycbobmatnyc

Safe patterns for evolving database schemas in production with decision trees and troubleshooting guidance.

databasemigrationschema+4
142 days ago