medusa AI Agent Skills
Browse 2 skills related to medusa
speculative-decoding
21.8k
Accelerate LLM inference using speculative decoding, Medusa multiple heads, and lookahead decoding techniques. Use when optimizing inference speed (1.5-3.6× speedup), reducing latency for real-time applications, or deploying models with limited compute. Covers draft models, tree-based attention, Jacobi iteration, parallel token generation, and production deployment strategies.
Emerging TechniquesSpeculative DecodingMedusa+7
143 days ago
medusa
15
Medusa v2 rules and best practices for modular commerce architecture, Workflow SDK, data models, services, and admin customizations.
medusaheadless-commerceecommerce+4
143 days ago