LLM Serving and Inference APIs
Serve models through reliable APIs with streaming, batching, monitoring, and sensible deployment boundaries. Actual count-based generation and serving state transitions plus optional HTTP and model-runtime integration. Includes detailed lessons, worked solutions, failure injection, independent challenges and instructor assessment.
Advanced18–26 hoursArtificial IntelligencePremium access