Running LLM inference on Kubernetes requires new primitives for routing, autoscaling, and GPU scheduling. Here's what platform engineers need to know.

Podden och tillhörande omslagsbild på den här sidan tillhör The AI Kubernetes Show. Innehållet i podden är skapat av The AI Kubernetes Show och inte av, eller tillsammans med, Poddtoppen.