NTN 520 -   Escalar IA Duele

NTN 520 - Escalar IA Duele

May 19, 2026 · 23 min

About this episode

The episode discusses the complexities of scaling large language models compared to traditional web applications.

Servir un LLM no es como escalar una web app normal. Hablamos de tokens, GPUs, KV cache, latencia, costos y por qué “agregar más pods” ya no salva a nadie. Fuentes: • https://www.dheeth.blog/llm-serving-is-not-normal-web-serving/ • https://arxiv.org/abs/2309.06180 • https://kubernetes.io/docs/concepts/workloads/autoscaling/horizontal-pod-autoscale/

More episodes of No Tiene Nombre

Explore listener stats, chart rankings, contacts and more on the No Tiene Nombre podcast page.