Inferencia de LLM y Despliegue a Gran Escala Certification
Sirva grandes modelos de lenguaje de forma rápida, económica y fiable a escala
Key facts
- Level: Professional
- Field: Artificial Intelligence & LLMs
- Estimated study time: about 38 hours
- Credential price: $149
- Exam: 75 questions · 105 minutes · pass mark 75%
About the Inferencia de LLM y Despliegue a Gran Escala certification
Convierta un modelo entrenado en un servicio en producción que sea rápido, asequible y fiable bajo tráfico real. Esta certificación profesional cubre en qué se diferencia fundamentalmente la inferencia del entrenamiento, el bucle de decodificación autorregresiva y las dos fases que dominan el coste: el prefill ligado a cómputo y el decode ligado a memoria. Dominará la caché KV — por qué existe, cuánto cuesta en memoria de GPU y por qué ella, y no los pesos, a menudo limita el rendimiento — y las estrategias de batching que amortizan ese coste: batching estático, dinámico y continuo (en vuelo). A continuación se aborda el conjunto de herramientas esencial para el servicio: PagedAttention y vLLM para la gestión eficiente en memoria de la caché KV, FlashAttention para la atención consciente de la E/S, cuantización (int8/int4, GPTQ, AWQ, GGUF, solo pesos vs. pesos y activaciones) y sus compromisos de precisión, decodificación especulativa/asistida para la latencia, y paralelismo de tensores para modelos demasiado grandes para una sola GPU. Realizará los cálculos de memoria GPU (parámetros, caché KV, activaciones), razonará sobre las métricas de latencia que importan — TTFT, TPOT/ITL y de extremo a extremo — y navegará el compromiso entre rendimiento y latencia. Finalmente operará el servicio: autoescalado y balanceo de carga, elección de un stack de servicio (vLLM / TGI / TensorRT-LLM), caché de prompts y prefijos, optimización de costes, monitoreo y observabilidad, y salvaguardas en tiempo de servicio. Al finalizar podrá dimensionar, desplegar, ajustar y defender un despliegue real de inferencia de LLM.
What you will learn
The official Inferencia de LLM y Despliegue a Gran Escala study course covers:
- From Training to Inference — Why serving is a different problem: the forward-only decode loop, the prefill/decode split, and the KV-cache that defines LLM inference.
- The KV-Cache & GPU-Memory Math — Why the KV-cache exists, what it costs, and how to size weights + KV + activations for a real deployment.
- Batching & Attention Kernels — Static, dynamic, and continuous batching; PagedAttention's paged KV; and FlashAttention's IO-aware exact attention.
- Quantization & Faster Decoding — Int8/int4 weight and activation quantization (GPTQ, AWQ, GGUF), the accuracy tradeoff, and speculative decoding.
- Serving at Scale — Latency metrics, throughput/latency tradeoffs, tensor parallelism, serving stacks, caching, autoscaling, cost, observability, and guardrails.
Prerequisites
Frequently asked questions
- Is the Inferencia de LLM y Despliegue a Gran Escala certificate verifiable?
- Yes. Every issued Hootix Academy certificate carries a unique credential code that anyone can verify online.
- How is the Inferencia de LLM y Despliegue a Gran Escala exam structured?
- It is a 105-minute proctored multiple-choice exam of 75 questions; you need 75% to pass.
- Do I need to buy the course to take the exam?
- You can purchase the certification exam on its own, or bundle it with the full study course at a reduced price.
- How long does the Inferencia de LLM y Despliegue a Gran Escala course take?
- About 38 hours of self-paced study.