Hootix Academy

استنتاج LLM والنشر على نطاق واسع Certification

أتِح نماذج اللغة الكبيرة بسرعة وبتكلفة منخفضة وبموثوقية عالية على نطاق واسع

Key facts

About the استنتاج LLM والنشر على نطاق واسع certification

حوّل نموذجًا مُدرَّبًا إلى خدمة إنتاجية سريعة وميسورة التكلفة وموثوقة تحت حركة مرور حقيقية. تغطي هذه الشهادة الاحترافية كيفية اختلاف الاستنتاج جوهريًا عن التدريب، وحلقة فك التشفير الذاتي التكراري، والمرحلتين اللتين تُهيمنان على التكلفة: الإسبقية (prefill) المقيّدة بالحوسبة وفك التشفير (decode) المقيّد بالذاكرة. ستتقن ذاكرة تخزين KV المؤقتة — سبب وجودها، وتكلفتها في ذاكرة GPU، ولماذا هي — لا الأوزان — في الغالب تُحدّد الإنتاجية — واستراتيجيات التجميع التي تُوزّع تلك التكلفة: التجميع الثابت والديناميكي والمستمر (في الرحلة). تأتي بعد ذلك مجموعة أدوات الخدمة الأساسية: PagedAttention وvLLM لإدارة ذاكرة KV المؤقتة الكفوءة، وFlashAttention للانتباه الواعي بالإدخال/الإخراج، والكميّة (int8/int4 وGPTQ وAWQ وGGUF، والأوزان فقط مقابل الأوزان والتنشيط) ومقايضات دقتها، وفك التشفير التخميني/المساعَد لتقليل زمن الاستجابة، والتوازي في المتجهات للنماذج الكبيرة جدًا لـGPU واحدة. ستُجري حسابات ذاكرة GPU (المعاملات وذاكرة KV المؤقتة والتنشيطات)، وتستدل حول مقاييس زمن الاستجابة المهمة — TTFT وTPOT/ITL والإجمالي — وتتنقل في مقايضة الإنتاجية مقابل زمن الاستجابة. أخيرًا ستشغّل الخدمة: الضبط التلقائي لحجم الخدمة وموازنة الحمل، واختيار حزمة الخدمة (vLLM / TGI / TensorRT-LLM)، والتخزين المؤقت للتوجيه والبادئة، وتحسين التكلفة، والمراقبة والرصد، وضمانات الحماية عند وقت الخدمة. بحلول النهاية ستكون قادرًا على تحديد حجم نشر استنتاج LLM حقيقي ونشره وضبطه والدفاع عنه.

What you will learn

The official استنتاج LLM والنشر على نطاق واسع study course covers:

  1. From Training to Inference — Why serving is a different problem: the forward-only decode loop, the prefill/decode split, and the KV-cache that defines LLM inference.
  2. The KV-Cache & GPU-Memory Math — Why the KV-cache exists, what it costs, and how to size weights + KV + activations for a real deployment.
  3. Batching & Attention Kernels — Static, dynamic, and continuous batching; PagedAttention's paged KV; and FlashAttention's IO-aware exact attention.
  4. Quantization & Faster Decoding — Int8/int4 weight and activation quantization (GPTQ, AWQ, GGUF), the accuracy tradeoff, and speculative decoding.
  5. Serving at Scale — Latency metrics, throughput/latency tradeoffs, tensor parallelism, serving stacks, caching, autoscaling, cost, observability, and guardrails.

Prerequisites

Frequently asked questions

Is the استنتاج LLM والنشر على نطاق واسع certificate verifiable?
Yes. Every issued Hootix Academy certificate carries a unique credential code that anyone can verify online.
How is the استنتاج LLM والنشر على نطاق واسع exam structured?
It is a 105-minute proctored multiple-choice exam of 75 questions; you need 75% to pass.
Do I need to buy the course to take the exam?
You can purchase the certification exam on its own, or bundle it with the full study course at a reduced price.
How long does the استنتاج LLM والنشر على نطاق واسع course take?
About 38 hours of self-paced study.

Related certifications