Bize Ulaşın

Eğitim İçeriği

Tencent Hunyuan Üretim Temelleri

  • Tencent Hunyuan model sunum senaryolarına genel bakış
  • Büyük ve MoE modellerin üretim özellikleri
  • Yaygın gecikme, işleme kapasitesi ve maliyet darboğazları
  • Çıkarım iş yükleri için hizmet düzeyi hedeflerinin tanımlanması

Dağıtım Mimarisi ve Sunum Akışı

  • Bir üretim çıkarım yığınının temel bileşenleri
  • Kapsayıcı tabanlı, yerel altyapı ve bulut dağıtım modelleri arasında seçim
  • Model yükleme, istek yönlendirme ve GPU tahsisi temelleri
  • Güvenilirlik ve operasyonel sadelik için tasarım

Pratikte Gecikme Optimizasyonu

  • Uygun durumlarda TensorRT gibi optimize edilmiş çıkarım motorlarının kullanımı
  • KV-cache kavramları ve pratik önbellek ayarlama
  • Başlatma, ısınma yanıt süresi ve yanıt üst maliyetlerinin azaltılması
  • İlk jetonun gelme süresi (time to first token) ve jeton üretimi hızının ölçülmesi

İşleme Kapasitesi, Toplu İşleme ve GPU Verimliliği

  • Sürekli toplu işleme ve istek toplu işleme stratejileri
  • Eşzamanlılık ve kuyruk davranışının yönetimi
  • Kullanıcı deneyimini olumsuz etkilemeden GPU veriminin artırılması
  • Uzun bağlam ve karmaşık iş yükü isteklerinin işlenmesi

Nicelleştirme ve Maliyet Kontrolü

  • Nicelleştirmenin üretim sunumu neden önemlidir?
  • FP16, INT8 ve diğer yaygın hassasiyet seçeneklerinin pratik dengeleri
  • Model kalitesi, gecikme ve altyapı maliyeti arasındaki denge
  • Basit bir maliyet optimizasyonu kontrol listesi oluşturma

Operasyonlar, İzleme ve Hazırlık Gözden Geçirmesi

  • Çıkarım hizmetleri için otomatik ölçeklendirme tetikleyicileri
  • Gecikme, işleme kapasitesi, önbellek kullanımı ve GPU sağlığı izleme
  • Günlük kayıtları (logging), uyarılar ve olay müdahalesi temelleri
  • Bir referans dağıtımın gözden geçirilmesi ve iyileştirme planının oluşturulması

Kurs İçin Gerekli Önbilgiler

  • Yapay zeka büyük dil modellerinin dağıtımı ve çıkarım iş akışlarına ilişkin temel bilgi.
  • Kapsayıcılar (containers), bulut veya yerel altyapı ve API tabanlı hizmetler konusunda deneyim.
  • Python veya sistem mühendisliği görevlerine yönelik çalışma bilgisine sahip olmak.

Hedef Kitle

  • LLM'leri üretim ortamına dağıtan ML mühendisleri.
  • GPU tabanlı çıkarım hizmetlerinden sorumlu platform mühendisleri.
  • Ölçeklenebilir AI sunum platformları tasarlayan çözüm mimarları.
 14 Saatler

Katılımcı Sayısı


Katılımcı başına fiyat

Yaklaşan Etkinlikler

İlgili Kategoriler