Bizi tercih ettiğiniz için teşekkür ederiz. Ekip üyelerimiz en kısa sürede sizlerle iletişime geçecektir.
Rezervasyonunuzu gönderdiğiniz için teşekkür ederiz! Ekibimizden bir yetkili kısa süre içinde sizinle iletişime geçecektir.
Süre 14 Saat
Eğitim İçeriği
Tencent Hunyuan Üretim Temelleri
- Tencent Hunyuan model sunum senaryolarına genel bakış
- Büyük ve MoE modellerin üretim özellikleri
- Yaygın gecikme, işleme kapasitesi ve maliyet darboğazları
- Çıkarım iş yükleri için hizmet düzeyi hedeflerinin tanımlanması
Dağıtım Mimarisi ve Sunum Akışı
- Bir üretim çıkarım yığınının temel bileşenleri
- Kapsayıcı tabanlı, yerel altyapı ve bulut dağıtım modelleri arasında seçim
- Model yükleme, istek yönlendirme ve GPU tahsisi temelleri
- Güvenilirlik ve operasyonel sadelik için tasarım
Pratikte Gecikme Optimizasyonu
- Uygun durumlarda TensorRT gibi optimize edilmiş çıkarım motorlarının kullanımı
- KV-cache kavramları ve pratik önbellek ayarlama
- Başlatma, ısınma yanıt süresi ve yanıt üst maliyetlerinin azaltılması
- İlk jetonun gelme süresi (time to first token) ve jeton üretimi hızının ölçülmesi
İşleme Kapasitesi, Toplu İşleme ve GPU Verimliliği
- Sürekli toplu işleme ve istek toplu işleme stratejileri
- Eşzamanlılık ve kuyruk davranışının yönetimi
- Kullanıcı deneyimini olumsuz etkilemeden GPU veriminin artırılması
- Uzun bağlam ve karmaşık iş yükü isteklerinin işlenmesi
Nicelleştirme ve Maliyet Kontrolü
- Nicelleştirmenin üretim sunumu neden önemlidir?
- FP16, INT8 ve diğer yaygın hassasiyet seçeneklerinin pratik dengeleri
- Model kalitesi, gecikme ve altyapı maliyeti arasındaki denge
- Basit bir maliyet optimizasyonu kontrol listesi oluşturma
Operasyonlar, İzleme ve Hazırlık Gözden Geçirmesi
- Çıkarım hizmetleri için otomatik ölçeklendirme tetikleyicileri
- Gecikme, işleme kapasitesi, önbellek kullanımı ve GPU sağlığı izleme
- Günlük kayıtları (logging), uyarılar ve olay müdahalesi temelleri
- Bir referans dağıtımın gözden geçirilmesi ve iyileştirme planının oluşturulması
Kurs İçin Gerekli Önbilgiler
- Yapay zeka büyük dil modellerinin dağıtımı ve çıkarım iş akışlarına ilişkin temel bilgi.
- Kapsayıcılar (containers), bulut veya yerel altyapı ve API tabanlı hizmetler konusunda deneyim.
- Python veya sistem mühendisliği görevlerine yönelik çalışma bilgisine sahip olmak.
Hedef Kitle
- LLM'leri üretim ortamına dağıtan ML mühendisleri.
- GPU tabanlı çıkarım hizmetlerinden sorumlu platform mühendisleri.
- Ölçeklenebilir AI sunum platformları tasarlayan çözüm mimarları.