Eğitim İçeriği
Databricks Platformu ve Lakehouse Temelleri
- Databricks Lakehouse mimarisi ve bileşenleri
- Çalışma alanlarının ve kataloğların düzenlenmesi
Databricks Çalışma Alanı ve Not Defterleri
- Çalışma alanında gezinme ve not defteri tabanlı geliştirme
- Kodu yeniden kullanılabilir not defterlerine yapılandırma
Apache Spark Mimarisi ve İşleyişi
- Spark çalışma zamanı mimarisi ve işleyiş modeli
- Gecikmeli değerlendirme (Lazy Evaluation) ve iş DAG'i
PySpark DataFrames ve DataFrame API'si
- DataFrame soyutlamaları ve şemalar
- Temel DataFrame işlemleri ve sütun ifadeleri
SQL'den PySpark DataFrames'e Geçiş
- Temel SQL deyimlerinin DataFrame işlemlerine çevrilmesi
- PySpark'ta pencere fonksiyonları ve özet hesaplamalar
Databricks'te Veri Okuma ve Yazma
- Yaygın dosya ve veritabanı kaynaklarından okuma işlemi
- Lakehouse içinde veri yazma ve bölütleme (partitioning)
Delta Lake ve Tablo Yönetimi
- Delta tabloları ve ACID işlemleri
- Zaman yolculuğu ve şema evrimi
Veri Temizleme ve Dönüştürme Deseni
- Veri temizliği ve veri tipi dönüşümü
- Yeniden kullanılabilir dönüştürme mantığı oluşturma
Kullanıcı Tanımlı Fonksiyonlar (UDF) ve Modüler Kod
- Python UDF'ler ve pandas UDF'ler
- Sekans mantığını fonksiyonlara dönüştürerek modülerleştirme
Performans İnceleme ve Optimizasyon
- Bölütleme (partitioning) ve önbellekleme stratejileri
- Spark UI ile darboğazların teşhisi
Yapılandırılmış Akış Mimarisi (Structured Streaming) Temelleri
- Hızlı işlem vs akış işleme modelleri
- Akış DataFrames ve temel özetler
Databricks İşleri ve İş Akışı Yönetimi
- Not defterlerini görevler olarak zamanlama
- Bağımlılıkları olan çok adımlı iş akışları oluşturma
Unity Catalog ve Veri Yönetimi
- Unity Catalog mimarisi ve ad alanları
- Erişim kontrolü ve veri çizelgesi
Sınamalar, Hata Ayıklama ve Üretim Uygulamaları
- PySpark mantığının birim testi (unit testing)
- Hata ayıklama ve kod kalite standartları
Kapsamlı Finansal Hizmetler Kullanım Durumları
- Kapsamlı banka ETL boruhattı oluşturma
- Eski SQL süreçlerinin PySpark'a dönüştürülmesi
SQL Yüklerini PySpark'a Göç Etme
- Göç stratejisi ve planlama desenleri
- SQL iş akışlarının PySpark'a artışlı dönüştürülmesi
Kurs İçin Gerekli Önbilgiler
- Fonksiyonlar ve veri tipleri dahil Python programlama deneyimi
- Joins, aggregations (özetler) ve alt sorgular dahil SQL anlayışı
- Databricks veya PySpark'a dair önceden herhangi bir deneyim gerekmez
Hedef Kitle
- Veri mühendisleri, veri analistleri ve veri profesyonelleri
- Mevcut SQL tabanlı iş akışlarını Databricks ve PySpark’a göç ettiren ekipler
Danışanlarımızın Yorumları (1)
Teorik bilgiyi pratik örneklerle uygulamayı çok sevdim. Pratik olması benim için harika oldu.
Aurelia-Adriana - Allianz Services Romania
Eğitim - Python and Spark for Big Data (PySpark)
Yapay Zeka Çevirisi