Bize Ulaşın
 Süre 14 Saat

Eğitim İçeriği

Konuşma Tanıma Teknolojilerine Genel Bakış

  • Konuşma tanımanın tarihi ve evrimi
  • Akustik modeller, dil modelleri ve çözme (decoding)
  • Modern mimariler: RNN'ler, transformer'lar ve Whisper

Ses Ön İşleme ve Temel Metne Dönüştürme

  • Ses formatları ve örnek hızlarıyla çalışma
  • Sesin temizlenmesi, kısaltılması ve segmentlere ayrılması
  • Sesden metin üretimi: gerçek zamanlı ve toplu işlem

Whisper ve Diğer API'lerle Uygulamalı Çalışma

  • OpenAI Whisper'ın kurulumu ve kullanımı
  • Metne dönüştürme için bulut API'lerinin (Google, Azure) çağrılması
  • Performans, gecikme ve maliyet karşılaştırması

Dil, Aksan ve Sektöre Özel Uyum

  • Birden fazla dil ve aksanla çalışma
  • Özel sözlükler ve gürültü toleransı
  • Hukuki, tıbbi veya teknik dil işleme

Çıktı Biçimlendirme ve Entegrasyon

  • Zaman damgaları, noktalama işaretleri ve konuşmacı etiketleri ekleme
  • Metin, SRT veya JSON formatlarına dışa aktarma
  • Metinlerin uygulamalara veya veritabanlarına entegrasyonu

Kullanım Senaryosu Uygulama Laboratuvarları

  • Toplantı, mülakat veya podcast transkripsiyonu
  • Sesten metne komut sistemleri
  • Video/ses akışları için gerçek zamanlı altyazı

Değerlendirme, Sınırlılıklar ve Etik

  • Doğruluk metrikleri ve model performans testleri
  • Konuşma modellerinde önyargı ve adil davranma
  • Gizlilik ve uyumluluk hususları

Özet ve Sonraki Adımlar

Kurs İçin Gerekli Önbilgiler

  • Genel yapay zeka ve makine öğrenimi kavramlarına hakimiyet
  • Ses veya medya dosya formatları ve araçlarıyla aşinalık

Hedef Kitle

  • Ses verileriyle çalışan veri bilimciler ve yapay zeka mühendisleri
  • Metne dönüştürme tabanlı uygulamalar geliştiren yazılım geliştiriciler
  • Otomasyon için konuşma tanımayı araştıran kuruluşlar

Katılımcı Sayısı


Katılımcı başına fiyat

Yaklaşan Etkinlikler

İlgili Kategoriler