Bize Ulaşın

Eğitim İçeriği

Her oturum 2 saat sürmektedir.

1. Gün: Oturum 1: Neden Hükümet İçin Büyük Veri İş Zekası: İş Bakış Açıları

  • NIH ve DoE'den Vaka Çalışmaları
  • Hükümet Ajanslarında Büyük Veri uyum oranı ve gelecekteki operasyonlarını Büyük Veri Öngörüsel Analitiği etrafında nasıl hizaladıkları
  • DoD, NSA, IRS, USDA gibi alanlarda geniş ölçekli uygulama alanları
  • Büyük Veri'yi Miras (Legacy) verilerle arayüzleştirme
  • Öngörüsel analitikte etkinleştirici teknolojilere temel bakış
  • Veri Entegrasyonu ve Gösterge Panosu (Dashboard) görselleştirmesi
  • Dolandırıcılık yönetimi
  • İş Kuralı / Dolandırıcılık tespiti üretimi
  • Tehdit tespiti ve profil oluşturma
  • Büyük Veri uygulaması için maliyet-fayda analizi

1. Gün: Oturum 2: Büyük Veri'ye Giriş-1

  • Büyük Veri'nin ana karakteristikleri: hacim, çeşitlilik, hız ve doğruluk. Hacim için MPP mimarisi.
  • Veri Ambarları – statik şema, yavaş evrilen veri seti
  • Greenplum, Exadata, Teradata, Netezza, Vertica gibi MPP Veritabanları
  • Hadoop Tabanlı Çözümler – veri seti yapısında kısıtlama yok.
  • Tipik desen: HDFS, MapReduce (crunch), HDFS'den getirme
  • Toplu işlem – analitik/etkileşimsiz işlemler için uygundur
  • Hacim: CEP akan veri
  • Tipik tercihler – CEP ürünleri (örn. Infostreams, Apama, MarkLogic vb)
  • Daha az üretim hazırı – Storm/S4
  • NoSQL Veritabanları – (sütun tabanlı ve anahtar-değer): Veri ambarı/veritabanına analitik eklenti olarak en uygun olan

1. Gün: Oturum 3: Büyük Veri'ye Giriş-2

NoSQL çözümleri

  • KV Mağazası - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Mağazası - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Mağazası (Hiyerarşik) - GT.m, Cache
  • KV Mağazası (Sıralı) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Önbellek - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Kelime Mağazası (Tuple Store) - Gigaspaces, Coord, Apache River
  • Nesne Veritabanı - ZopeDB, DB40, Shoal
  • Belge Mağazası - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Geniş Sütunlu Mağaza - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Veri Çeşitleri: Büyük Veride Veri Temizleme Sorunlarına Giriş

  • RDBMS – statik yapı/şema, çevik ve keşfedici ortamı teşvik etmez.
  • NoSQL – yarı yapılandırılmış, veri depolanmadan önce tam bir şema gerektirmeden veriyi depolamaya yeterli yapı
  • Veri temizliği sorunları

1. Gün: Oturum 4: Büyük Veri Giriş-3: Hadoop

  • Hadoop ne zaman seçilmeli?
  • YAPILANDIRILMIŞ - Kurumsal veri ambarları/veritabanları devasa verileri depolayabilir (maliyete rağmen) ancak yapı dayatır (aktif keşif için uygun değildir)
  • YARI YAPILANDIRILMIŞ veri – geleneksel çözümlerle (DW/DB) zorlayıcıdır
  • Veri ambarı = Devasa çaba ve uygulanmadan sonra bile statik
  • Veri çeşitliliği ve hacmi için, standart donanımda işlenen – HADOOP
  • Bir Hadoop Kümesi oluşturmak için standart donanım gerekir

Map Reduce /HDFS'ye Giriş

  • MapReduce – hesaplamayı birden çok sunucuya dağıtma
  • HDFS – hesaplama süreci için veriyi yerel olarak erişilebilir kılma (yedeklilikle)
  • Veri – yapılandırılmamış/şemasız olabilir (RDBMS'in aksine)
  • Veriden anlam çıkarmak geliştiricinin sorumluluğundadır
  • MapReduce programlama = Java ile çalışma (artıları/eksileri), veriyi HDFS'ye manuel olarak yükleme

2. Gün: Oturum 1: Büyük Veri Ekosistemi-Büyük Veri ETL'sini İnşa Etme: Büyük Veri Araçları Evreni-hangi birini ve ne zaman kullanmalı?

  • Hadoop vs. Diğer NoSQL çözümleri
  • Etkileşimli, rastgele veri erişimi için
  • Hadoop üzerinde Hbase (sütun yönlü veritabanı)
  • Rastgele veri erişimi ancak kısıtlamalar dayatılmış (maks. 1 PB)
  • Ad-hoc analitik için uygun değil, loglama, sayma, zaman serileri için iyi
  • Sqoop - Veritabanlarından Hive veya HDFS'ye içe aktarma (JDBC/ODBC erişimi)
  • Flume – akan veriyi (örn. log verisi) HDFS'ye aktarma

2. Gün: Oturum 2: Büyük Veri Yönetim Sistemi

  • Kayan parçalar, hesaplama düğümleri başlar/başarısız olur: ZooKeeper - Yapılandırma/koordinasyon/adlandırma hizmetleri için
  • Karmaşık boru hattı/iş akışı: Oozie – iş akışını, bağımlılıkları, seri işlemi yönetme
  • Dağıtım, yapılandırma, küme yönetimi, yükseltme vb. (sistem yöneticisi) : Ambari
  • Bulut ortamında: Whirr

2. Gün: Oturum 3: İş Zekasında Öngörüsel Analitik -1: Temel Teknikler ve Makine Öğrenmesine Dayalı BI :

  • Makine öğrenmesine giriş
  • Sınıflandırma tekniklerini öğrenme
  • Bayes Tahmini-eğitim dosyası hazırlama
  • Destek Vektör Makinesi
  • KNN p-Ağaç Cebri ve dikey madencilik
  • Sinir Ağı
  • Büyük Veri büyük değişken sorunu - Rastgele orman (RF)
  • Büyük Veri Otomasyon sorunu – Çoklu model topluluğu RF
  • Soft10-M ile Otomasyon
  • Metin analitik aracı-Treeminer
  • Çevik öğrenme
  • Ajan tabanlı öğrenme
  • Dağıtık öğrenme
  • Öngörüsel analitik için Açık Kaynaklı Araçlara Giriş: R, Rapidminer, Mahut

2. Gün: Oturum 4 Öngörüsel analitik ekosistemi-2: Hükümetteki ortak öngörüsel analitik sorunları.

  • Görüş analitiği
  • Görselleştirme analitiği
  • Yapılandırılmış öngörüsel analitik
  • Yapılandırılmamış öngörüsel analitik
  • Tehdit/dolandırıcı/tedarikçi profillemesi
  • Tavsiye Motoru
  • Desen tespiti
  • Kural/Senaryo keşfi – hata, dolandırıcılık, optimizasyon
  • Kök neden keşfi
  • Duygu analizi
  • Müşteri İlişkileri Yönetimi (CRM) analitiği
  • Ağ analitiği
  • Metin Analitiği
  • Teknoloji destekli inceleme
  • Dolandırıcılık analitiği
  • Gerçek Zamanlı Analitik

3. Gün : Oturum 1: Hadoop Üzerinde Gerçek Zamanlı ve Ölçeklenebilir Analitik

  • Neden ortak analitik algoritmalar Hadoop/HDFS'de başarısız olur?
  • Apache Hama- Toplu Eşzamanlı dağıtık hesaplama için
  • Apache SPARK- gerçek zamanlı analitik için küme hesaplama
  • CMU Grafik Laboratuvarı 2- Dağıtık hesaplama için grafik tabanlı asenkron yaklaşım
  • Treeminer'dan KNN p-Cebri tabanlı yaklaşım, operasyon için donanım maliyetini azaltır

3. Gün: Oturum 2: eDiscovery ve Adli Bilim Araçları

  • Büyük Veri üzerinde eDiscovery vs. Miras veri – maliyet ve performans karşılaştırması
  • Öngörüsel kodlama ve teknoloji destekli inceleme (TAR)
  • TAR'ın daha hızlı keşif için nasıl çalıştığını anlamak için bir TAR ürününün (vMiner) canlı demosu
  • HDFS ile daha hızlı dizinleme – veri hızı
  • NLP veya Doğal Dil İşleme – çeşitli teknikler ve açık kaynak ürünler
  • Yabancı dillerde eDiscovery-yabancı dil işleme teknolojisi

3. Gün: Oturum 3: Siber Güvenlik için Büyük Veri BI – Hızlı veri toplama'dan tehdit tanımlama'ya kadar bütüncül 360 derecelik görünüşün anlaşılması

  • Güvenlik analitiği temellerini anlama-saldırı yüzeyi, güvenlik yapılandırma hataları, host savunmaları
  • Ağ altyapısı / Büyük veri borusu / Gerçek zamanlı analitik için Yanıt ETL
  • Tedbir alıcı vs öngörüsel – Sabit kural tabanlı vs Tehdit kurallarının Meta veriden otomatik keşfi

3. Gün: Oturum 4: USDA'da Büyük Veri : Tarımda Uygulama

  • Tarım için IoT (Nesnelerin İnterneti)'ne giriş-sensör tabanlı Büyük Veri ve kontrol
  • Uydu görüntülemesine ve tarımda uygulamalarına giriş
  • Toprak verimliliği, ekim önerileri ve tahminler için sensör ve görüntü verilerinin entegrasyonu
  • Tarım sigortası ve Büyük Veri
  • Hasar kayıpları tahmini

4. Gün: Oturum 1: Hükümette Büyük Veri'den Dolandırıcılık Önleme BI-Dolandırıcılık analitiği:

  • Dolandırıcılık analitiği temelli sınıflandırması- kural tabanlı vs öngörüsel analitik
  • Dolandırıcılık desen tespiti için Denetimli vs denetimsiz Makine Öğrenmesi
  • Tedarikçi dolandırıcılığı/projeler için fazla faturalandırma
  • Medicare ve Medicaid dolandırıcılığı- talep işlemleri için dolandırıcılık tespiti teknikleri
  • Seyahat gideri iadesi dolandırıcılıkları
  • IRS iade dolandırıcılıkları
  • Veri mevcut olan her yerde vaka çalışmaları ve canlı demo sunulacaktır.

4. Gün: Oturum 2: Sosyal Medya Analitiği- İstihbarat toplama ve analiz

  • Sosyal medya verilerini çıkarmak için Büyük Veri ETL API
  • Metin, görsel, meta veri ve video
  • Sosyal medya akışından duygu analizi
  • Sosyal medya akışının bağlamsal ve bağlamsız filtrelemesi
  • Çeşitli sosyal medyaları entegre etmek için Sosyal Medya Gösterge Panosu
  • Sosyal medya profillerinin otomatik profillemesi
  • Her analitik için Treeminer Aracı üzerinden canlı demo sunulacaktır.

4. Gün: Oturum 3: Görüntü işleme ve video akışlarında Büyük Veri Analitiği

  • Büyük Veride Görsel Depolama teknikleri-petabaytları aşan veriler için depolama çözümü
  • LTFS ve LTO
  • GPFS-LTFS (Büyük görsel veriler için Katmanlı depolama çözümü)
  • Görsel analitiği temelleri
  • Nesne tanıma
  • Görsel segmentasyonu
  • Hareket takibi
  • 3-B görsel yeniden yapımı

4. Gün: Oturum 4: NIH'de Büyük Veri uygulamaları:

  • Yükselen Biyoinformatik alanları
  • Meta-genomik ve Büyük Veri madencilik sorunları
  • Farmakogenomik, Metabolomik ve Proteomik için Büyük Veri Öngörüsel analitiği
  • Aşağı akış Genomik sürecinde Büyük Veri
  • Kamu sağlığında Büyük veri öngörüsel analitiğin uygulaması

Çeşitli verilerin hızlı erişimi ve görüntülenmesi için Büyük Veri Gösterge Panosu :

  • Mevcut uygulama platformunun Büyük Veri Gösterge Panosu ile entegrasyonu
  • Büyük Veri yönetimi
  • Büyük Veri Gösterge Panosu Vaka Çalışması: Tableau ve Pentaho
  • Büyük Veri uygulamasını Hükümette konum tabanlı hizmetleri desteklemek için kullanma
  • Takip sistemi ve yönetimi

5. Gün: Oturum 1: Bir kuruluş içinde Büyük Veri BI uygulamasının nasıl meşrulaştırılacağı:

  • Büyük Veri uygulaması için ROI tanımlama
  • Veri toplama ve hazırlama için Analist Zamanı tasarrufu vaka çalışmaları – verimlilik kazancı artışı
  • Lisanslı veritabanı maliyetinden tasarrufa dayalı gelir kazancı vaka çalışmaları
  • Konum tabanlı hizmetlerden gelen gelir kazancı
  • Dolandırıcılık önlemesinden tasarruf
  • Büyük Veri uygulamasından yaklaşık harcama vs. Gelir kazancı/tasarrufunu hesaplamak için entegre bir hesaplama tablosu yaklaşımı.

5. Gün: Oturum 2: Miras veri sistemini Büyük Veri Sistemine geçirme için Adım adım prosedür:

  • Pratik Büyük Veri Göç Yol Haritasını anlama
  • Bir Büyük Veri uygulamasını mimarileştirmeden önce gereken önemli bilgiler nelerdir?
  • Verinin hacminin, hızının, çeşitliliğinin ve doğruluğunun hesaplanmasının farklı yolları nelerdir?
  • Veri büyümesi nasıl tahmin edilir?
  • Vaka çalışmaları

5. Gün: Oturum 4: Büyük Veri Tedarikçilerinin ve ürünlerinin incelemesi. S/O Oturumu:

  • Accenture
  • APTEAN (Eski CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Eski 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (EMC'nin bir parçası)

Kurs İçin Gerekli Önbilgiler

  • Alanlarında Hükümet iş operasyonları ve veri sistemleri hakkında temel bilgi
  • SQL/Oracle veya ilişkisel veritabanları hakkında temel anlayış
  • İstatistik hakkında temel anlayış (Hesap Tablosu seviyesinde)
 35 Saatler

Katılımcı Sayısı


Katılımcı başına fiyat

Danışanlarımızın Yorumları (1)

Yaklaşan Etkinlikler

İlgili Kategoriler