Szkolenie: Apache Spark – Structured Streaming
Szkolenie Apache Spark Structured Streaming to praktyczny kurs projektowania i wdrażania aplikacji do przetwarzania strumieni danych w czasie rzeczywistym z użyciem PySpark, Apache Kafka i Delta Lake, obejmujący mikrobatch, event-time, watermark, okna czasowe, checkpointing, exactly-once, monitoring, odporność na awarie oraz optymalizację wydajności rozwiązań produkcyjnych
- Trenerzy praktycy
- Kameralne grupy
Czas trwania szkolenia:2 dni (16h)
Kod kursu:BIGDATA/SPARKSS
Apache Spark – Structured Streaming
Cele szkolenia
Szkolenie przygotowuje do samodzielnego projektowania i uruchamiania aplikacji strumieniowych w Apache Spark Structured Streaming z użyciem PySpark, Apache Kafka oraz narzędzi wdrożeniowych stosowanych w środowisku produkcyjnym
Szkolenie uczy budowania potoków danych czasu rzeczywistego z integracją źródeł i ujść, w tym Apache Kafka, Delta Lake oraz relacyjnych baz danych z wykorzystaniem właściwych trybów zapisu i mechanizmów Structured Streaming
Szkolenie pokazuje, jak konfigurować event-time, watermark, okna czasowe, triggery i partycje shuffle oraz jak dobierać parametry przetwarzania danych do charakterystyki strumienia i wymagań biznesowych
Szkolenie przygotowuje do monitorowania zapytań strumieniowych, analizowania metryk, diagnozowania opóźnień danych, problemów ze stanem aplikacji oraz optymalizacji wydajności mikro-wsadów w Apache Spark
Szkolenie omawia zasady budowania niezawodnych aplikacji 24/7 z użyciem checkpointów, mechanizmów odtwarzania po awarii, zarządzania stanem oraz semantyki dostarczania danych exactly-once
Szkolenie rozwija umiejętność świadomego doboru ujść, strategii zapisu, sposobu obsługi danych opóźnionych oraz metod optymalizacji wydajności w celu utrzymania spójności, skalowalności i wysokiej dostępności rozwiązania
Dla kogo?
Inżynierowie danych rozwijający lub utrzymujący potoki danych czasu rzeczywistego w środowiskach Spark i Kafka
Programiści Python lub PySpark z doświadczeniem w DataFrame API, rozszerzający kompetencje o przetwarzanie strumieniowe
Architekci i developerzy projektujący skalowalne aplikacje danych z wymaganiami wysokiej dostępności i spójności
Specjaliści Big Data odpowiedzialni za wdrożenia produkcyjne, monitoring, optymalizację i integrację ujść danych
Efekty kształcenia
Uczestnik projektuje aplikację strumieniową w Apache Spark Structured Streaming z wykorzystaniem PySpark i dobrych praktyk produkcyjnych
Uczestnik konfiguruje źródła i ujścia danych dla przetwarzania danych w czasie rzeczywistym z użyciem Apache Kafka, Delta Lake oraz baz relacyjnych
Uczestnik analizuje event-time, watermark i okna czasowe w strumieniu danych oraz dobiera odpowiednią strategię przetwarzania
Uczestnik monitoruje metryki zapytań, ocenia stan oraz wydajność aplikacji Structured Streaming i identyfikuje wąskie gardła
Uczestnik organizuje checkpointing, odtwarza przetwarzanie po awarii oraz wdraża mechanizmy zapewniające wysoką niezawodność aplikacji
Uczestnik optymalizuje partycje, triggery i zapis wyników do ujść produkcyjnych, zwiększając wydajność i skalowalność aplikacji streamingowych
Wymagania
Konieczna znajomość języka Python na poziomie umożliwiającym samodzielne pisanie skryptów
Konieczna znajomość Spark DataFrame API i Spark SQL (np. w zakresie szkolenia Apache Spark – wprowadzenie)
Silnie rekomendowana znajomość podstawowych pojęć Apache Kafka (temat, partycja, offset, producent, konsument)
Rekomendowana znajomość relacyjnego modelu danych i podstawowych poleceń SQL
Rekomendowana znajomość środowiska Docker na poziomie uruchamiania i zatrzymywania kontenerów
W cenie otrzymasz:
Materiały szkoleniowe
Certyfikat ukończenia szkolenia
W przypadku szkolenia w trybie stacjonarnym zapewnimy Ci również lunch oraz sprzęt niezbędny do nauki
Program szkolenia
Wybrane opinie
Przeczytaj pozytywne opinie pochodzące z ankiet satysfakcji z naszych szkoleń wypełnianych wyłącznie przez ich uczestników po realizacji usługi

