Szkolenie: Data Engineer – inżynieria danych w Pythonie
Szkolenie Data Engineer w Pythonie to praktyczny kurs inżynierii danych, który uczy projektowania i budowy produkcyjnych pipelineów danych z wykorzystaniem Python, Apache Airflow, Apache Spark, Apache Kafka oraz baz SQL i NoSQL, obejmując ETL i ELT, data lake, przetwarzanie wsadowe i strumieniowe, jakość danych, orkiestrację, optymalizację wydajności i udostępnianie danych
- Trenerzy praktycy
- Kameralne grupy
Czas trwania szkolenia:2 dni (16h)
Kod kursu:BIGDATA/DE-PYTHON
Data Engineer – inżynieria danych w Pythonie
Cele szkolenia
Szkolenie przygotowuje do samodzielnego projektowania i budowy produkcyjnych procesów ETL i ELT w języku Python z uwzględnieniem architektury data lake, podziału na warstwy danych oraz zasad powtarzalnego i odpornego na błędy przetwarzania
Szkolenie uczy organizowania przepływów danych z wykorzystaniem Apache Airflow, w tym definiowania zadań, obsługi harmonogramów, ponowień, backfillu oraz uruchamiania procesów wsadowych i zdarzeniowych w środowisku produkcyjnym
Szkolenie pokazuje przetwarzanie dużych zbiorów danych w Apache Spark, obejmujące czyszczenie danych, transformacje, partycjonowanie, budowę warstw pośrednich i docelowych oraz dobór technik poprawy wydajności przetwarzania
Szkolenie omawia integrację źródeł i systemów danych z wykorzystaniem Apache Kafka, PostgreSQL i Redis oraz pokazuje, jak łączyć przetwarzanie wsadowe i strumieniowe w produkcyjnych pipeline’ach danych
Szkolenie rozwija umiejętność kontrolowania jakości danych, diagnozowania problemów wydajnościowych oraz budowy kompletnego pipelineu danych od pozyskania, przez walidację i przetwarzanie, po publikację wyników
Dla kogo?
Programiści Python z praktyczną znajomością SQL, którzy chcą rozwijać kompetencje w obszarze Data Engineering lub pracować jako Data Engineer
Inżynierowie danych budujący lub utrzymujący pipeliney ETL, ELT i platformy danych
Analitycy danych i backend developerzy rozszerzający kompetencje o Spark, Airflow i Kafka
Specjaliści platform danych odpowiedzialni za integrację źródeł, jakość danych i wydajność
Osoby pracujące z Dockerem i bazami danych, które chcą wdrażać produkcyjne procesy danych
Efekty kształcenia
Uczestnik projektuje pipeline danych zgodny z podejściem ETL, ELT i architekturą medalionową
Uczestnik buduje przepływy Airflow z harmonogramem, ponawianiem zadań i backfillem Uczestnik przetwarza dane w Apache Spark z użyciem DataFrame, partycjonowania i technik optymalizacji
Uczestnik integruje dane wsadowe i strumieniowe z użyciem Kafka i Structured Streaming
Uczestnik wdraża walidację jakości danych, kwarantannę rekordów i testy w pipeline
Uczestnik analizuje wydajność zapytań i dobiera SQL, NoSQL oraz mechanizmy cache
Wymagania
Praktyczna znajomość języka Python w zakresie funkcji, klas i środowisk wirtualnych
Znajomość języka SQL w zakresie złączeń, agregacji i podzapytań
Mile widziane doświadczenie w pracy z danymi lub bazami danych
Umiejętność korzystania z narzędzi wirtualizacji, np. Docker, Podman
W cenie otrzymasz:
Materiały szkoleniowe
Certyfikat ukończenia szkolenia
W przypadku szkolenia w trybie stacjonarnym zapewnimy Ci również lunch oraz sprzęt niezbędny do nauki
Program szkolenia
Wybrane opinie
Przeczytaj pozytywne opinie pochodzące z ankiet satysfakcji z naszych szkoleń wypełnianych wyłącznie przez ich uczestników po realizacji usługi

