U
Upvanta sp. z o.o.
FrontendSenior
Senior Data Engineer / Spark Developer
Apache SparkPySparkDataFrame APIStructured StreamingMongoDBMongoDB Spark ConnectorApache IcebergPythonJenkinsCI/CDPrometheusGrafanaJiraConfluenceDelta LakeApache HudiKubernetesDockerSpark OperatorOpenTelemetryDynatraceAzureAWSGCP
Про позицію
We are looking for an experienced Spark / Data Lakehouse Developer to join the Data Platform team. The role involves designing and developing data processing, synchronization, and reconciliation solutions in a Big Data environment, building a modern Data Lakehouse architecture based on Apache Spark, MongoDB, and Apache Iceberg.
Обовʼязки
- Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
- Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
- Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
- Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
- Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
- Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
- Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
- Implementacja monitoringu, metryk i alertowania dla procesów danych.
- Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
- Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
- Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
- Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
- Udział w code review oraz mentoring mniej doświadczonych członków zespołu.
Вимоги
- Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
- Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
- Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
- Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
- Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
- Dobra znajomość języka Python.
- Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
- Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
- Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
- Praktyczna znajomość Jira i Confluence.
- Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)
- Doświadczenie z Delta Lake lub Apache Hudi.
- Znajomość Kubernetes, Docker oraz Spark Operator.
- Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.
- Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.
- Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).
Senior Data Engineer / Spark DeveloperPLN 1100–1300 / DAY
Оригінал