Beschreibung
Die Rolle entwickelt und wartet automatisierte Batch- und Streaming-Datenaufnahme-Pipelines, erweitert hybride Datenplattformen mit Spark oder Databricks, implementiert Maßnahmen zur Datenqualität und -governance und unterstützt die Performance der Datenverarbeitung. Dafür sind praktische Kenntnisse in verteiltem Computing, Python, SQL, Cloud-Umgebungen, Docker, Git, Datenmodellierung und Tests erforderlich; außerdem werden gute Deutsch- und Englischkenntnisse sowie ein Studium der Informatik, Dateningenieurwesen oder eines vergleichbaren Fachgebiets vorausgesetzt.
