4x Intermediate Data Engineer & 1x Senior Data Architect (m/w/d) - AWS, AzurePython, CI/CD, Kafka, KI, SQL, PySpark und Apache Spark

Remote | Berlin

Für unser Projekt IT_2332 suchen wir folgenden Spezialisten (m/w/d):
 

Bitte Bewerben Sie sich nur wenn Sie die Muss-Anforderungen zu 100% erfüllen. 

Bitte geben Sie bei Ihrer Bewerbung an für welche per 5 Positionen Sie sich bewerben. 

Nur Festangestellte. KEINE FREELANCER. 


Wichtige Infos:
Abgabefrist: 15.09.2026 eob
Auslastung: Vollzeit
Örtlichkeit: remote
Projektsprache: Deutsch (Pflicht)
Anstellungsart: Ausschließlich sozialversicherungspflichtige Festanstellung (keine freie Mitarbeit, keine Freelancer).
Honorar: Intermediate-Positionen (A-D) max. 75€/Std. remote UND Senior-Position (E) max. 85€/Std. remote  

 

Schwerpunkt der MUSS-Anforderungen
A – Intermediate Data Engineer::: Entwicklung von Datenpipelines und Datenprodukten mit Python, SQL, PySpark und Spark; AWS- und Azure-Erfahrung; Cloud-Migration und Modernisierung von Legacy-Systemen; Verarbeitung heterogener Stamm- und Transaktionsdaten aus dem Schienengüterverkehr.

B – Intermediate Data Engineer::: AWS-fokussiertes Data Engineering mit Python, SQL, PySpark und Spark; AWS Glue, S3 und Step Functions; Migration von On-Premise-Systemen; CI/CD, Infrastructure as Code und automatisierte Tests; Datenqualität, Monitoring und Reporting für den Schienengüterverkehr.

C – Intermediate Data Engineer::: Multi-Cloud-Erfahrung mit AWS und Azure; AWS Glue, S3 und weitere AWS-Services; Azure Data Factory, Python, PySpark und Scala; Entwicklung von Machine-Learning-Anwendungen; Migration von Legacy-Datenplattformen; Datenqualität, Tests, Monitoring und Data Contracts.

D – Intermediate Data Engineer::: Azure-fokussiertes Data Engineering mit Python, SQL, PySpark, Azure Data Factory und Azure Synapse; Entwicklung von Batch- und Streaming-Pipelines; Kafka-basierte Datenverarbeitung; Integration heterogener Datenquellen; Medallion-Architektur, Data Vault und Star Schema.

E – Senior Data Architect::: Strategische Konzeption und Bewertung von Daten- und KI-Architekturen; strategische Modernisierung komplexer Datenplattformen; Erfahrung im Schienenverkehr; Entwicklung von Daten- und KI-Strategien; Bewertung von KI-Anwendungsfällen; Leitung komplexer Transformationsvorhaben und interdisziplinärer Teams.

Gemeinsame Rahmenbedingungen

  • Rollen: Intermediate Data Engineer beziehungsweise Senior Data Architect
  • Projektzeitraum: 23.09.2026 bis 31.12.2027
  • Umfang: 291 Personentage
  • Einsatzort: Remote
  • Projektsprache: Deutsch, zwingend erforderlich
  • Branche: Transport & Logistics, Großes deutsches Schienenunternehmen
  • Projektumfeld: Digitale Transformation und Aufbau einer modernen, datengetriebenen IT- und Systemlandschaft
  • Themenschwerpunkte:
    • Entwicklung und Betrieb von Datenplattformen
    • Entwicklung von Datenpipelines und Datenprodukten
    • Integration heterogener Datenquellen
    • Verarbeitung großer Datenmengen
    • Data Lakes, Data Warehouses und DataHub-Strukturen
    • Datenmodelle und Datenflüsse
    • Datenqualität, Governance, Security und Compliance
    • Cloud-Migration und Modernisierung bestehender Systeme
    • Machine Learning und KI-Anwendungsfälle
  • Architekturleistungen:
    • Konzeption und Weiterentwicklung von Datenarchitekturen
    • Definition von Architekturprinzipien und Standards
    • Bewertung von Skalierbarkeit, Performance, Sicherheit und Wartbarkeit
    • Erstellung technischer Spezifikationen und Architekturkonzepte
    • Durchführung von Architektur-Reviews
    • Pflege der Architektur-Dokumentation

Projektbeschreibung:

Die angefragte Leistung unterstützt zentrale Initiativen im Rahmen der digitalen Transformation. Ziel der Vorhaben ist der Aufbau und die Weiterentwicklung einer modernen, datengetriebenen IT- und Systemlandschaft, welche die Grundlage für die Automatisierung und Optimierung von Geschäftsprozessen sowie für die Nutzung von datenbasierten und KI-gestützten Anwendungsfällen bildet. Im Fokus stehen insbesondere die Konzeption, Entwicklung und der Betrieb von Datenprodukten, Datenpipelines sowie IT-Services innerhalb einer verteilten, cloudbasierten Architektur. Hierbei werden Technologien und Plattformen wie DataHubStrukturen, Data Lakes sowie CloudServices (insbesondere AWS und Azure) eingesetzt. Die Integration heterogener Datenquellen sowie die Verarbeitung großer Datenmengen sind zentrale Bestandteile der Vorhaben. Die Projekte umfassen sowohl klassische Entwicklungsleistungen als auch innovative Themenstellungen im Umfeld von Machine Learning, datengetriebenen Optimierungsverfahren sowie der Automatisierung von Geschäftsprozessen. Ein besonderer Fokus liegt auf der schnellen Umsetzung von Prototypen (PoCs) und Minimum Viable Products (MVPs), um neue Use Cases frühzeitig zu validieren und in die produktive Umgebung zu überführen.

 

Aufgabe: 

Die Leistungen umfassen die Konzeption und Weiterentwicklung unternehmensweiter Datenarchitekturen in cloudbasierten Umgebungen, insbesondere auf Basis von AWS und Microsoft Azure. Dazu gehören die Definition von Architekturprinzipien, Standards und Best Practices für die Entwicklung und den Betrieb von Datenplattformen und Datenprodukten sowie das Design und die Spezifikation von Data Lakes, Data Warehouses, DataHub-Strukturen und verteilten Datenplattformen.Ein weiterer Schwerpunkt liegt auf der Konzeption von Integrationsarchitekturen zur Anbindung heterogener Quellsysteme und zur Verarbeitung großer und komplexer Datenmengen. Darüber hinaus werden Architekturentscheidungen hinsichtlich Skalierbarkeit, Performance, Sicherheit und Wartbarkeit definiert und bewertet. Zu den Aufgaben gehören außerdem die Erstellung von Architekturkonzepten und technischen Spezifikationen sowie die Konzeption von Datenmodellen und Datenflüssen.Darüber hinaus werden Standards für Datenqualität, Data Governance, Security und Compliance definiert und weiterentwickelt. Die Leistungen umfassen auch die Durchführung von Architektur-Reviews sowie die Bewertung bestehender Systeme im Hinblick auf Modernisierung und Cloud-Transformation. Ergänzend werden Lösungsansätze für die Integration von Machine-Learning- und KI-Anwendungsfällen in bestehende Datenplattformen konzipiert. Schließlich gehören die Erstellung und Pflege von Architektur-Dokumentationen sowie die Sicherstellung der Nachvollziehbarkeit von Designentscheidungen zum Aufgabenbereich.


Rolle A: Intermediate Data Engineer

MUSS-Anforderung: (zwingend zu erfüllen)
Erfahrung in der Entwicklung von Datenpipelines und Datenprodukten, sowie in der Implementierung skalierbarer ETL-/ELT-Pipelines mit Python, SQL, PySpark und Apache Spark in Cloud-Umgebungen. (Mindestens 4 Jahre praktische Erfahrung) Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Entwicklung von Datenplattformen in Microsoft-Azure- und AWS-Cloud-Umgebungen mit Azure Data Factory, AWS Glue und Amazon S3. (Mindestens 4 Jahre praktische Erfahrung) Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Migration und Modernisierung von Legacy-Datenplattformen und On-Premise-Systemen in Cloud-Umgebungen, inklusive Refactoring und Anpassung bestehender Datenstrecken an cloud-native Technologien. (Mindestens 4 Jahre praktische Erfahru Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Analyse, Integration, Modellierung und Aufbereitung von Stamm- und Transaktionsdaten des Schienengüterverkehrs aus heterogenen Quellsystemen. Anzahl Referenzen 3
 

SOLL-Anforderung:
Erfahrung in der Konzeption und Implementierung von CI/CD-Pipelines, Entwicklungsstandards, automatisierten Tests sowie Monitoring- und Logging-Lösungen für den Betrieb von Datenprodukten. Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Konzeption von Datenarchitekturen und Datenprodukt-Blueprints sowie in der Umsetzung von Data Governance, Data Contracts und Berechtigungsmanagement auf cloudbasierten Datenplattformen. Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Projekterfahrung in agilen Teams in SAFe Organisationen und der Nutzung von Jira und Confluence sowie Erfahrung in der Planung und Durchführung von Stakeholder-Workshops. Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)

 

Rolle B: Intermediate Data Engineer

MUSS-Anforderung: (zwingend zu erfüllen)

Erfahrung in der Entwicklung von Datenpipelines und Datenprodukten sowie in der Implementierung skalierbarer ETL-/ELT-Pipelines mit Python, SQL, PySpark und Apache Spark in AWS-Cloud-Umgebungen Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Migration von On-Premise Systemen sowie in der Entwicklung, Modernisierung und dem Betrieb cloudbasierter Datenplattformen mit Services wie AWS Glue, Amazon S3 und AWS Step Functions Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Konzeption und Implementierung von CI/CD-Pipelines, Infrastructure as Code (Terraform oder Cloudformation) und automatisierten Tests für die Bereitstellung von Datenpipelines und AWS-Plattformkomponenten Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Integration, dem Mapping und der Aufbereitung von Daten in AWS aus unterschiedlichen Quellsystemen sowie in der Entwicklung von Datenmodellen und Datenpipelines für Analyse- und Reportingzwecke von Daten des Schienengüterverkehrs. (M Anzahl Referenzen 1
Erfahrung in der Umsetzung von Datenqualitäts-, Test- und Monitoring-Lösungen für Datenpipelines (automatisierter Datenvalidierungen, Data-Quality-Prüfungen, Logging). Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
 

SOLL-Anforderung:

Nachweis aktueller Zertifizierungen im Bereich AWS Data Engineering Zertifikate AWS Certified Data Engineer
Modernisierung von Datenpipelines für die Analyse von Planungsdaten im Schienengüterverkehr (Mindestens 1 Projektreferenz nachweisbar) Anzahl Referenzen 1
Erfahrung in der Implementierung und Performance-Optimierung von Spark-basierten ETL-/ELT-Pipelines im beispielsweise Analyse von Spark Execution Plans, Optimierung von PySpark-Code und Reduzierung von Laufzeiten Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)

 

 

Rolle C: Intermediate Data Engineer


MUSS-Anforderung: (zwingend zu erfüllen)

Erfahrung in der Entwicklung von Datenpipelines und Datenprodukten sowie in der Implementierung skalierbarer ETL-/ELT-Pipelines mit Python, SQL, PySpark und Apache Spark in Cloud-Umgebungen, in AWS und Azure Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Entwicklung, Migration, Modernisierung und dem Betrieb von Datenplattformen in AWS-Cloud-Umgebungen mit Services AWS Glue, Amazon S3 sowie idealerweise Erfahrungen mit AWS EMR, AWS Step Functions und Amazon EventBridge Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Entwicklung von Datenverarbeitungs- und Machine-Learning-Anwendungen in Microsoft-Azure-Cloud-Umgebungen mit Azure Data Factory, PySpark, Python und Scala (Mindestens 1 Projektreferenz nachweisbar) Anzahl Referenzen 1
Erfahrung in der Migration und Modernisierung von Legacy-Datenanwendungen und On-Premise-Datenplattformen in Cloud-Umgebungen, inklusive Entwicklung von ETL-Migrationspipelines sowie Mapping und Validierung von Legacy- und Zieldatenmodellen Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Umsetzung von Datenqualitäts-, Test- und Monitoring-Lösungen für Datenpipelines, idealerweise auf Basis von Data Contracts Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
 

SOLL-Anforderung:

Erfahrung in der Konzeption und Implementierung von DevOps Best Practices wie CI/CD-Prozessen, Infrastructure as Code und automatisierten Tests für die Bereitstellung cloudbasierter Datenpipelines und Plattformkomponenten in AWS- und Microsoft-AzureErfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Nachweis aktueller Zertifizierungen im Bereich Data Engineering. Zertifikate AWS Certified Data Engineer
Erfahrung in der Entwicklung, dem Training und der Validierung von Machine-Learning- und Predictive-Analytics-Modellen in Azure-Cloud-Umgebungen sowie in der Orchestrierung der zugehörigen Datenpipelines mit Azure Data Factory Anzahl Referenzen 1
Erfahrung in der Konzeption und Implementierung von moderenen Data Governance Lösungen wie Data Contracts, Data Lineage, Medallion-Architekturen für Datenplattformen Anzahl Referenzen 3

 

 


Rolle D: Intermediate Data Engineer

MUSS-Anforderung: (zwingend zu erfüllen)

Erfahrung in der Entwicklung von Datenpipelines und Datenprodukten sowie in der Implementierung von ETL-/ELT-Prozessen mit Python, SQL und PySpark in Cloud-Umgebungen. (Mindestens 4 Jahre praktische Erfahrung ) Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Entwicklung und Modernisierung von Datenplattformen in Microsoft-Azure-Cloud-Umgebungen und Azure Services wie Azure Data Factory oder Azure Synapse. (Mindestens 4 Jahre praktische Erfahrung ) Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Entwicklung von Batch- und Streaming-Datenpipelines sowie in der Kafka-basierten Datenverarbeitung zur Bereitstellung großer Datenmengen für Reporting-, Analyse-, KI- und ML-Anwendungsfälle. (Mindestens 4 Jahre praktische Erfahrung ) Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Integration heterogener Datenquellen, beispielsweise REST oder Kafka, sowie unterschiedlicher Datenformate in cloudbasierte Datenplattformen. Anzahl Referenzen 2
Modellierung von Daten heterogener Quellsysteme nach Medallion-Architektur mit Data Vault oder Star Schema.(Mindestens 4 Jahre praktische Erfahrung ) Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
 

SOLL-Anforderung:

Erfahrung in der Migration und Modernisierung bestehender Datenpipelines und Datenplattformen im Microsoft-Azure-Umfeld, inklusive Migration bestehender Azure-Synapse-Datenflüsse auf moderne cloudbasierte Datenplattformen. (Mind. 1 Projektreferenz) Anzahl Referenzen 1
Erfahrung in der Konzeption und Umsetzung von Data-Hub- und Lakehouse- Architekturen. (Mindestens 4 Jahre praktische Erfahrung ) Erfahrungslevel in Jahren Intermediate (> 3 Jahre Erfahrung)
Erfahrung in der Implementierung und Optimierung von ETL-/ELT-Prozessen für die Verarbeitung großer Datenmengen im Cloud-Umfeld, inklusive Performance-Optimierung, Standardisierung von Entwicklungsprozessen und Review von Programmcode. Anzahl Referenzen 2
Erfahrung in der Konzeption und Umsetzung von Data-Quality-Prüfungen, automatisierten Tests und technischen Qualitätssicherungsmaßnahmen für ETL-/ELT-Prozesse und Datenpipelines. Anzahl Referenzen 2

 


Rolle E: Senior Data Architect


MUSS-Anforderung: (zwingend zu erfüllen)

Erfahrung in der Konzeption und strategischen Bewertung von Daten- und KI-Architekturen, Datenplattformen, einschließlich der strategischen Modernisierung von Datenplattformen in Cloud-Umgebungen. Erfahrungslevel in Jahren Senior (> 5 Jahre Erfahrung)
Erfahrung im strategischen Management und in der Weiterentwicklung komplexer IT- & Datenplattformen im Kontext Schienenverkehr. Anzahl Referenzen 5
Erfahrung in der Entwicklung von Daten- und KI-Strategien sowie in der Identifikation und Bewertung von KI-Anwendungsfällen im Schienenverkehr. Anzahl Referenzen 1
Erfahrung in der Leitung komplexer Daten-, KIoder IT-Transformationsvorhaben sowie in der Steuerung interdisziplinärer Projektteams. Erfahrungslevel in Jahren Senior (> 5 Jahre Erfahrung)
 

SOLL-Anforderung:

Erfahrung in der Leitung komplexer Projekte und in der Steuerung interdisziplinärer sowie international verteilter Projektteams, einschließlich Projekterfahrung in agilen Teams. Erfahrungslevel in Jahren Senior (> 5 Jahre Erfahrung)
Erfahrung in der Bewertung und strategischen Weiterentwicklung von Datenplattformen unter Berücksichtigung von Microsoft-Azure- und AWS-Cloud- oder SAP-Umgebungen. Anzahl Referenzen 4
Nachweis aktueller Zertifizierungen im Bereich Projektmanagement Zertifikate PRINCE2 Project Management Foundation.
Erfahrung in der Konzeption und Weiterentwicklung von Data Governance, Data Quality und Data Catalog im Rahmen komplexer Datenplattformen. Anzahl Referenzen 5
Erfahrung in der Konzeption übergreifender Datenflüsse, Datenintegration und Zugriffsmodelle für komplexe Datenplattformen. Anzahl Referenzen 4

 

Die sms Consulting GmbH ist seit 1993 für Ihre Kunden ein kompetenter Partner für die Rekrutierung externer IT-Spezialisten und Festangestellten.

Ihre Bewerbung:
Bitte bewerben Sie sich nur, wenn Sie die Profil-Anforderungen umfänglich erfüllen und wenn Sie ggf. vorhandene Muss-/Mindestanforderungen voll erfüllen.
Bitte geben Sie bei Ihrer Bewerbung Ihren Stundensatz an und ab wann Sie Verfügbar sind.
Wenn Sie sich per Email bewerben gebe Sie bitte immer die Projekt-ID und den Titel der Ausschreibung mit an.

Bitte senden Sie uns als Partner/Unternehmen Ihren verfügbaren Mitarbeiter für das Projekt per E-Mail an: jobs@sms-consulting.de