Senior Site Reliability Engineer Kubernetes Platform (m/w/d)
Deine Mission
Deine Aufgaben
Sicherstellung des stabilen Betriebs unserer Kubernetes SaaS-Plattform mit hunderten aktiven Clustern inklusive Vorfallminderung
Übersetzung komplexer Systemarchitekturen in Code (30-40%) mit einem Software-Entwicklungsanteil in Go, Terraform, Ansible und Bash
Entwicklung und Automatisierung von Infrastrukturkomponenten von der Server-Provisionierung bis hin zu K8s-Operatoren
Optimierung und operative Betreuung der Observability-Plattform für die Managed-Service-Infrastruktur (Prometheus, Loki, Mimir)
Durchführung von Release-Management, kontinuierliche Verbesserung der CI/CD-Pipelines (GitLab) sowie Troubleshooting im 2nd und 3rd Level Support
Teilnahme an der Rufbereitschaft (nach erfolgreicher Probezeit)
Das bringst Du mit
Fundierte Praxiserfahrung im Betrieb, der Fehlerbehebung und der Skalierung hochverfügbarer Kubernetes-Cluster in Produktionsumgebungen
Tiefgehende Kenntnisse in der Linux-Systemadministration sowie ein solides Verständnis von Netzwerk-Layer 3/4 (Routing, NAT) und Layer 7-Protokollen
Praktische Entwicklungserfahrung in System-Sprachen (Go) sowie sichere Anwendung gängiger Automatisierungswerkzeuge (Terraform, Ansible, Helm)
Erfahrung im Aufbau und Betrieb von Observability-Stacks (Prometheus, Loki, Mimir) sowie im Umgang mit gängigen CI/CD-Praktiken
Verständnis der internen Kubernetes-Mechanismen (etcd, apiserver, kubelet)
Fließende Deutsch- und gute Englischkenntnisse (B2)
Was Dich bei uns erwartet
Über uns
Wir leben Diversität – auch im Denken und Handeln, denn nur unterschiedliche Blickwinkel finden am Ende die beste Lösung, die uns und unsere Kunden weiterbringt. Kurz gesagt: Wir achten aufeinander und hängen uns voll rein. Wenn du in diesem vertrauensvollen Umfeld wachsen und die Zukunft flexibler Infrastrukturen mitprägen willst, bist du bei uns genau richtig.
