Stellenangebot
Principal, SRE
Navantia sucht einen Principal SRE mit über 5 Jahren Erfahrung in DevOps und Infrastrukturmanagement (Kubernetes, Terraform, AWS), der für die Überwachung, Automatisierung und Sicherheit der digitalen Plattformen verantwortlich ist. Die Position ist in Schweden (Stockholm/Gothenburg) angesiedelt und bietet ein hybrides Arbeitsmodell.
Aufgaben
- Verantwortlich für den Status und die Wartung von Diensten
- Automatisierung der (Site-)Wiederherstellung und Ereignisüberwachung, einschließlich Upgrade-Aufgaben und Service-Management
- Verbesserung der Bereitschaft, Resilienz und Redundanz der Katastrophenerholung
- Sicherstellung, dass die SLAs und die aktuelle oder zukünftige Plattform im Bereich (wie Verfügbarkeit, Service-Level, Kapazitätsplanung usw.) erfüllt werden
- Teilnahme an der Gestaltung und Dokumentation von Lösungen
- Verantwortlich für den Lieferstatus in den Bereichen von Interesse für das Anwendungsteam (SRE)
- Beitrag zur Gestaltung und Implementierung von Software für die Sicherheit von Marineplattformen, einschließlich Netzwerksicherheit
- Betrieb und Überwachung von Systemen, Skripten und Anwendungsinfrastruktur, einschließlich Continuous Integration/Continuous Delivery (CI/CD)-Pipelines und sicherheitsbezogener Konfigurationen
- Leitung der Zusammenarbeit zwischen Teams bei Best Practices, Identifizierung von Lösungen und Bereitstellung technischer Führung
- Arbeit an Infrastrukturprojekten (z. B. Kubernetes, Terraform, AWS und Sicherheit)
- Überwachung der Anwendungsgesundheit und Log-Analyse (Elastic, Datadog)
- Sicherstellung, dass SLA- und Uptime-Metriken erfüllt und priorisiert werden
- Mentoring von Junior-SREs
- Aufbau und Wartung der Infrastruktur (z. B. Kubernetes, Terraform, AWS)
- Entwicklung und Verbesserung der CI/CD-Pipelines
- Überwachung und Fehlerbehebung des Systems
- Sicherheit und Compliance
Anforderungen
- Bachelor-Abschluss in einem technischen Fachgebiet (z. B. Informatik, Software Engineering oder InfoSec); Master-Abschluss oder Äquivalent ist von Vorteil
- Mind. 5 Jahre Erfahrung in DevOps, SRE, Site Reliability Engineering oder einem eng verwandten Bereich
- Starke praktische Expertise in der Cloud (AWS, Azure, GCP), Kompetenz in Linux/Unix in der Infrastruktur, Anwendungsbereitstellung und Sicherheitsverwaltung (z. B. Zero-Trust, IAM, Netzwerksegmentierung) wird gewünscht
- Ausgezeichnetes Verständnis von kryptografischen Protokollen, Supply-Chain-Sicherheit und Anwendungssicherheit
- Kenntnis in mindestens einer Programmiersprache (wie Python, Jenkins oder Python)
- Kenntnisse in DevOps-Tools und CI/CD-Pipelines, Service-Management (IaC usw.), Skripting (Python, Bash) und Sicherheitsautomatisierung
- Fokussiert, detailorientiert und in der Lage, komplexe Risiko- und Compliance-Anforderungen in leicht verständliche Ergebnisse, technische Roadmaps und ausführbare Pläne mit klaren Betriebsverfahren zu übersetzen
- Wünschenswert: Erfahrung mit der Implementierung von Zero-Trust-Architekturen (z. B. Sails, Istio, OPA) und mit PKI-Konzepten, Hardware Security Modules (HSMs) und sicheren Container-Runtimes
- Mind. 5 Jahre in Betriebs- und Plattformpositionen
- DevOps, SRE-Kenntnisse mit Konfigurationskenntnissen
- Fähigkeit zur Zusammenarbeit mit funktionsübergreifenden Teams
- Problemlösungsfähigkeit
- Fließende Englischkenntnisse
- Expertenkenntnisse im Infrastrukturmanagement (z. B. Kubernetes-Erfahrung, Terraform)
- Erfahrung mit Cloud-Anbietern (z. B. AWS, GCP, Azure) (AWS bevorzugt, aber kein Ausschlusskriterium, wenn andere bekannt sind)
- Erfahrung mit Observability-Tools (z. B. Datadog oder ähnlich)
Jobdetails