Stellenangebot
Senior Principal Infrastructure Services (SRE Practice)
Northern Trust sucht einen erfahrenen Senior Principal Java Reliability Engineer für die SRE-Praxis in Austin, TX, der Automatisierungslösungen für komplexe Cloud- und Hybrid-Infrastrukturen entwickelt. Die Rolle umfasst die Leitung der Systemarchitektur, Incident Management sowie das Mentoring von Teams zur Förderung einer Kultur der Resilienz und kontinuierlichen Verbesserung.
Aufgaben
- Entwickeln Sie ein tiefes Verständnis der Geschäftsabläufe und -dienste von Northern Trust und kommunizieren Sie die Auswirkungen von Technologieausfällen effektiv an die Geschäftsleitung, nicht-technische Interessengruppen und verteilte Teams.
- Liefern Sie eine robuste, skalierbare und hochverfügbare SRE-Automatisierungsgrundlage, die mehrere Service-Plattformen wie Amazon Web Services (AWS), Microsoft Azure, Google Cloud Platform (GCP), hybride On-Premises- und Co-Location-Systeme, Microsoft Windows sowie Linux/Unix-basierte Plattformen betrifft.
- Führen Sie Root-Cause-Analysen durch, übersetzen Sie komplexe technische Probleme in verständliche Geschäftsauswirkungen, entwickeln Sie umfassende Behebungsstrategien, etablieren Sie Präventionsmechanismen und bieten Sie kontinuierliche Überwachungsdienste an.
- Leiten Sie das Design und die Weiterentwicklung hochresilienter, skalierbarer und leistungsstarker verteilter Systeme, die sich über zahlreiche Dienste und Anwendungsbereiche erstrecken.
- Arbeiten Sie mit Product Ownern und Anwendungsteams zusammen, um Systemdesigns zu beeinflussen, die Observabilität, Automatisierung und operative Agilität verbessern, die Teamkultur positiv beeinflussen, resiliente Systeme aufbauen und externe Lastverschiebungen effektiv verwalten.
- Definieren und fördern Sie Zuverlässigkeitsmuster, architektonische technische Praktiken und Tool-Konfigurationen, die mit Geschäftsergebnissen übereinstimmen.
- Treiben Sie einen Automatisierungsansatz voran, indem Sie Tests, Tools und Pipelines entwerfen und entwickeln, die manuelle Arbeit reduzieren, Workflows optimieren und das Kundenerlebnis sowie die Mitarbeitererfahrung verbessern.
- Entwerfen Sie einen sich entwickelnden Ingenieurprozess, der Infrastruktur-, Konfigurations- und Softwarebereitstellungen umfasst, die automatisierte Betriebskontrollen und Sicherheitsvorkehrungen einschließen, einschließlich eingebetteter, nicht störender Betriebsabläufe.
- Nehmen Sie an Root-Cause-Analysen für Produktionsvorfälle teil oder führen Sie diese durch, um eine rechtzeitige Minderung und Behebung während der Wiederherstellungsphase sicherzustellen.
- Identifizieren und implementieren Sie Kapazitätsmetriken, Risiken und Bedrohungen für Einmal- oder anhaltende Zuverlässigkeitssysteme, um regelmäßige Bewertungen und Priorisierung von Diensten zu ermöglichen.
- Architektonisch gestalten und verwalten Sie Service Level Objectives (SLO), Service Level Indicators (SLI) und Alerting and Escalation Response Teams (ARTER), die klare Berichte über Servicegesundheit, Leistung und Risiken liefern.
- Etablieren Sie Metriken und Ziele für SLIs, SLOs und Error Budgets, die kundenorientierte Service-Level-Erwartungen widerspiegeln.
- Leiten Sie Bemühungen ein, die Fall-für-Fall-Überlegungen, letzte Änderungen, Regressionstests und andere Faktoren nutzen, um Systemausfallmodi zu visualisieren.
- Kommunizieren Sie branchenübliche operative Best Practices, messen Sie diese (SRE) und verwandeln Sie Ihre Vision in ein besseres SRE-Team und stellen Sie die Servicezuverlässigkeit sicher.
- Erstellen und pflegen Sie Team-, Codebase- und Wissensdokumentation unter Nutzung branchenüblicher Architekturen, Standards und Muster sowie Incident Postmortems.
- Kommunizieren Sie proaktiv Service-Kapazitätsmetriken, Verfügbarkeit, Leistung und Fehlertoleranz zwischen Peer-Teams.
- Arbeiten Sie eng mit Produkt-, Entwicklungs-, Plattform-, Sicherheits- und Betriebsteams zusammen, um SRE-Denken in Team-Frameworks zu integrieren.
- Handeln Sie als vertrauenswürdiger Berater, mentoren Zuverlässigkeitsteams und Betriebspersonal, um Geschäftseinblicke zum Nutzen von Northern Trust und seinen externen Interessengruppen zu beeinflussen.
- Treiben Sie die Adoption strategischer SRE-Programme voran, die die cross-funktionale Zusammenarbeit, die Incident-Response und die operative Effizienz messbar verbessern.
- Verwalten und priorisieren Sie mehrere Arbeitslastinitiativen (einschließlich technischer, geschäftlicher Systembetriebsbedürfnisse mit Schwerpunkt auf cross-funktionaler Zusammenarbeit).
Jobdetails