Offerta di lavoro
Responsabile senior dei servizi di infrastruttura (SRE Practice)
Northern Trust è alla ricerca di un Senior Principal Java Reliability Engineer con esperienza per il team SRE di Austin, in Texas, incaricato di sviluppare soluzioni di automazione per infrastrutture cloud e ibride complesse. Il ruolo prevede la gestione dell’architettura di sistema, la gestione degli incidenti e il mentoring dei team al fine di promuovere una cultura della resilienza e del miglioramento continuo.
Compiti
- Acquisite una comprensione approfondita dei processi e dei servizi aziendali di Northern Trust e comunicate in modo efficace le ripercussioni dei guasti tecnologici alla direzione, alle parti interessate non tecniche e ai team distribuiti.
- Fornite una piattaforma di automazione SRE robusta, scalabile e ad alta disponibilità che copra diverse piattaforme di servizio quali Amazon Web Services (AWS), Microsoft Azure, Google Cloud Platform (GCP), sistemi ibridi on-premises e in co-locazione, Microsoft Windows e piattaforme basate su Linux/Unix.
- Eseguite analisi delle cause alla radice, traducete problemi tecnici complessi in impatti aziendali comprensibili, sviluppate strategie di risoluzione complete, mettete in atto meccanismi di prevenzione e fornite servizi di monitoraggio continuo.
- Guida la progettazione e l'ulteriore sviluppo di sistemi distribuiti altamente resilienti, scalabili e ad alte prestazioni, che abbracciano numerosi servizi e ambiti applicativi.
- Collaborate con i Product Owner e i team applicativi per influenzare la progettazione dei sistemi in modo da migliorare l’osservabilità, l’automazione e l’agilità operativa, influenzare positivamente la cultura del team, costruire sistemi resilienti e gestire efficacemente gli spostamenti di carico esterni.
- Definite e promuovete modelli di affidabilità, pratiche tecniche architetturali e configurazioni degli strumenti che siano in linea con i risultati aziendali.
- Promuovete un approccio all'automazione progettando e sviluppando test, strumenti e pipeline che riducano il lavoro manuale, ottimizzino i flussi di lavoro e migliorino l'esperienza dei clienti e dei dipendenti.
- Progettate un processo ingegneristico in continua evoluzione che comprenda l'implementazione di infrastrutture, configurazioni e software, includendo controlli operativi automatizzati e misure di sicurezza, tra cui procedure operative integrate e non invasive.
- Partecipate alle analisi delle cause alla radice degli incidenti di produzione o conducetele voi stessi, al fine di garantire una mitigazione e una risoluzione tempestive durante la fase di ripristino.
- Identificate e implementate metriche di capacità, rischi e minacce per i sistemi di affidabilità una tantum o continuativi, al fine di consentire valutazioni periodiche e la definizione delle priorità dei servizi.
- Progettate e gestite in modo strutturato gli obiettivi di livello di servizio (SLO), gli indicatori di livello di servizio (SLI) e i team di risposta agli allarmi e all’escalation (ARTER), che forniscono report chiari sullo stato di salute del servizio, sulle prestazioni e sui rischi.
- Definire metriche e obiettivi per SLI, SLO ed “error budget” che riflettano le aspettative relative ai livelli di servizio orientate al cliente.
- Avviate iniziative che sfruttino le valutazioni caso per caso, le ultime modifiche, i test di regressione e altri fattori per visualizzare le modalità di guasto del sistema.
- Diffondete le best practice operative standard del settore, misuratele (SRE) e trasformate la vostra visione in un team SRE più efficiente, garantendo l'affidabilità del servizio.
- Creare e aggiornare la documentazione relativa ai team, al codice e alle conoscenze, avvalendosi di architetture, standard e modelli di settore, nonché di analisi post-incidente.
- Comunicate in modo proattivo le metriche relative alla capacità del servizio, alla disponibilità, alle prestazioni e alla tolleranza agli errori tra i team omologhi.
- Collaborate a stretto contatto con i team di prodotto, sviluppo, piattaforma, sicurezza e operazioni per integrare la mentalità SRE nelle strutture dei team.
- Agite in qualità di consulenti di fiducia, fornendo indicazioni ai team di controllo di affidabilità e al personale operativo, al fine di influenzare le decisioni aziendali a vantaggio di Northern Trust e dei suoi stakeholder esterni.
- Promuovete l’adozione di programmi SRE strategici che migliorino in modo misurabile la collaborazione interfunzionale, la risposta agli incidenti e l’efficienza operativa.
- Gestire e dare priorità a diverse iniziative relative al carico di lavoro (comprese le esigenze tecniche e operative dei sistemi aziendali, con particolare attenzione alla collaborazione interfunzionale).
Dettagli sul lavoro