- Location
- TUM - D.F. Del. Miguel Hidalgo, Mexico
- Workplace
- Onsite
- Type
- Full-time
- Department
- Engineering
- Source
- Workday
Description
TransUnion's Job Applicant Privacy Notice
Team Overview
The Reliability Engineering team ensures the stability, availability, and performance of Buró de Crédito’s mission-critical platforms and El equipo de Reliability Engineering es responsable de garantizar la estabilidad, disponibilidad y desempeño de las plataformas y servicios críticos para el negocio de Buró de Crédito. Mediante prácticas de observabilidad, automatización y gestión de incidentes, impulsa la excelencia operativa y la mejora continua en entornos de misión crítica. El equipo colabora estrechamente con las áreas de Infraestructura, Desarrollo, Bases de Datos y Seguridad para mantener sistemas resilientes y escalables. Este rol reporta al líder del equipo de Reliability Engineering. This job is assigned as On-Site Essential and requires in- person work at an assigned TU office location as a condition of employment.Role Overview And Core Responsibilities
El Site Reliability & Observability Engineer (SRE) es responsable de garantizar la confiabilidad, estabilidad y disponibilidad de servicios críticos mediante la adopción de mejores prácticas de Site Reliability Engineering. Este rol impulsa la excelencia operativa a través de observabilidad, automatización y mejora continua, reduciendo riesgos operativos y fortaleciendo la resiliencia de la plataforma.
- Garantizar la confiabilidad, estabilidad y disponibilidad de servicios de misión crítica mediante prácticas de Site Reliability Engineering (SRE).
- Operar y evolucionar continuamente la plataforma de observabilidad, incluyendo métricas, registros, trazas distribuidas y capacidades de alertamiento.
- Monitorear proactivamente sistemas críticos y responder a incidentes operativos para minimizar interrupciones y el impacto al negocio.
- Liderar actividades de respuesta ante incidentes mayores, coordinando esfuerzos de recuperación y comunicación con las partes interesadas.
- Ejecutar análisis de causa raíz (RCA) y facilitar revisiones posteriores a incidentes para prevenir recurrencias y fortalecer la resiliencia operativa.
- Definir, medir y optimizar Service Level Indicators (SLIs), Service Level Objectives (SLOs) y presupuestos de error (Error Budgets).
- Automatizar procesos operativos y reducir actividades manuales mediante scripting, automatización de infraestructura y prácticas de ingeniería de plataformas.
- Brindar soporte y resolución de problemas en entornos distribuidos que incluyen Apache Cassandra, Apache Kafka, Kubernetes, bases de datos relacionales y plataformas NoSQL.
- Colaborar con equipos de desarrollo e infraestructura para mejorar la confiabilidad de despliegues, preparación operativa y desempeño general de la plataforma.
Required Knowledge And Experiences
- Licenciatura en Ciencias de la Computación, Ingeniería en Sistemas, Telecomunicaciones o disciplina técnica relacionada, o experiencia equivalente demostrable.
- Experiencia comprobada en Site Reliability Engineering (SRE), Operaciones de Producción, Platform Engineering, Infrastructure Engineering o funciones enfocadas en confiabilidad.
- Conocimiento sólido de sistemas distribuidos, observabilidad, gestión de incidentes y metodologías avanzadas de resolución de problemas en entornos críticos.
- Experiencia liderando incidentes mayores, procesos de análisis de causa raíz, restauración de servicios e iniciativas de excelencia operativa.
- Conocimiento de marcos de confiabilidad, incluyendo SLOs, SLIs, Error Budgets, mejora continua y mejores prácticas de gestión de servicios.
Habilidades técnicas requeridas
- Administración y soporte de plataformas Kubernetes en entornos empresariales.
- Experiencia con Apache Cassandra y Apache Kafka en arquitecturas distribuidas.
- Conocimiento de herramientas de observabilidad para monitoreo, registros, trazabilidad y alertamiento.
- Capacidad para automatizar tareas operativas mediante scripting e infraestructura como código (IaC).
- Experiencia con bases de datos relacionales y tecnologías NoSQL en ambientes de alta disponibilidad.
Habilidades Deseadas: También se buscan las siguientes habilidades. Ya sea que se dominen o estén en desarrollo, se apoya el crecimiento profesional en:
- Experiencia en ingeniería de plataformas y modernización de operaciones tecnológicas.
- Conocimiento de prácticas DevOps y procesos CI/CD.
- Experiencia en optimización de rendimiento y escalabilidad de plataformas empresariales.
- Habilidades para impulsar iniciativas de mejora continua y eficiencia operativa.
- Capacidad de colaboración efectiva con equipos multidisciplinarios en entornos complejos y dinámicos.
#LI-GL1,#LI-Hybrid
TransUnion Overview:
At TransUnion, we encourage and are committed to creating a real, positive impact and shared sense of purpose within our Workforce for Good, which empowers our people to grow, innovate and contribute to a better future for our communities and customers. We strive to build an environment where our associates are in the driver’s seat of their professional development— while having access to help along the way. We recognize that success comes when our associates thrive both professionally and personally; that’s why we prioritize work/life flexibility and offer resources for our teams across the globe to collaborate and drive excellence.
Be a part of our Workforce for Good – you’ll work with great people, pioneering products and cutting-edge technology.
TransUnion Job Title
Sr Engineer, Infrastructure Engineering and Provisioning