Descripción
Resumen:
Ingeniero Líder de Confiabilidad de Sitios para impulsar operaciones fiables en la infraestructura, gestionando el monitoreo, la observabilidad y el registro de eventos con Dynatrace y Splunk, y colaborando en la respuesta a incidentes.
Aspectos destacados:
1. Impulsar operaciones fiables en un amplio panorama de infraestructura
2. Gestionar el monitoreo, la observabilidad y el registro de eventos con Dynatrace y Splunk
3. Colaborar en la respuesta a incidentes y realizar análisis de causa raíz
Buscamos un **Ingeniero Líder de Confiabilidad de Sitios** que se integre al equipo e impulse operaciones fiables en un amplio panorama de infraestructura. Usted gestionará el monitoreo, la observabilidad y el registro de eventos con Dynatrace y Splunk, y contribuirá a la evolución de paneles de control, alertas y prácticas de análisis. Asimismo, participará en la rotación de guardias y colaborará en la respuesta a incidentes. ¡Postúlese ahora!
**Responsabilidades**
* Monitorear y mantener la salud, el rendimiento y la confiabilidad de las aplicaciones y servicios del cliente
* Operar y mejorar continuamente Dynatrace y Splunk, incluidos los paneles de control, las alertas, la detección de anomalías y el análisis de registros
* Analizar alertas, determinar las causas probables y ofrecer recomendaciones accionables a los equipos de ingeniería y gestión de incidentes
* Apoyar las actividades de respuesta a incidentes y participar en la rotación de guardias
* Realizar análisis de causa raíz (RCA) e impulsar mejoras medibles tras los incidentes
* Definir y supervisar SLO, SLA y presupuestos de errores
* Detectar y subsanar brechas en observabilidad y monitoreo en los servicios
* Mantener manuales operativos y documentación de apoyo
**Requisitos**
* Experiencia comprobada de 5\+ años en Ingeniería de Confiabilidad de Sitios, Operaciones de Producción, DevOps o un rol estrechamente relacionado
* Conocimientos profundos de Dynatrace y Splunk, incluidos APM, alertas, paneles de control, monitoreo de experiencia del usuario real (RUM), monitoreo sintético, análisis de flujo de servicios, consultas SPL y análisis de registros
* Experiencia práctica en gestión de incidentes en producción y soporte en guardia, abarcando clasificación de alertas, respuesta a incidentes, RCA y revisiones posteriores a incidentes
* Excelentes habilidades de resolución de problemas y capacidad de RCA en aplicaciones y servicios distribuidos
* Comprensión sólida de arquitectura de aplicaciones, dependencias entre servicios, integraciones, análisis de rendimiento, mapeo de dependencias e identificación de cuellos de botella
* Experiencia práctica con servicios de AWS, incluidos CloudWatch, ECS, EC2, ALB, Route53, RDS y VPC
* Conocimientos prácticos de pipelines CI/CD y procesos de validación de lanzamientos
* Dominio del inglés a nivel B2 (intermedio alto) o superior
**Deseable**
* Familiaridad con capacidades de observabilidad asistidas por IA
* Experiencia optimizando estrategias de monitoreo y alertas
* Conocimiento de Infraestructura como Código (Terraform o equivalente)
* Experiencia en el sector de viajes/aviación
* Antecedentes en apoyo a iniciativas de modernización y transformación en la nube
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días de vacaciones pagados y licencias por enfermedad
* Capacitación continua, reconversión profesional y cursos de certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn