Descripción
Resumen:
Buscamos un Ingeniero Senior de Confiabilidad del Sitio para supervisar y mantener la infraestructura, con experiencia especializada en Dynatrace y Splunk, y participación en el soporte fuera del horario laboral.
Aspectos destacados:
1. Supervisar y mantener la salud, el rendimiento y la fiabilidad de las aplicaciones
2. Experiencia especializada en Dynatrace y Splunk para observabilidad y supervisión
3. Participar en la respuesta a incidencias y en el análisis de causas fundamentales
Estamos buscando un **Ingeniero Senior de Confiabilidad del Sitio** que se integre al equipo y apoye las operaciones en todo el entorno de infraestructura. Las herramientas principales de supervisión, observabilidad y registro utilizadas en todos los servicios del cliente son Dynatrace y Splunk. El puesto incluye soporte fuera del horario laboral — los detalles se tratarán posteriormente.
**Responsabilidades**
* Supervisar y mantener la salud, el rendimiento y la fiabilidad de las aplicaciones y servicios del cliente
* Operar y mejorar continuamente Dynatrace y Splunk, incluidos los paneles de control, las alertas, la detección de anomalías y el análisis de registros
* Investigar alertas, identificar posibles causas fundamentales y proporcionar recomendaciones prácticas a los equipos de ingeniería y gestión de incidencias
* Participar en actividades de respuesta a incidencias y soporte fuera del horario laboral
* Realizar análisis de causa fundamental (RCA) e impulsar mejoras posteriores a las incidencias
* Definir y hacer seguimiento de los objetivos de nivel de servicio (SLO), los acuerdos de nivel de servicio (SLA) y los presupuestos de errores
* Identificar y subsanar brechas en observabilidad y supervisión entre los distintos servicios
* Mantener manuales operativos y documentación de soporte
**Requisitos**
* 3 o más años de experiencia en Ingeniería de Confiabilidad del Sitio, Operaciones de Producción, DevOps o un rol similar
* Experiencia especializada en Dynatrace y Splunk, incluyendo gestión del rendimiento de aplicaciones (APM), alertas, paneles de control, monitoreo de experiencia del usuario real (RUM), monitoreo sintético, análisis de flujos de servicio, consultas SPL y análisis de registros
* Experiencia en gestión de incidencias en producción y soporte fuera del horario laboral, incluida la clasificación de alertas, respuesta a incidencias, análisis de causa fundamental (RCA) y revisiones posteriores a las incidencias
* Habilidades para la resolución de problemas y el análisis de causa fundamental en aplicaciones y servicios distribuidos
* Comprensión de la arquitectura de aplicaciones, dependencias entre servicios, integraciones, análisis de rendimiento, mapeo de dependencias e identificación de cuellos de botella
* Experiencia con servicios de AWS, incluidos CloudWatch, ECS, EC2, ALB, Route53, RDS y VPC
* Conocimientos sobre tuberías de CI/CD y procesos de validación de lanzamientos
* Competencia en inglés a nivel B2 o superior
**Deseable**
* Conocimientos sobre capacidades de observabilidad asistida por IA
* Experiencia en ajuste de estrategias de supervisión y alertas
* Familiaridad con Infraestructura como Código (Terraform o equivalente)
* Experiencia en el sector de viajes o aerolíneas
* Antecedentes en iniciativas de modernización y transformación en la nube
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales de profesionales altamente cualificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días de vacaciones pagados y licencias por enfermedad
* Cursos de actualización de competencias, reconversión profesional y certificaciones
* Acceso ilimitado a la biblioteca de LinkedIn Learning y a más de 22 000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn