Descripción
Resumen:
Buscamos un Ingeniero de Fiabilidad de Sitio proactivo para mejorar la fiabilidad, escalabilidad y seguridad de los entornos de producción mediante la automatización, la observabilidad y la respuesta a incidentes.
Aspectos destacados:
1. Fortalecer la fiabilidad, escalabilidad y seguridad de los entornos de producción
2. Conectar el desarrollo de software y las operaciones mediante la automatización
3. Liderar análisis posteriores a incidentes sin asignación de culpas y automatizar tareas operativas repetitivas
Buscamos un **Ingeniero de Fiabilidad de Sitio** proactivo para fortalecer la fiabilidad, escalabilidad y seguridad de los entornos de producción. Usted conectará el desarrollo de software y las operaciones mediante la automatización, la observabilidad y la respuesta a incidentes; ¡postúlese ahora para ayudar a reducir el tiempo de inactividad y permitir lanzamientos rápidos y seguros!
**Responsabilidades**
* Diseñar y mantener infraestructura en la nube mediante prácticas de Infraestructura como Código
* Construir y optimizar canalizaciones CI/CD para automatizar despliegues y flujos de trabajo operativos
* Implementar registros, monitoreo y alertas para mejorar la observabilidad y la fiabilidad
* Definir y supervisar Objetivos de Nivel de Servicio e Indicadores de Nivel de Servicio con informes claros
* Responder a incidentes en producción y garantizar la restauración rápida del servicio
* Liderar análisis posteriores a incidentes sin asignación de culpas para identificar causas fundamentales y prevenir su recurrencia
* Colaborar con ingenieros para mejorar el rendimiento, la escalabilidad y la planificación de capacidad
* Automatizar tareas operativas repetitivas para reducir la carga operativa innecesaria (toil) y el riesgo operativo
* Reforzar los entornos de producción para mejorar la resiliencia y las prácticas seguras de cambio
**Requisitos**
* 2\+ años de experiencia en ingeniería de fiabilidad de sitio, DevOps o administración de sistemas
* Experiencia práctica con Infraestructura como Código utilizando Terraform o CloudFormation
* Experiencia práctica construyendo y mejorando canalizaciones CI/CD para despliegues automatizados
* Excelentes habilidades de resolución de problemas y liderazgo en la respuesta a incidentes en entornos de producción
* Buenas habilidades de gestión de proyectos para coordinar trabajos de fiabilidad con equipos de desarrollo de software
* Competencia en scripting o programación con Python, Bash, Go o Rust
* Experiencia con plataformas en la nube: AWS, Azure o GCP
* Experiencia con contenedores: Docker y Kubernetes
* Conocimientos profundos en administración de Linux/Unix y fundamentos de redes (TCP/IP, DNS, HTTP, SSL/TLS)
* Excelentes habilidades comunicativas y mentalidad orientada a la fiabilidad, centrada en la automatización y la reducción de la carga operativa innecesaria (toil)
* Dominio avanzado del inglés (nivel C1, Avanzado)
**Deseable**
* Experiencia con Prometheus, Grafana o Datadog
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días de vacaciones remunerados y licencias por enfermedad
* Programas de actualización de habilidades, reconversión profesional y certificaciones
* Acceso ilimitado a la biblioteca de LinkedIn Learning y más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn