Descripción
Resumen:
Buscamos un Ingeniero de Fiabilidad de Sitio proactivo para fortalecer la fiabilidad, escalabilidad y seguridad de los entornos de producción mediante la automatización, la observabilidad y la respuesta a incidentes.
Aspectos destacados:
1. Fortalecer la fiabilidad, escalabilidad y seguridad de los entornos de producción
2. Conectar el desarrollo de software y las operaciones mediante la automatización
3. Liderar análisis posteriores a incidentes sin asignación de culpas para identificar las causas fundamentales
Buscamos un **Ingeniero de Fiabilidad de Sitio** proactivo para fortalecer la fiabilidad, escalabilidad y seguridad de los entornos de producción. Usted conectará el desarrollo de software y las operaciones mediante la automatización, la observabilidad y la respuesta a incidentes; ¡postúlese ahora para ayudar a reducir el tiempo de inactividad y permitir lanzamientos rápidos y seguros!
**Responsabilidades**
* Diseñar y mantener infraestructura en la nube utilizando prácticas de Infraestructura como Código
* Construir y optimizar canalizaciones CI/CD para automatizar despliegues y flujos de trabajo operativos
* Implementar registros, monitoreo y alertas para mejorar la observabilidad y la fiabilidad
* Definir y hacer seguimiento a los Objetivos de Nivel de Servicio y los Indicadores de Nivel de Servicio con informes claros
* Responder a incidentes en producción y garantizar la restauración rápida del servicio
* Liderar análisis posteriores a incidentes sin asignación de culpas para identificar las causas fundamentales y prevenir su recurrencia
* Colaborar con ingenieros para mejorar el rendimiento, la escalabilidad y la planificación de capacidad
* Automatizar tareas operativas repetitivas para reducir la carga operativa innecesaria y el riesgo operativo
* Reforzar los entornos de producción para mejorar la resiliencia y las prácticas seguras de cambio
**Requisitos**
* 2\+ años de experiencia en ingeniería de fiabilidad de sitio, DevOps o administración de sistemas
* Experiencia práctica con Infraestructura como Código mediante Terraform o CloudFormation
* Experiencia práctica construyendo y mejorando canalizaciones CI/CD para despliegues automatizados
* Excelentes habilidades prácticas de solución de problemas y liderazgo en la respuesta a incidentes en entornos de producción
* Sólidas habilidades de gestión de proyectos para coordinar trabajos de fiabilidad con equipos de desarrollo de software
* Competencia en scripting o programación con Python, Bash, Go o Rust
* Experiencia con plataformas en la nube como AWS, Azure o GCP
* Experiencia con contenerización mediante Docker y Kubernetes
* Conocimientos profundos de administración de Linux/Unix y fundamentos de redes (TCP/IP, DNS, HTTP, SSL/TLS)
* Excelentes habilidades comunicativas con mentalidad centrada en la fiabilidad, la automatización y la reducción de la carga operativa innecesaria
* Dominio avanzado del inglés (nivel C1, Avanzado)
**Deseable**
* Experiencia con Prometheus, Grafana o Datadog
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales de colegas altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días libres remunerados y licencias por enfermedad
* Capacitación continua, reconversión profesional y cursos de certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn