Descripción
Resumen:
Buscamos un Ingeniero de Confiabilidad del Sitio (SRE) proactivo que aplique principios de ingeniería de software para automatizar operaciones, escalar infraestructura y garantizar alta disponibilidad, resiliencia y rendimiento de los entornos de producción.
Aspectos destacados:
1. Diseñar, construir y mantener infraestructura en la nube mediante Infraestructura como Código
2. Construir y optimizar canalizaciones CI/CD para automatizar las implementaciones de software
3. Responder a incidentes de producción y liderar los esfuerzos de resolución de problemas
Nuestro equipo de ingeniería busca incorporar un **Ingeniero de Confiabilidad del Sitio (SRE)** competente y proactivo. Este puesto actúa como vínculo entre el desarrollo de software y las operaciones de sistemas. Se aplicarán principios de ingeniería de software para automatizar operaciones, escalar infraestructura y mantener los sistemas altamente disponibles, resilientes y eficientes. La misión central consiste en construir, ejecutar y proteger los entornos de producción que sustentan nuestras aplicaciones, minimizando el tiempo de inactividad mientras se permite una implementación de software rápida y segura.
**Responsabilidades**
* Diseñar, construir y mantener infraestructura en la nube mediante prácticas modernas de Infraestructura como Código, como Terraform y CloudFormation
* Construir y optimizar canalizaciones CI/CD para automatizar implementaciones de software, gestión de configuraciones y tareas operativas repetitivas
* Diseñar e implementar sistemas robustos de registro, monitoreo y alertas utilizando herramientas como Prometheus, Grafana y Datadog
* Establecer Objetivos de Nivel de Servicio (SLO) e Indicadores de Nivel de Servicio (SLI) claros
* Responder a incidentes de producción y liderar los esfuerzos de resolución de problemas para restablecer los servicios
* Realizar análisis posteriores sin asignación de culpas (blameless post\-mortems) para identificar causas fundamentales y prevenir su recurrencia
* Colaborar con desarrolladores de software para optimizar el rendimiento del sistema y planificar la capacidad
* Garantizar que los servicios puedan escalar para soportar el crecimiento y picos de tráfico
**Requisitos**
* 2\+ años de experiencia en administración de sistemas, DevOps o desarrollo de software centrado en sistemas
* Competencia en al menos un lenguaje de scripting o programación, como Python, Bash, Go o Rust
* Experiencia con proveedores de nube pública como AWS, Azure o GCP, así como con herramientas de contenerización como Docker y Kubernetes
* Conocimientos sólidos sobre administración de Linux/Unix y fundamentos de redes, como TCP/IP, DNS y HTTP/SSL/TLS
* Pasión por la automatización, la eliminación de tareas repetitivas (toil) y la construcción de sistemas resilientes que fallen con elegancia
* Competencia avanzada en inglés (C1\+)
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales de colegas altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días libres remunerados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn