Descripción
Resumen:
Buscamos un Ingeniero Senior de Confiabilidad de Sitios (SRE) para conectar el desarrollo de software y las operaciones, aplicando principios de ingeniería para automatizar tareas operativas, ampliar la infraestructura y garantizar la confiabilidad del sistema.
Aspectos destacados:
1. Arquitecturar y mantener infraestructura en la nube con enfoques modernos de Infraestructura como Código (IaC)
2. Desarrollar y perfeccionar tuberías de integración y entrega continuas (CI/CD) para agilizar las versiones de software
3. Establecer marcos integrales de registro, supervisión y alertas
Buscamos un **Ingeniero Senior de Confiabilidad de Sitios** (SRE) competente y con visión de futuro para unirse a nuestra organización de ingeniería.
En este puesto, usted actuará como punto de conexión entre el desarrollo de software y las operaciones de sistemas, aplicando principios de ingeniería para automatizar tareas operativas, ampliar la capacidad de infraestructura y garantizar que nuestros sistemas sean confiables, resilientes y ofrezcan un buen rendimiento. Su objetivo será construir, operar y proteger los entornos de producción que respaldan nuestras aplicaciones, reduciendo el tiempo de inactividad mientras se permiten versiones de software rápidas y seguras.
**Responsabilidades**
* Arquitecturar, construir y mantener infraestructura en la nube mediante enfoques modernos de Infraestructura como Código (IaC), tales como Terraform o CloudFormation
* Desarrollar y perfeccionar tuberías de integración y entrega continuas (CI/CD) para agilizar las versiones de software, la gestión de configuraciones y las actividades operativas rutinarias
* Establecer marcos integrales de registro, supervisión y alertas utilizando plataformas como Prometheus, Grafana o Datadog
* Definir Objetivos de Nivel de Servicio (SLO) e Indicadores de Nivel de Servicio (SLI) claros para evaluar la confiabilidad del sistema
* Atender incidentes en producción liderando esfuerzos de resolución de problemas orientados a restaurar el servicio lo más rápido posible
* Facilitar revisiones posteriores a incidentes sin asignación de culpas para identificar causas fundamentales y prevenir recurrencias
* Colaborar con desarrolladores de software para ajustar el rendimiento del sistema y pronosticar los requisitos de capacidad
* Garantizar que los servicios se escalen adecuadamente para adaptarse al crecimiento y a picos repentinos de tráfico
**Requisitos**
* Al menos 3 años de experiencia profesional relevante
* Base sólida en administración de sistemas, DevOps o ingeniería de software orientada a sistemas
* Competencia en al menos un lenguaje de scripting o programación, como Python, Bash, Go o Rust
* Experiencia práctica con plataformas de nube pública, incluidas AWS, Azure o GCP
* Experiencia directa con tecnologías de contenerización, como Docker y Kubernetes
* Conocimientos exhaustivos sobre administración de sistemas Linux/Unix y conceptos esenciales de redes, incluidos TCP/IP, DNS, HTTP y SSL/TLS
* Gran entusiasmo por la automatización, la reducción del trabajo manual repetitivo y el diseño de sistemas que se degraden con elegancia ante fallos
* Antecedentes profesionales en los sectores de Servicios Financieros, Seguros o Comercio Minorista
* Dominio sólido del inglés escrito y hablado, nivel C1 o superior
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días de vacaciones pagados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificaciones
* Acceso ilimitado a la biblioteca de LinkedIn Learning y a más de 22\+000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn