Descripción
Resumen:
Únase a nuestro equipo de ingeniería como Ingeniero Senior de Confiabilidad del Sitio (SRE) para conectar el desarrollo y las operaciones, automatizar sistemas y garantizar alta disponibilidad y rendimiento.
Aspectos destacados:
1. Conectar el desarrollo de software y las operaciones de sistemas mediante la automatización.
2. Construir, ejecutar y proteger entornos de producción para minimizar el tiempo de inactividad.
3. Diseñar y mantener infraestructura en la nube con prácticas modernas de Infraestructura como Código (IaC).
Buscamos un **Ingeniero Senior de Confiabilidad del Sitio** (SRE) competente y proactivo para unirse a nuestro equipo de ingeniería.
En este puesto, usted cerrará la brecha entre el desarrollo de software y las operaciones de sistemas. Aplicará principios de ingeniería de software para automatizar nuestras operaciones, escalar nuestra infraestructura y garantizar que nuestros sistemas sean altamente disponibles, resilientes y eficientes. Su misión consiste en construir, ejecutar y proteger los entornos de producción que sustentan nuestras aplicaciones, minimizando el tiempo de inactividad y ayudándonos a implementar software de forma rápida y segura.
**Responsabilidades**
* Diseñar, construir y mantener infraestructura en la nube utilizando prácticas modernas de Infraestructura como Código (IaC), como Terraform o CloudFormation
* Construir y optimizar canalizaciones de CI/CD para automatizar las implementaciones de software, la gestión de configuraciones y las tareas operativas repetitivas
* Diseñar e implementar sistemas robustos de registro, supervisión y alertas mediante herramientas como Prometheus, Grafana o Datadog
* Establecer Objetivos de Nivel de Servicio (SLO) e Indicadores de Nivel de Servicio (SLI) claros para medir la confiabilidad del sistema
* Responder a incidentes en producción y liderar esfuerzos de resolución de problemas para restaurar los servicios rápidamente
* Realizar análisis posteriores a fallos sin asignación de culpas para identificar las causas fundamentales y prevenir problemas recurrentes
* Colaborar con desarrolladores de software para optimizar el rendimiento del sistema y planificar las necesidades de capacidad
* Garantizar que los servicios puedan escalar eficazmente para manejar el crecimiento y picos de tráfico
**Requisitos**
* Un mínimo de 3 años de experiencia relevante
* Sólida experiencia en administración de sistemas, DevOps o desarrollo de software centrado en sistemas
* Competencia en al menos un lenguaje de programación o scripting, como Python, Bash, Go o Rust
* Experiencia sólida con proveedores de nube pública, incluidos AWS, Azure o GCP
* Experiencia práctica con herramientas de contenerización como Docker y Kubernetes
* Profundo conocimiento de la administración de Linux/Unix y de los fundamentos básicos de redes, incluidos TCP/IP, DNS, HTTP y SSL/TLS
* Una auténtica pasión por la automatización, la reducción de tareas manuales y la construcción de sistemas resilientes que fallen con elegancia
* Experiencia en los sectores de Servicios Financieros, Seguros o Comercio Minorista
* Competencia escrita y oral sólida en inglés, nivel C1 o superior
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales compuestos por colegas altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días libres remunerados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn