Descripción
Resumen:
Buscamos un Ingeniero Senior de Confiabilidad de Sitios para conectar el desarrollo de software y las operaciones, aplicando principios de ingeniería para automatizar, ampliar la infraestructura y garantizar la confiabilidad del sistema y lanzamientos seguros de software.
Aspectos destacados:
1. Arquitecturar, construir y mantener infraestructura en la nube con IaC
2. Desarrollar y perfeccionar canalizaciones CI/CD para lanzamientos de software optimizados
3. Establecer marcos integrales de registro, supervisión y alertas
Buscamos un **Ingeniero Senior de Confiabilidad de Sitios** (SRE) competente y con visión de futuro para unirse a nuestra organización de ingeniería.
En este puesto, usted será el punto de conexión entre el desarrollo de software y las operaciones de sistemas, aplicando principios de ingeniería para automatizar tareas operativas, ampliar la capacidad de infraestructura y mantener nuestros sistemas confiables, resilientes y con buen rendimiento. Su objetivo es construir, operar y proteger los entornos de producción que respaldan nuestras aplicaciones, reduciendo el tiempo de inactividad mientras se permiten lanzamientos de software rápidos y seguros.
**Responsabilidades**
* Arquitecturar, construir y mantener infraestructura en la nube mediante enfoques modernos de Infraestructura como Código (IaC), como Terraform o CloudFormation
* Desarrollar y perfeccionar canalizaciones CI/CD para optimizar lanzamientos de software, gestión de configuraciones y actividades operativas rutinarias
* Establecer marcos integrales de registro, supervisión y alertas utilizando plataformas como Prometheus, Grafana o Datadog
* Definir Objetivos de Nivel de Servicio (SLO) e Indicadores de Nivel de Servicio (SLI) claros para evaluar la confiabilidad del sistema
* Atender incidencias en producción liderando esfuerzos de resolución de problemas orientados a restablecer el servicio lo más rápido posible
* Facilitar revisiones posteriores a incidentes sin asignación de culpas para identificar causas fundamentales y prevenir recurrencias
* Colaborar con desarrolladores de software para ajustar el rendimiento del sistema y pronosticar requisitos de capacidad
* Garantizar que los servicios se escalen adecuadamente para adaptarse al crecimiento y a picos repentinos de tráfico
**Requisitos**
* Al menos 3 años de experiencia profesional relevante
* Base sólida en administración de sistemas, DevOps o ingeniería de software orientada a sistemas
* Competencia en al menos un lenguaje de scripting o programación, como Python, Bash, Go o Rust
* Experiencia práctica con plataformas de nube pública, incluidas AWS, Azure o GCP
* Experiencia directa con tecnologías de contenerización, como Docker y Kubernetes
* Conocimientos profundos sobre administración de sistemas Linux/Unix y conceptos esenciales de redes, incluidos TCP/IP, DNS, HTTP y SSL/TLS
* Entusiasmo marcado por la automatización, la reducción de tareas manuales repetitivas y el diseño de sistemas que se degraden con elegancia ante fallos
* Experiencia previa en los sectores de Servicios Financieros, Seguros o Comercio Minorista
* Dominio escrito y hablado del inglés a nivel C1 o superior
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales de colegas altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días libres remunerados y licencias por enfermedad
* Capacitación para actualización y especialización, así como cursos de certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn