Descripción
Resumen:
Buscamos un Ingeniero Senior de Confiabilidad de Sitios para integrar el desarrollo de software y las operaciones, automatizando la infraestructura y garantizando sistemas altamente disponibles y resilientes.
Aspectos destacados:
1. Arquitecturar, construir y mantener infraestructura en la nube con prácticas de infraestructura como código (IaC).
2. Liderar la respuesta a incidentes y facilitar revisiones posteriores sin asignación de culpas.
3. Colaborar para mejorar el rendimiento del sistema y planificar las necesidades de capacidad.
Buscamos un **Ingeniero Senior de Confiabilidad de Sitios** competente y orientado a resultados para que se una a nuestro equipo de ingeniería y cierre la brecha entre el desarrollo de software y las operaciones de sistemas. En este puesto, aplicará principios de ingeniería para automatizar operaciones, escalar infraestructura y mantener los sistemas altamente disponibles, resilientes y eficientes. Su misión consiste en construir, operar y proteger los entornos de producción que sustentan nuestras aplicaciones, reduciendo el tiempo de inactividad y permitiendo una entrega de software rápida y segura.
**Responsabilidades**
* Arquitecturar, construir y mantener infraestructura en la nube mediante prácticas modernas de infraestructura como código (IaC), como Terraform y CloudFormation
* Desarrollar y perfeccionar canalizaciones de integración y entrega continuas (CI/CD) para agilizar los despliegues de software, la gestión de configuraciones y las tareas operativas rutinarias
* Implementar sistemas exhaustivos de registro, supervisión y alertas utilizando herramientas como Prometheus, Grafana y Datadog
* Definir objetivos claros de nivel de servicio (SLO) e indicadores de nivel de servicio (SLI)
* Liderar los esfuerzos de respuesta a incidentes y solucionar problemas en producción para restablecer los servicios de forma inmediata
* Facilitar revisiones posteriores sin asignación de culpas para identificar las causas fundamentales y prevenir recurrencias futuras
* Colaborar con desarrolladores de software para mejorar el rendimiento del sistema y planificar las necesidades de capacidad
* Garantizar que los servicios escalen eficazmente para adaptarse al crecimiento y a los picos de tráfico
**Requisitos**
* 3 o más años de experiencia en administración de sistemas, DevOps o desarrollo de software orientado a sistemas
* Competencia en al menos un lenguaje de scripting o programación, como Python, Bash, Go o Rust
* Experiencia práctica con plataformas en la nube pública, como AWS, Azure o GCP, así como con herramientas de contenerización como Docker y Kubernetes
* Conocimientos sólidos sobre administración de Linux/Unix y fundamentos de redes, como TCP/IP, DNS y HTTP/SSL/TLS
* Mentalidad demostrada de confiabilidad, con un fuerte impulso hacia la automatización, la reducción de tareas repetitivas y el diseño de sistemas resilientes que fallen con elegancia
* Dominio del inglés a nivel B2 o superior
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales compuestos por colegas altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días de vacaciones remunerados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y a más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada, reconocida por Glassdoor, Newsweek y LinkedIn