Descripción
Resumen:
Buscamos un Ingeniero Senior de Datos para diseñar, desarrollar y mantener pipelines de datos y de aprendizaje automático en la plataforma Domino Data Lab, centrándonos en ingeniería de datos y MLOps.
Aspectos destacados:
1. Diseño, desarrollo y mantenimiento de pipelines de datos y de aprendizaje automático
2. Construcción de pipelines de datos fiables y supervisión de flujos de trabajo del ciclo de vida de los modelos
3. Promoción de las mejores prácticas en el uso de la plataforma y el diseño de pipelines
Estamos buscando un Ingeniero Senior de Datos para liderar el diseño, desarrollo y mantenimiento de pipelines de datos y de aprendizaje automático en la plataforma Domino Data Lab. Este puesto se centra en los aspectos de ingeniería de datos y MLOps de Domino, construyendo pipelines de datos fiables, supervisando flujos de trabajo del ciclo de vida de los modelos y manteniendo eficiente y segura la infraestructura de datos y computación de la plataforma. Este no es un puesto de desarrollo front-end ni de aplicaciones.
**Responsabilidades**
* Crear y mantener pipelines de datos fiables que impulsen cargas de trabajo analíticas y de aprendizaje automático
* Gestionar el ciclo completo de los flujos de trabajo de datos, abarcando ingesta, transformación y entrega
* Administrar la infraestructura de cómputo para mantener operaciones de plataforma eficientes, seguras y fiables
* Diagnosticar y resolver problemas que afecten al rendimiento de los pipelines y a la calidad de los datos
* Colaborar con científicos de datos y otros ingenieros para satisfacer sus necesidades de infraestructura y herramientas
* Definir y promover las mejores prácticas en el uso de la plataforma, el diseño de pipelines y la estructura de los flujos de trabajo de datos
* Incorporar automatización en los procesos de pruebas e implementación para aumentar la fiabilidad y reducir el trabajo manual
* Supervisar la salud de los pipelines y anticiparse a cuellos de botella o fallos antes de que se agraven
* Contribuir al mejoramiento continuo de herramientas y procesos internos que apoyan las operaciones de datos
* Documentar diseños técnicos, flujos de trabajo y configuraciones para facilitar el intercambio de conocimientos dentro del equipo
**Requisitos**
* Al menos 3 años de experiencia relevante
* Experiencia práctica profunda con la plataforma Domino Data Lab, incluidas las Fuentes y Conectores de Datos, Conjuntos de Datos, Entornos, Proyectos, Trabajos y Flujos, con capacidad para arquitecturar y solucionar problemas de extremo a extremo en pipelines de datos y promover las mejores prácticas en el uso de la plataforma
* Dominio experto de Python como lenguaje principal para ingeniería de datos y desarrollo de pipelines
* Excelentes habilidades en SQL para extraer, transformar y optimizar datos en sistemas relacionales y de almacenamiento de datos
* Capacidad para usar R y Bash en toda la cadena de herramientas de ciencia de datos y para la creación de scripts de automatización
* Experiencia demostrada en el diseño, construcción y mantenimiento de pipelines ETL/ELT, incluida la ingesta, transformación, validación y orquestación de datos
* Experiencia práctica con Kubernetes y ofertas gestionadas como EKS, AKS o GKE, con capacidad para implementar, depurar y ajustar finamente cargas de trabajo en clústeres que ejecuten trabajos de datos y de aprendizaje automático
* Experiencia en la creación, optimización y solución de problemas de imágenes de contenedores para cargas de trabajo de datos y de aprendizaje automático mediante Docker
* Experiencia en establecer y mantener pipelines de CI/CD utilizando herramientas como Jenkins, GitLab CI, GitHub Actions o Azure DevOps para automatizar pruebas e implementaciones de pipelines de datos y flujos de trabajo de aprendizaje automático
* Conocimiento práctico de al menos uno de los principales proveedores de nube, como AWS, Azure o GCP, con capacidad para evaluar compromisos entre arquitectura de datos, costos y seguridad
* Excelente dominio del inglés (nivel B2 o superior)
**Deseable**
* Experiencia con Domino Nexus u orquestación híbrida/multi-nube de cómputo
* Experiencia en la entrega de flujos de trabajo de aprendizaje automático que abarquen entrenamiento, despliegue, monitoreo y reentrenamiento, con comprensión de la reproducibilidad y el control de versiones
* Experiencia práctica con IA generativa, modelos de lenguaje grande (LLM) o marcos agentes, incluida la generación aumentada por recuperación (RAG), desde la perspectiva de pipelines de datos
* Familiaridad con herramientas de orquestación como MLflow, Kubeflow, Airflow o Domino Flows
* Conocimiento de gobernanza de modelos, automatización de cumplimiento o marcos de registro de auditoría
* Experiencia laboral en entornos farmacéuticos, BFSI o del sector público
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días de vacaciones pagados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn