Descripción
Resumen:
Buscamos un Ingeniero Senior de Datos para diseñar, desarrollar y mantener tuberías de datos y aprendizaje automático en la plataforma Domino Data Lab, centrándose en los aspectos de ingeniería de datos y MLOps.
Aspectos destacados:
1. Diseño, desarrollo y mantenimiento de tuberías de datos y aprendizaje automático
2. Enfoque en aspectos de ingeniería de datos y MLOps
3. Colaboración con equipos globales de compañeros altamente calificados y diversos
Estamos buscando un Ingeniero Senior de Datos para liderar el diseño, desarrollo y mantenimiento de tuberías de datos y aprendizaje automático en la plataforma Domino Data Lab. Este puesto se centra en los aspectos de ingeniería de datos y MLOps de Domino, construyendo tuberías de datos confiables, supervisando flujos de trabajo del ciclo de vida de los modelos y manteniendo la infraestructura de datos y computación de la plataforma funcionando de forma eficiente y segura. Este no es un puesto de desarrollo front\-end ni de aplicaciones.
**Responsabilidades**
* Construir y mantener tuberías de datos confiables que impulsen cargas de trabajo analíticas y de aprendizaje automático
* Gestionar el ciclo completo de los flujos de trabajo de datos, abarcando ingesta, transformación y entrega
* Administrar la infraestructura computacional para mantener operaciones de plataforma eficientes, seguras y confiables
* Diagnosticar y resolver problemas que afecten el rendimiento de las tuberías y la calidad de los datos
* Colaborar con científicos de datos y otros ingenieros para satisfacer sus requisitos de infraestructura y herramientas
* Definir y promover buenas prácticas sobre el uso de la plataforma, el diseño de tuberías y la estructura de flujos de trabajo de datos
* Introducir automatización en los procesos de pruebas e implementación para aumentar la fiabilidad y reducir el trabajo manual
* Supervisar la salud de las tuberías y anticiparse a cuellos de botella o fallos antes de que se agraven
* Contribuir al mejoramiento continuo de herramientas y procesos internos que respaldan las operaciones de datos
* Documentar diseños técnicos, flujos de trabajo y configuraciones para facilitar el intercambio de conocimientos dentro del equipo
**Requisitos**
* Al menos 3 años de experiencia relevante
* Experiencia práctica profunda con la plataforma Domino Data Lab, incluidas las Fuentes y Conectores de Datos, Conjuntos de Datos, Entornos, Proyectos, Trabajos y Flujos, con capacidad para arquitecturar y solucionar problemas de extremo a extremo en tuberías de datos y promover buenas prácticas para el uso de la plataforma
* Dominio experto de Python como lenguaje principal para ingeniería de datos y desarrollo de tuberías
* Competencias sólidas en SQL para extraer, transformar y optimizar datos en sistemas relacionales y de almacenamiento de datos
* Capacidad para usar R y Bash en toda la cadena de herramientas de ciencia de datos y para escribir scripts de automatización
* Experiencia comprobada en el diseño, construcción y mantenimiento de tuberías ETL/ELT, incluida la ingesta, transformación, validación y orquestación de datos
* Experiencia práctica con Kubernetes y ofertas gestionadas tales como EKS, AKS o GKE, con capacidad para implementar, depurar y ajustar finamente cargas de trabajo en clústeres que ejecuten trabajos de datos y aprendizaje automático
* Experiencia en la creación, optimización y solución de problemas de imágenes de contenedores para cargas de trabajo de datos y aprendizaje automático mediante Docker
* Experiencia en establecer y mantener tuberías CI/CD usando herramientas como Jenkins, GitLab CI, GitHub Actions o Azure DevOps para automatizar pruebas e implementación de tuberías de datos y flujos de trabajo de aprendizaje automático
* Conocimiento práctico de al menos uno de los principales proveedores de nube, como AWS, Azure o GCP, con capacidad para evaluar los compromisos entre arquitectura de datos, costos y seguridad
* Excelente dominio del inglés (nivel B2 o superior)
**Deseable**
* Experiencia con Domino Nexus u orquestación híbrida/multi\-nube de computación
* Experiencia en la entrega de flujos de trabajo de aprendizaje automático que abarquen entrenamiento, despliegue, monitoreo y reentrenamiento, con comprensión de la reproducibilidad y el control de versiones
* Experiencia práctica con IA generativa (GenAI), modelos de lenguaje grande (LLM) o marcos agentes, incluida la generación con recuperación aumentada (RAG), desde la perspectiva de una tubería de datos
* Familiaridad con herramientas de orquestación como MLflow, Kubeflow, Airflow o Domino Flows
* Conocimiento de gobernanza de modelos, automatización de cumplimiento o marcos de registro de auditoría
* Experiencia laboral en entornos farmacéuticos, BFSI o del sector público
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales de compañeros altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días libres remunerados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y a más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn