Ingeniero Senior de Datos (Databricks/AWS)

Compañía
Descripción
Resumen: Este es un puesto de alto impacto para un Ingeniero Senior de Datos con experiencia en Databricks, dbt y Apache Airflow, destinado a apoyar una migración crítica de la arquitectura de datos CRM para un cliente clave. Aspectos destacados: 1. Apoyar la iniciativa urgente para reforzar capacidades clave de ingeniería 2. Centrarse en construir y configurar tuberías de ingesta de datos 3. Implementar modelos dbt y orquestaciones de Airflow para garantizar la precisión de los datos **Acerca de Fusemachines** Fusemachines es una empresa de IA con más de 12 años de antigüedad, dedicada a ofrecer productos y soluciones de IA de vanguardia a una amplia gama de industrias. Fundada por Sameer Maskey, Ph.D., profesor adjunto asociado de la Universidad de Columbia, nuestra empresa tiene como misión constante democratizar la IA y aprovechar el talento global en IA procedente de comunidades desatendidas. Con una sólida presencia en cuatro países y un equipo comprometido de más de 400 empleados de tiempo completo, estamos decididos a impulsar trayectorias de transformación con IA para empresas de todo el mundo. En Fusemachines no solo cerramos la brecha entre el avance de la IA y su impacto global, sino que también nos esforzamos por entregar al mundo las soluciones tecnológicas más avanzadas. **Tipo: Tiempo completo, remoto** **Acerca del puesto** Este es un puesto de tiempo completo y alto impacto para un Ingeniero Senior de Datos con experiencia en **Databricks**, **dbt** y **Apache Airflow**, destinado a apoyar una migración crítica de la arquitectura de datos CRM para un cliente clave del sector de Ciencias de la Vida. En este puesto, usted se unirá a una iniciativa urgente para reforzar capacidades clave de ingeniería y mantener el impulso durante una transición en curso del sistema CRM. El proyecto implica migrar los datos empresariales de clientes desde Veeva CRM hacia Salesforce Life Sciences Cloud, integrado con un entorno subyacente en la nube AWS S3 y un almacén de datos Databricks. Su principal enfoque será construir, configurar y redirigir tuberías de ingesta de datos desde Life Sciences Cloud hacia el almacén de datos, implementando simultáneamente modelos dbt y orquestaciones de Airflow para asegurar una precisión total de los datos. Los candidatos deben ser capaces de trabajar estrictamente en el horario comercial de la costa este de Estados Unidos (la ubicación es flexible en toda Norteamérica, LATAM o remotamente, siempre que exista una superposición completa con el horario del Este). **Requisitos de calificación / conjunto de habilidades:** * **Experiencia técnica fundamental**: + Más de 5 años de experiencia práctica en ingeniería de datos con profunda especialización en **AWS**, **Databricks**, **dbt** y **Apache Airflow**. + Alta competencia en programación con **Python** / **PySpark** y **SQL avanzado** (uniones complejas, funciones analíticas de ventana). + Experiencia práctica con la arquitectura de la plataforma **Databricks**, implementación de Lakehouse, Delta Lake, Unity Catalog y ajuste del rendimiento de clústeres. * **Arquitectura y migración**: + Trayectoria comprobada en la arquitectura y ejecución de **migraciones**. + Experiencia demostrada en la **escala del rendimiento de plataformas**. * **Orquestación y modelado de tuberías**: + Experiencia comprobada en la construcción de tuberías de transformación escalables mediante **dbt**, para transformación, pruebas y documentación de datos. + Sólida experiencia en la orquestación de DAGs de flujo de trabajo complejos con **Apache Airflow**. + Experiencia trabajando con infraestructura en la nube **AWS**, específicamente **S3** como capa de almacenamiento subyacente del lago de datos. * **Integración CRM y conocimiento del dominio**: + Experiencia práctica desarrollando integraciones y tuberías de ingesta de datos para plataformas CRM, especialmente Salesforce, **Salesforce Life Sciences Cloud** y/o **Veeva CRM**. + Comprensión de estructuras de datos, datos maestros de clientes y flujos de análisis dentro del sector de **Ciencias de la Vida**. * **DevOps y gobernanza**: + Profundo conocimiento del **ciclo de vida del desarrollo de software (SDLC)/metodologías ágiles** y DevOps para CI/CD y gestión de artefactos. + Conocimiento de las mejores prácticas de seguridad y estándares de cumplimiento para AWS y Databricks. * **Certificaciones preferidas**: Certificación Databricks como Ingeniero de Datos Asociado/Profesional, Certificación Databricks como Desarrollador Spark y certificaciones importantes en la nube de AWS. * Logística y superposición de turnos: + Capacidad para mantener una **superposición del 100 % del horario laboral** con el **horario comercial de la costa este de EE.UU. (ET)**. Ubicación flexible (EE.UU., Canadá, LATAM o remota en ET). **Responsabilidades** * **Desarrollo e integración de tuberías**: Arquitecturar, construir e implementar tuberías de integración de datos que conecten **Salesforce Life Sciences Cloud** con el entorno de almacén de datos Databricks del cliente. * **Soporte para la migración CRM**: Ejecutar modificaciones en las tuberías para migrar fuentes de datos heredadas desde Veeva CRM hacia Salesforce Life Sciences Cloud, actualizando los modelos del almacén en consecuencia. * **Transformación y orquestación de flujos de trabajo**: Escribir modelos de transformación limpios y modulares con **dbt**, y organizar la ejecución extremo a extremo de DAGs mediante **Apache Airflow**. * **Optimización del almacén de datos y almacenamiento**: Gestionar **tablas Delta** y optimizar **clústeres Databricks** y **almacenamiento AWS S3** para lograr un alto rendimiento y eficiencia de costos. * **Validación de datos y aseguramiento de calidad**: Implementar pruebas de calidad de datos, esquemas y reglas de verificación en dbt y Python para garantizar una entrega precisa de los datos. * **Supervisión y alertas**: Construir y aplicar marcos proactivos de supervisión. * **Colaboración ágil**: Trabajar estrechamente con líderes de proyectos, arquitectos de soluciones y partes interesadas técnicas durante el horario de la costa este de EE.UU. para asegurar iteraciones rápidas y la finalización de objetivos. *Empleador de igualdad de oportunidades: raza, color, religión, sexo, orientación sexual, identidad de género, origen nacional, edad, información genética, discapacidad, estatus de veterano protegido u otra categoría legalmente protegida.* cA1KN2xFdv
Publicado por

Sofía González
Indeed · HR





