Descripción
Resumen:
Como Científico de Datos, construirás conjuntos de datos, características y modelos de aprendizaje automático dentro de Databricks para impulsar decisiones de inteligencia de marketing.
Aspectos destacados:
1. Trabajar con una plataforma nativa en la nube Databricks Lakehouse y una cultura orientada a la IA
2. Experiencia práctica con Databricks en una plataforma moderna de tipo lakehouse
3. Mentoría y crecimiento profesional con arquitectos senior
**Científico de Datos**
**(Aprendizaje Automático \& Databricks)**
-------------------------------------------------------
**Salario** \| 2 000 USD/mes (pagos quincenales)
**Ubicación** \| Teletrabajo desde América Latina
**Horario** \| Jornada completa
**Tipo de empleo** \| Contratista
**Beneficios \& Tiempo libre** \| Días festivos estadounidenses libres, permisos pagados generosos, capacitación interna y mentoría
#### **Acerca del cliente**
Latino Legends colabora con una empresa estadounidense de inteligencia de marketing de rápido crecimiento para identificar talento nearshore de primer nivel. Nuestro cliente no solo informa sobre los datos: los utiliza para construir soluciones que impulsan decisiones de marketing para más de 1 000 clientes distribuidores a través de canales digitales y directos. Opera sobre una plataforma nativa en la nube Databricks Lakehouse y fomenta una cultura orientada a la IA, donde las herramientas modernas aceleran el análisis y la implementación.
#### **El puesto**
Como Científico de Datos, trabajarás principalmente dentro de Databricks construyendo conjuntos de datos, características y modelos de aprendizaje automático que potencien la inteligencia de marketing. Destinarás tu tiempo a la preparación de datos, al análisis exploratorio, a la ingeniería de características y al entrenamiento/evaluación de modelos, con el apoyo de ingenieros y arquitectos senior en el lado de producción.
#### **Principales responsabilidades**
##### **Datos y modelado (80 %)**
* Construir y mantener canalizaciones y transformaciones de datos en Databricks mediante Python, PySpark y SQL.
* Realizar análisis exploratorios de datos para comprender conjuntos de datos relacionados con marketing, campañas y clientes.
* Diseñar características, preparar conjuntos de datos para entrenamiento y entrenar, evaluar y ajustar modelos de aprendizaje automático.
* Apoyar la implementación y supervisión de modelos en producción junto con ingenieros senior.
* Investigar y resolver problemas de calidad de datos en fuentes originales y canalizaciones.
* Aprovechar eficientemente herramientas de programación asistida por IA sin comprometer la calidad del código ni la comprensión profunda.
##### **Colaboración y calidad (20 %)**
* Participar en la planificación de sprints, reuniones diarias (standups) y retrospectivas dentro de un marco ágil/SCRUM.
* Escribir pruebas, verificaciones de validación de datos y participar en revisiones de código.
* Documentar conjuntos de datos, características, supuestos y resultados de los modelos.
* Presentar hallazgos y recomendaciones tanto a partes interesadas técnicas como comerciales.
#### **Cualificaciones fundamentales**
##### **Requeridas:**
* **Experiencia:** 1\-3 años de experiencia práctica en ciencia de datos, aprendizaje automático o ingeniería analítica (incluyendo pasantías, prácticas profesionales, investigación o proyectos complejos).
* **Formación académica:** Título universitario en Ciencias de la Computación, Estadística, Matemáticas, Ingeniería, Ciencia de Datos o experiencia práctica equivalente.
* **Lenguajes y herramientas centrales:** Competencia sólida en Python (pandas, NumPy, scikit\-learn) y SQL (joins, agregaciones, funciones ventana).
* **Fundamentos de ciencia de datos:** Comprensión sólida del aprendizaje supervisado, divisiones entre conjuntos de entrenamiento y prueba, ingeniería de características, validación cruzada y métricas de evaluación (ROC AUC, RMSE, precisión, exhaustividad).
* **Estadística y manejo de datos:** Conocimiento práctico de estadística descriptiva, pruebas de hipótesis, perfilado de datos y limpieza de datos.
* **Flujo de trabajo moderno:** Competencia con Git, desarrollo colaborativo y herramientas de desarrollo asistido por IA (Cursor, GitHub Copilot, Claude, etc.).
* **Comunicación:** Excelentes habilidades escritas y orales en inglés para explicar de forma efectiva hallazgos complejos a audiencias no técnicas.
##### **Deseables:**
* Experiencia práctica con Databricks (Unity Catalog, clústeres, trabajos, notebooks) o PySpark.
* Conocimientos básicos de MLflow, Delta Lake (arquitectura en capas) o servicios en la nube de Azure.
* Experiencia en pronóstico de series temporales, modelado de impacto (uplift modeling) o segmentación de audiencias.
* Familiaridad con herramientas de visualización (Power BI, Tableau, Plotly) o canalizaciones CI/CD (GitHub Actions, Azure DevOps).
* Interés en Modelos de Lenguaje de Gran Tamaño (LLM) y aplicaciones de IA generativa.
#### **¿Por qué postularse a través de Latino Legends?**
* **Stack moderno:** Experiencia práctica con Databricks en una plataforma moderna de tipo lakehouse, sin código heredado que entorpezca el trabajo.
* **Mentoría y crecimiento profesional:** Trabajar codo con codo con arquitectos senior que revisarán tu código y te ayudarán a pasar de experimentos en notebooks a modelos de aprendizaje automático listos para producción.
* **Alto impacto:** Tus modelos influyen directamente en millones de dólares destinados activamente al gasto en marketing.
* **Cultura distribuida:** Disfruta de una cultura colaborativa transfronteriza entre Estados Unidos y América Latina.