Mindrift
Mindrift
Mindrift es un mercado de talento especializado en inteligencia artificial y una plataforma SaaS que conecta a colaboradores profesionales y expertos en distintas áreas con proyectos de entrenamiento y evaluación de IA de empresas tecnológicas. Como parte de Toloka, trabaja con redactores, editores, especialistas en control de calidad, científicos y otros expertos en la materia que ayudan a generar datos de entrenamiento, evaluar la seguridad y el razonamiento de los modelos, valorar la calidad de los contenidos multimedia y crear escenarios del mundo real para mejorar el rendimiento y la fiabilidad de la IA. Mindrift selecciona y verifica a los colaboradores mediante evaluaciones y comprobación de identidad, y luego ofrece oportunidades flexibles de proyectos remunerados relacionados con el entrenamiento y la evaluación de IA.

Ingeniero/a sénior de scraping de datos en Python — remoto en Japón

Desarrolla flujos fiables de scraping web en Python para el proyecto Tendem AI de Mindrift. Extrae, valida y escala conjuntos de datos estructurados desde sitios web complejos y dinámicos.

Descripción

  • Liderar la extracción de datos de principio a fin en sitios web complejos
  • Entregar conjuntos de datos estructurados completos, precisos y fiables
  • Utilizar herramientas disponibles y flujos de trabajo personalizados para acelerar la recopilación, validación y ejecución de tareas
  • Extraer datos de fuentes dinámicas e interactivas, incluido contenido renderizado con JavaScript
  • Ajustar los métodos de scraping a medida que cambia el comportamiento de los sitios web
  • Mantener la calidad de los datos mediante validación, comprobaciones entre fuentes, estándares de formato y verificación sistemática
  • Escalar el scraping de grandes volúmenes mediante procesamiento por lotes eficiente o procesamiento paralelo
  • Supervisar los fallos y preservar la estabilidad ante cambios menores en la estructura de los sitios
  • Aplicar Apify, OpenRouter y otras tecnologías a la extracción y el procesamiento web

Requisitos

  • Al menos 5 años de experiencia relevante en ingeniería de datos, scraping web, automatización o desarrollo de software
  • Se valorará una licenciatura o maestría en Ingeniería, Matemáticas Aplicadas, Ciencias de la Computación u otro campo técnico relacionado
  • Sólida experiencia en scraping con Python usando BeautifulSoup, Selenium o herramientas similares, contenido dinámico como JavaScript, AJAX y desplazamiento infinito, y API accedidas mediante proxies
  • Capacidad para extraer datos de estructuras complejas, incluidas jerarquías, páginas archivadas y HTML inconsistente
  • Sólida experiencia en limpieza, normalización y validación de datos, con experiencia entregando conjuntos de datos en CSV, JSON o Google Sheets
  • Experiencia gestionando mecanismos antibot y estructuras dinámicas de sitios a gran escala
  • Experiencia con AWS o infraestructura en la nube equivalente
  • Experiencia utilizando Docker para la contenerización
  • Experiencia práctica con frameworks de LLM como LangChain, OpenRouter o herramientas similares para la automatización
  • Gran atención al detalle y compromiso con la precisión de los datos
  • Enfoque autónomo, con capacidad para resolver problemas de forma independiente
  • Nivel de inglés intermedio alto (B2) o superior
  • Se valorará incluir un enlace a GitHub

Beneficios

  • Oportunidad de trabajo freelance
  • Trabajo a tiempo parcial, estimado en aproximadamente 10–20 horas semanales durante las fases activas
  • Trabajo remoto
  • Oportunidad de contribuir a proyectos innovadores de tecnología y desarrollo de inteligencia artificial

Empleos relacionados