Mindrift
Mindrift
Mindrift ir mākslīgā intelekta talantu tirgus un SaaS platforma, kas savieno profesionālus darba veicējus un konkrētu jomu ekspertus ar tehnoloģiju uzņēmumu mākslīgā intelekta apmācības un novērtēšanas projektiem. Kā Toloka daļa tā sadarbojas ar rakstniekiem, redaktoriem, kvalitātes nodrošināšanas speciālistiem, zinātniekiem un citiem jomu ekspertiem, kuri palīdz veidot apmācības datus, novērtēt modeļu drošību un spriestspēju, izvērtēt multivides kvalitāti un radīt reālās pasaules scenārijus mākslīgā intelekta veiktspējas un uzticamības uzlabošanai. Mindrift piesaista un pārbauda darba veicējus, izmantojot novērtējumus un identitātes verifikāciju, pēc tam piedāvājot elastīgas, apmaksātas projektu iespējas mākslīgā intelekta apmācības un novērtēšanas jomā.

Vecākais Python tīmekļa datu ieguves inženieris — attālināts darbs Saūda Arābijā

Vecākais Python inženieris izstrādā uzticamas tīmekļa datu ieguves un datu apstrādes darbplūsmas Mindrift Tendem AI projektam. Šis amats ir vērsts uz strukturētu datu kopu iegūšanu, validēšanu un mērogošanu no sarežģītām tīmekļa vietnēm.

Apraksts

  • Vadīt pilnas datu ieguves darbplūsmas sarežģītās tīmekļa vietnēs
  • Nodrošināt visaptverošu pārklājumu, precīzus rezultātus un uzticamu strukturētu datu kopu piegādi
  • Izmantot pieejamos rīkus un pielāgotas darbplūsmas, lai paātrinātu datu vākšanu, validēšanu un uzdevumu izpildi
  • Konsekventi iegūt datus no dinamiskiem un interaktīviem tīmekļa avotiem
  • Pielāgot ieguves metodes JavaScript renderētam saturam un mainīgai tīmekļa vietņu darbībai
  • Aizsargāt datu kvalitāti ar validācijas pārbaudēm, dažādu avotu salīdzināšanu, formatēšanas noteikumiem un sistemātisku pārbaudi
  • Mērogot liela apjoma datu ieguvi, izmantojot efektīvu pakešu apstrādi vai paralēlo apstrādi
  • Sekot kļūmēm un saglabāt darbplūsmas stabilitāti, neraugoties uz nelielām tīmekļa vietnes struktūras izmaiņām
  • Izmantot Apify, OpenRouter un saistītās tehnoloģijas tīmekļa datu ieguves un datu apstrādes darbplūsmās

Prasības

  • Vismaz 5 gadu atbilstoša pieredze datu inženierijā, tīmekļa datu ieguvē, automatizācijā vai programmatūras izstrādē
  • Vēlama bakalaura vai maģistra grāds inženierzinātnēs, lietišķajā matemātikā, datorzinātnēs vai saistītā tehniskā jomā
  • Padziļināta Python tīmekļa datu ieguves pieredze, tostarp ar BeautifulSoup, Selenium vai salīdzināmiem rīkiem, dinamisku saturu un uz starpniekserveriem balstītām API
  • Spēja iegūt informāciju no sarežģītām struktūrām, piemēram, hierarhijām, arhivētām lapām un nekonsekventa HTML
  • Pieredze datu tīrīšanā, normalizēšanā un validēšanā, lai tos piegādātu CSV, JSON vai Google Sheets formātā
  • Praktiska pieredze darbā ar pretdatu ieguves sistēmām un mainīgām vietņu struktūrām lielā mērogā
  • Pieredze ar AWS vai līdzvērtīgu mākoņinfrastruktūru
  • Pieredze lietojumprogrammu iepakošanā, izmantojot Docker
  • Praktiska LangChain, OpenRouter vai līdzīgu LLM ietvaru izmantošana automatizācijas uzdevumos
  • Liela uzmanība detaļām un konsekventa koncentrēšanās uz datu precizitāti
  • Spēja strādāt patstāvīgi, pašam organizēt uzdevumus un novērst problēmas
  • Angļu valodas zināšanas vismaz vidēji augstākajā līmenī (B2)
  • GitHub profils tiks uzskatīts par priekšrocību

Priekšrocības

  • Nepilna laika ārštata darbs
  • Aktīvajos projekta posmos aptuveni 10–20 stundas nedēļā
  • Līdz 37 ASV dolāru ekvivalentam stundā atkarībā no ieguldījuma līmeņa un darba tempa
  • Elastīga uz projektiem balstīta darba slodze, kur atlīdzība mainās atkarībā no apjoma, sarežģītības un nepieciešamās kompetences
  • Iespēja atbalstīt tehnoloģiju un mākslīgā intelekta izstrādes projektus

Saistītās vakances