
빅데이터 엔지니어—Python, PySpark 및 Databricks|씨티|푸네 하이브리드 근무
Python, PySpark, Databricks를 활용해 씨티의 글로벌 금융 데이터 인프라를 위한 대규모 데이터 파이프라인을 구축하고 지원합니다. Hadoop, Tableau, Linux 및 엔터프라이즈 분석 제공 전반의 업무를 수행합니다.
설명
- 분산 플랫폼 전반에서 정형 및 비정형 데이터를 처리하는 확장 가능한 Python 및 PySpark 파이프라인을 개발하고 유지 관리한다
- HDFS와 Hive를 포함한 Hadoop 기반 워크플로를 설계하고 개선하여 보고 및 분석에 신뢰할 수 있는 데이터를 제공한다
- 사업 영역 전반의 데이터 엔지니어링 이니셔티브를 위한 타당성 평가, 제공 일정 산정 및 기술 계획을 수립한다
- 분석과 설계부터 테스트, 배포 및 운영 지원까지 데이터 애플리케이션 수명 주기를 관리한다
- 분석 및 보고 팀과 협력하여 Tableau 대시보드를 개발하고 원천 데이터를 유용한 비즈니스 인사이트로 전환한다
- Linux 기반 데이터 프로세스를 관리하고 문제를 해결하여 시스템 안정성, 성능 및 운영 연속성을 유지한다
- 제공 위험을 평가하고 데이터 엔지니어링 솔루션을 보안, 거버넌스 및 규정 준수 요구사항에 맞춘다
지원 자격
- 데이터 엔지니어링, 빅데이터 개발 또는 대규모 데이터 플랫폼에 중점을 둔 소프트웨어 애플리케이션 개발 경력 5~8년을 보유한다
- 대규모 데이터 수집, 변환 및 파이프라인 오케스트레이션을 위한 Python 및 PySpark 실무 개발 경험을 보유한다
- ETL, Oracle Database 및 SQL에 대한 전문가 수준의 지식을 보유한다
- Databricks 실무 지식을 보유한다
- HDFS, Hive 및 클러스터 운영과 같은 Hadoop 생태계 기술을 이해하고 Ozone 스토리지에도 익숙하다
- 스크립팅, 작업 일정 관리 및 프로세스 관리를 활용해 Linux 환경에서 효과적으로 업무를 수행한다
- Tableau 대시보드와 보고서를 생성하거나 지원한 경험이 있다
- 데이터 엔지니어링 환경에서 통계 분석 또는 데이터 탐색에 사용하는 RStudio에 익숙하다
- OpenAI, Gemini, Claude, Llama 및 로컬 또는 오픈 소스 모델을 포함한 대규모 언어 모델에 대한 깊은 전문성을 보유한다
- 관련 기술 분야의 학사 학위 또는 동등한 경험을 보유한다
- 프로젝트를 관리하고 성공적으로 제공한 경험이 있다
- 컨설팅 및 프로젝트 관리 기법과 방법론을 이해한다
- 압박 속에서도 마감일을 준수하며 업무를 수행하고 요구사항이나 기대의 예기치 않은 변화에 적응할 수 있다
- 클라우드 네이티브 데이터 플랫폼 경험 또는 온프레미스 Hadoop 워크로드를 최신 데이터 플랫폼으로 마이그레이션한 경험이 있다
- 대규모 환경에서 사용되는 데이터 거버넌스, 메타데이터 관리 또는 데이터 품질 프레임워크를 이해한다
- 기술 제공에 사용되는 컨설팅 또는 프로젝트 관리 방법론에 익숙하다
복리후생
- 주 2일 사무실 근무와 주 3일 원격 근무를 병행하는 하이브리드 일정
- 지속적인 학습 및 전문성 개발 리소스
- 직접적인 감독이 제한된 상황에서도 기술적 의사결정을 내릴 수 있는 자율성 및 고위 이해관계자의 주제 전문가로 활동할 기회
- 씨티의 글로벌 기술 조직 내에서 명확한 경력 개발 기회
- 근무 지역과 직급에 맞춘 재정적 웰빙 지원 및 복리후생








