[주요업무] 1. 데이터 파이프라인 설계 및 구축 정형·비정형 데이터를 안정적으로 수집·처리·저장할 수 있는 데이터 파이프라인을 설계하고 구축합니다. - Python, SQL, Spark 기반 ETL·ELT 파이프라인 개발 - Batch, CDC, Streaming 방식의 데이터 수집 및 적재 체계 구축 - 대용량 데이터 처리, 파티셔닝, 병렬처리 및 성능 최적화, 데이터 처리 오류 분석, 재처리 및 모니터링 체계 구축 2. 비정형 데이터 및 AI 검색 환경 구축 문서, 이미지, PDF 등 비정형 데이터를 AI 검색 및 RAG 서비스에서 활용할 수 있도록 처리합니다. - 문서 수집, 파싱, 정제 및 표준화 파이프라인 구축 - 문서 구조를 고려한 Chunking 및 메타데이터 생성 - Embedding 생성 및 Vector DB·Vector Search 연계 3. AI 서비스 및 업무 시스템 데이터 연계 AI 서비스가 업무 데이터를 안전하고 일관된 방식으로 활용할 수 있도록 데이터 연계 체계를 구축합니다. - 데이터베이스 및 업무 API 기반의 실시간 데이터 조회 구조 설계 - AI Agent, RAG 및 업무 시스템 간 데이터 제공 구조 설계 - 데이터 인터페이스 표준, 오류 처리, 재처리 및 이력 관리 체계 구축
※부서소개: 데이터거버넌스팀은 전사 데이터 품질과 AI 활용 기반을 책임지는 조직입니다. 정형·비정형 데이터를 통합 관리하고 AI Ready Data를 구축하여 생성형 AI, AI Agent, 데이터 기반 의사결정을 지원합니다. 데이터 라이프사이클 전반을 아우르는 핵심 조직으로서 삼성카드의 AI 전환을 주도하고 있습니다.
[자격요건] - 학사 이상/ 컴퓨터공학, 소프트웨어공학 관련 전공 우대 - 총 경력 8년 이상 ※ 석/박사 학위취득(예정)자의 경우 수학기간을 경력기간으로 인정합니다. - 경력기간 중 데이터 엔지니어링, 데이터 플랫폼 구축·운영, 정형/비정형 데이터 처리 및 데이터 파이프라인 설계·개발 관련 경험 5년 이상
<전문지식> - 문서, PDF, 이미지 등 비정형 데이터 처리 및 Python, SQL 기반 개발 경험 - ETL·ELT, Batch, CDC, Streaming 구조에 대한 이해
<우대사항> - 금융권 또는 대규모 엔터프라이즈 데이터 플랫폼 구축 경험 - 프로젝트 아키텍처 수립 및 유관부서·협력사 기술 협업 경험