Data Scientist
AI / Engineering 정규직 NAVER 1784 - D2SF / 분당 정자동 ~ 2026-09-30 마감
주요 업무
- 1) 데이터 구조 분석 및 모델링
- PostgreSQL, MySQL, Aurora, RDS, Redshift 등 고객 데이터 소스를 분석 후 AI 활용이 가능한 구조로 설계
- 대용량 SQL 데이터를 row/table 중심에서 object/document/feature/metadata 중심 구조로 변환하는 데이터 모델링
- 2) 데이터 수집 및 저장 전략
- Snapshot, CDC, batch 등 수집 방식 요구사항 정의 및 데이터 정합성 검증 로직 설계
- Parquet, Iceberg, object storage 기반 저장 구조 및 partitioning 전략 수립
- 3) 데이터 신뢰성 및 품질 관리
- 원본 데이터의 PK, FK, schema, lineage, provenance, timestamp, operation log 등을 활용해서 추적 가능한 데이터 구조 설계
- AI-ready dataset 생성을 위한 정제, 스키마 매핑, semantic enrichment, entity relationship 보존 전략 수립
- 품질 검증, reconciliation, duplicate detection, null/type/timezone/schema drift 검증 기준 정의
- 4) 협업 및 프로젝트 수행
- 백엔드, 데이터 엔지니어, AI 엔지니어와 협업하여 SynTitan ingestion pipeline 및 AI-ready data layer 고도화
- PoC/Demo/실제 구축 프로젝트에서 데이터 변환 전략 수립 및 검증 리포트 작성
자격 요건
- 데이터 사이언스/엔지니어링/백엔드 데이터 처리 경력 3년 이상
- SQL 및 관계형 데이터베이스 구조에 대한 깊은 이해
- PostgreSQL, MySQL 등 RDBMS의 table, schema, index, PK/FK, join 구조 분석 가능한 분
- Python 기반 데이터 처리, 변환, 검증 자동화 경험
- Pandas, PySpark, SQLAlchemy, dbt, Airflow 중 1개 이상 활용 경험
- 대용량 데이터 처리시 발생하는 성능, 정합성, 중복, schema drift 문제에 대한 이해
- 정형 데이터를 AI/LLM/RAG/Agent 활용 가능 형태로의 전환에 관심도, 이해도 높은 분
- 데이터 품질, 재현성, 감사 추적성, lineage 관리의 중요성을 이해하는 분
- 백엔드/AI/인프라 팀과 협업해 요구사항을 구조화, 문서화하는 역량 보유
우대 사항
- 1) 데이터 인프라 및 아키텍처 경험
- CDC, Debezium, Kafka, AWS DMS, logical replication 등 변경 데이터 수집 구조 이해·경험
- Parquet, Iceberg, Delta Lake 등 데이터레이크 설계 또는 운영 경험
- Lineage, metadata catalog, schema registry, data quality framework 구축 경험
- 2) 대용량 데이터 처리 경험
- Spark, PySpark, Trino, DuckDB 등을 활용한 대용량 데이터 처리 경험
- AWS 환경(S3, RDS, Aurora, Redshift, Glue, Athena, EMR) 활용 경험
- 3) 데이터 변환 및 AI 활용 경험
- RDB 데이터를 JSON, document, key-value, feature store, vector DB 등으로 변환한 경험
- LLM/RAG/Agent 서비스용 데이터 전처리, chunking, metadata 설계 경험
- 개인정보·민감정보 비식별화, synthetic data, differential privacy 관련 경험
- 4) 유관 실무 경험
- 고객사 데이터 구조 분석 및 PoC/구축 프로젝트 수행 경험
- Claude Code, Cursor 등 AI 코딩 도구로 데이터 처리 코드 생산성을 높인 경험
- 5) 이런 분을 찾고 있어요
- 모델 학습보다 기업 데이터를 AI가 쓸 수 있는 구조로 바꾸는 일에 관심있는 분
- "데이터가 있다" 와 "AI가 사용할 수 있는 데이터다" 의 차이를 이해하는 분
- SQL table, schema, business context, metadata, lineage를 연결해 사고할 수 있는 분
- 데이터 정합성, 재현성, 감사 추적성을 중요하게 생각하는 분
- 고객마다 다른 데이터 구조를 공통 프레임워크로 흡수하는 문제에 흥미를 느끼는 분
- 연구형보다 제품형, 분석형보다 플랫폼형 문제 해결에 강점이 있는 분