Careers
KO

Data Scientist

AI / Engineering 정규직 NAVER 1784 - D2SF / 분당 정자동 ~ 2026-09-30 마감

주요 업무

  • 1) 데이터 구조 분석 및 모델링
  • PostgreSQL, MySQL, Aurora, RDS, Redshift 등 고객 데이터 소스를 분석 후 AI 활용이 가능한 구조로 설계
  • 대용량 SQL 데이터를 row/table 중심에서 object/document/feature/metadata 중심 구조로 변환하는 데이터 모델링
  • 2) 데이터 수집 및 저장 전략
  • Snapshot, CDC, batch 등 수집 방식 요구사항 정의 및 데이터 정합성 검증 로직 설계
  • Parquet, Iceberg, object storage 기반 저장 구조 및 partitioning 전략 수립
  • 3) 데이터 신뢰성 및 품질 관리
  • 원본 데이터의 PK, FK, schema, lineage, provenance, timestamp, operation log 등을 활용해서 추적 가능한 데이터 구조 설계
  • AI-ready dataset 생성을 위한 정제, 스키마 매핑, semantic enrichment, entity relationship 보존 전략 수립
  • 품질 검증, reconciliation, duplicate detection, null/type/timezone/schema drift 검증 기준 정의
  • 4) 협업 및 프로젝트 수행
  • 백엔드, 데이터 엔지니어, AI 엔지니어와 협업하여 SynTitan ingestion pipeline 및 AI-ready data layer 고도화
  • PoC/Demo/실제 구축 프로젝트에서 데이터 변환 전략 수립 및 검증 리포트 작성

자격 요건

  • 데이터 사이언스/엔지니어링/백엔드 데이터 처리 경력 3년 이상
  • SQL 및 관계형 데이터베이스 구조에 대한 깊은 이해
  • PostgreSQL, MySQL 등 RDBMS의 table, schema, index, PK/FK, join 구조 분석 가능한 분
  • Python 기반 데이터 처리, 변환, 검증 자동화 경험
  • Pandas, PySpark, SQLAlchemy, dbt, Airflow 중 1개 이상 활용 경험
  • 대용량 데이터 처리시 발생하는 성능, 정합성, 중복, schema drift 문제에 대한 이해
  • 정형 데이터를 AI/LLM/RAG/Agent 활용 가능 형태로의 전환에 관심도, 이해도 높은 분
  • 데이터 품질, 재현성, 감사 추적성, lineage 관리의 중요성을 이해하는 분
  • 백엔드/AI/인프라 팀과 협업해 요구사항을 구조화, 문서화하는 역량 보유

우대 사항

  • 1) 데이터 인프라 및 아키텍처 경험
  • CDC, Debezium, Kafka, AWS DMS, logical replication 등 변경 데이터 수집 구조 이해·경험
  • Parquet, Iceberg, Delta Lake 등 데이터레이크 설계 또는 운영 경험
  • Lineage, metadata catalog, schema registry, data quality framework 구축 경험
  • 2) 대용량 데이터 처리 경험
  • Spark, PySpark, Trino, DuckDB 등을 활용한 대용량 데이터 처리 경험
  • AWS 환경(S3, RDS, Aurora, Redshift, Glue, Athena, EMR) 활용 경험
  • 3) 데이터 변환 및 AI 활용 경험
  • RDB 데이터를 JSON, document, key-value, feature store, vector DB 등으로 변환한 경험
  • LLM/RAG/Agent 서비스용 데이터 전처리, chunking, metadata 설계 경험
  • 개인정보·민감정보 비식별화, synthetic data, differential privacy 관련 경험
  • 4) 유관 실무 경험
  • 고객사 데이터 구조 분석 및 PoC/구축 프로젝트 수행 경험
  • Claude Code, Cursor 등 AI 코딩 도구로 데이터 처리 코드 생산성을 높인 경험
  • 5) 이런 분을 찾고 있어요
  • 모델 학습보다 기업 데이터를 AI가 쓸 수 있는 구조로 바꾸는 일에 관심있는 분
  • "데이터가 있다" 와 "AI가 사용할 수 있는 데이터다" 의 차이를 이해하는 분
  • SQL table, schema, business context, metadata, lineage를 연결해 사고할 수 있는 분
  • 데이터 정합성, 재현성, 감사 추적성을 중요하게 생각하는 분
  • 고객마다 다른 데이터 구조를 공통 프레임워크로 흡수하는 문제에 흥미를 느끼는 분
  • 연구형보다 제품형, 분석형보다 플랫폼형 문제 해결에 강점이 있는 분
지원하기