Data Engineering (5년 이상)
주요업무
-
레이크하우스 위에 변환·모델링 레이어를 설계하고 구현합니다.
-
자주 반복되는 데이터 조회를 도구로 만들어, 필요한 사람이 직접 뽑아 쓰게 합니다.
-
CDC 파이프라인을 운영하며 대상 도메인을 넓히고, 스키마 진화·백필·재처리를 안전하게 수행합니다.
-
파이프라인을 오케스트레이션하고, 지연·처리량·안정성을 측정해 개선합니다.
-
파티셔닝·파일 포맷·쿼리 최적화로 조회 성능과 비용을 개선합니다.
-
데이터를 쓰는 사람들과 직접 이야기해 무엇이 필요한지 정의합니다.
-
AI로 데이터 맥락 파악과 변환 로직·문서 작업을 처리합니다.
기술 스택
-
파이프라인 : Kafka, Flink CDC, Airflow
-
스토리지·쿼리 : Iceberg, Athena, Druid, OpenSearch, Aurora MySQL·PostgreSQL, DynamoDB, Redis
-
분석·시각화 : Superset, Grafana
-
클라우드 : AWS
-
컨테이너·오케스트레이션 : ECS, EKS, k3s, Helm
-
IaC·CI/CD : Terraform, AWS CDK, Atlantis, GitHub Actions, ArgoCD
-
언어 : Python, Kotlin/Java, SQL
-
관측·운영 : Datadog, Prometheus, CloudWatch
-
협업 관련 : Git, Asana, Slack, Confluence
자격요건
-
프로덕션 데이터 파이프라인을 설계·운영한 경험이 있는 분
-
데이터 모델링에 강한 분. 원천 데이터를 쓰기 좋은 형태로 재구성하는 판단을 해 본 경험이 있는 분
-
배치 또는 스트리밍 파이프라인 중 최소 하나를 직접 책임지고 운영한 경험이 있는 분
-
스키마 변경·백필·재처리를 서비스 영향 없이 수행한 사례를 설명할 수 있는 분
-
Python 또는 JVM 계열 언어로 데이터 처리 코드를 작성할 수 있고, SQL에 능숙한 분
-
데이터를 쓰는 비개발자를 고객으로 보고, 그들이 직접 쓸 수 있는 형태까지 만들어 본 분
-
AI를 데이터 작업에 쓰고 있고, 그 결과를 어떻게 검증하는지 본인의 기준을 설명할 수 있는 분
우대사항
-
사용자 세그멘테이션·타겟팅 체계나 피처 스토어를 만들어 본 경험이 있는 분
-
dbt 등으로 변환 레이어와 테스트를 체계화한 경험이 있는 분
-
CDC(Debezium, Flink CDC)와 Kafka 기반 스트리밍 파이프라인을 운영한 경험이 있는 분
-
Iceberg·Delta·Parquet 등 레이크하우스 테이블 포맷 경험이 있는 분
-
순서 역전·중복·지연 같은 운영 난제를 직접 진단하고 해결한 경험이 있는 분
-
자연어 질의를 쿼리로 바꾸는 층이나 AI 기반 데이터 탐색 도구를 만들어 본 경험이 있는 분
-
Druid·OpenSearch·Athena 등 분석 엔진의 쿼리·비용을 최적화한 경험이 있는 분
-
Kotlin/Spring 기반 백엔드 코드를 읽고 소스 시스템의 도메인을 이해할 수 있는 분
필수 제출 서류
- 자유양식 이력서, 자기소개서 (지원동기 및 입사 후 기여할 수 있는 점)
- 필수 서류 미제출 시, 서류 전형 불합격됩니다.
이런 이야기를 담아주시면 좋아요
-
다른 기업이 아닌 ‘마카롱팩토리’에 지원한 이유 (진정성 있는 이유는 서로를 더 잘 이해하는 데 큰 도움이 됩니다.)
-
주도적으로 실행한 경험 (성공 사례뿐만 아니라 실패, 작은 시도도 괜찮아요. 실행 과정과 인사이트, 결과를 설명해 주세요.)
-
‘나’였기에 가능했던 성과
합류 여정
-
서류 전형 > 1차 기술 인터뷰 > (필요 시) 과제 전형 > 2차 최종 인터뷰 > (필요 시) 레퍼런스 체크 > 처우 협상 및 최종 합격
-
포지션 및 비즈니스 상황에 따라 변경될 수 있으며, 사전에 안내드립니다.
*자세한 내용은 합류 여정 페이지를 참고해 주세요.
*채용 시 마감될 수 있습니다. 빠른 지원을 권장드립니다.