레이크하우스 모델링과 데이터 파이프라인 설계 및 운영을 담당해요. 프로덕션 파이프라인 운영 경험과 데이터 모델링 역량이 필수이며, 배치나 스트리밍 중 하나를 책임지고 운영해 본 경험이 있어야 해요. Python 또는 JVM 언어와 SQL 활용 능력이 필요하며, AI를 활용한 데이터 작업 검증 기준을 설명할 수 있어야 해요. 비개발자를 위한 데이터 도구 제작 경험을 요구해요.
레이크하우스 위에 변환·모델링 레이어를 설계하고 구현합니다.
자주 반복되는 데이터 조회를 도구로 만들어, 필요한 사람이 직접 뽑아 쓰게 합니다.
CDC 파이프라인을 운영하며 대상 도메인을 넓히고, 스키마 진화·백필·재처리를 안전하게 수행합니다.
파이프라인을 오케스트레이션하고, 지연·처리량·안정성을 측정해 개선합니다.
파티셔닝·파일 포맷·쿼리 최적화로 조회 성능과 비용을 개선합니다.
데이터를 쓰는 사람들과 직접 이야기해 무엇이 필요한지 정의합니다.
AI로 데이터 맥락 파악과 변환 로직·문서 작업을 처리합니다.
파이프라인 : Kafka, Flink CDC, Airflow
스토리지·쿼리 : Iceberg, Athena, Druid, OpenSearch, Aurora MySQL·PostgreSQL, DynamoDB, Redis
분석·시각화 : Superset, Grafana
클라우드 : AWS
컨테이너·오케스트레이션 : ECS, EKS, k3s, Helm
IaC·CI/CD : Terraform, AWS CDK, Atlantis, GitHub Actions, ArgoCD
언어 : Python, Kotlin/Java, SQL
관측·운영 : Datadog, Prometheus, CloudWatch
협업 관련 : Git, Asana, Slack, Confluence
프로덕션 데이터 파이프라인을 설계·운영한 경험이 있는 분
데이터 모델링에 강한 분. 원천 데이터를 쓰기 좋은 형태로 재구성하는 판단을 해 본 경험이 있는 분
배치 또는 스트리밍 파이프라인 중 최소 하나를 직접 책임지고 운영한 경험이 있는 분
스키마 변경·백필·재처리를 서비스 영향 없이 수행한 사례를 설명할 수 있는 분
Python 또는 JVM 계열 언어로 데이터 처리 코드를 작성할 수 있고, SQL에 능숙한 분
데이터를 쓰는 비개발자를 고객으로 보고, 그들이 직접 쓸 수 있는 형태까지 만들어 본 분
AI를 데이터 작업에 쓰고 있고, 그 결과를 어떻게 검증하는지 본인의 기준을 설명할 수 있는 분
사용자 세그멘테이션·타겟팅 체계나 피처 스토어를 만들어 본 경험이 있는 분
dbt 등으로 변환 레이어와 테스트를 체계화한 경험이 있는 분
CDC(Debezium, Flink CDC)와 Kafka 기반 스트리밍 파이프라인을 운영한 경험이 있는 분
Iceberg·Delta·Parquet 등 레이크하우스 테이블 포맷 경험이 있는 분
순서 역전·중복·지연 같은 운영 난제를 직접 진단하고 해결한 경험이 있는 분
자연어 질의를 쿼리로 바꾸는 층이나 AI 기반 데이터 탐색 도구를 만들어 본 경험이 있는 분
Druid·OpenSearch·Athena 등 분석 엔진의 쿼리·비용을 최적화한 경험이 있는 분
Kotlin/Spring 기반 백엔드 코드를 읽고 소스 시스템의 도메인을 이해할 수 있는 분
다른 기업이 아닌 ‘마카롱팩토리’에 지원한 이유 (진정성 있는 이유는 서로를 더 잘 이해하는 데 큰 도움이 됩니다.)
주도적으로 실행한 경험 (성공 사례뿐만 아니라 실패, 작은 시도도 괜찮아요. 실행 과정과 인사이트, 결과를 설명해 주세요.)
‘나’였기에 가능했던 성과
서류 전형 > 1차 기술 인터뷰 > (필요 시) 과제 전형 > 2차 최종 인터뷰 > (필요 시) 레퍼런스 체크 > 처우 협상 및 최종 합격
포지션 및 비즈니스 상황에 따라 변경될 수 있으며, 사전에 안내드립니다.
*자세한 내용은 합류 여정 페이지를 참고해 주세요.