CATEGORY / DATA-PIPELINE
Data Pipeline
데이터가 흐르는 전 과정을 설계한다
수집, 메시징, 분산 처리, lakehouse와 품질 관리를 나눠 데이터가 소비자에게 도달하는 전체 경로를 기록합니다.
- Subtopics
- 05
- Published
- 00
Data FlowKafka / MQSparkIcebergData Quality
Topic tree / 05
세부 주제를 선택합니다
01 / 00 logsStart here
Flow Fundamentals
데이터 흐름의 기본 계약부터 고정한다source와 sink, batch와 stream, ordering, backpressure와 전달 보장을 먼저 이해합니다.
세부 주제 보기 ↗02 / 00 logsNext
Event & Messaging
메시지를 전달하고 다시 처리할 수 있어야 한다Kafka와 메시지 큐의 소비 방식, 보존 모델, 순서와 재처리 가능성을 비교합니다.
세부 주제 보기 ↗03 / 00 logsPlanned
Distributed Processing
분산 처리의 비용은 데이터 이동에서 드러난다Spark를 중심으로 partition, shuffle, 병렬 처리와 장애 복구를 학습합니다.
세부 주제 보기 ↗04 / 00 logsPlanned
Lakehouse & Table Format
파일 묶음에 트랜잭션과 진화를 더한다Iceberg가 snapshot, schema와 partition evolution을 제공하는 방식을 봅니다.
세부 주제 보기 ↗05 / 00 logsPlanned
Orchestration & Quality
파이프라인을 반복 실행 가능한 운영 단위로 만든다스케줄, lineage, schema contract와 품질 검증을 하나의 운영 흐름으로 연결합니다.
세부 주제 보기 ↗Published logs / 00
카테고리 전체 공개 기록
이 카테고리는 탐구 중입니다. 직접 확인을 마친 글부터 공개합니다.