교보문고 데이터 파이프라인을 처음 구축하던 시절, 가장 놀랐던 것은 데이터가 얼마나 엉망인 상태로 쌓여있는가였다.
판매 데이터, 재고 데이터, 고객 데이터가 각각 다른 시스템에, 다른 형식으로, 다른 담당자가 관리하고 있었다. 이 데이터로 "AI를 해보자"는 건 모래 위에 집을 짓는 것과 같았다.
AI는 결과물이다. 파이프라인은 기반이다. 기반 없이 결과물을 만들 수 없다.
파이프라인이 없을 때 실제로 벌어지는 일
첫째, 데이터 과학자가 90%의 시간을 데이터 정제에 쓴다
데이터 과학자의 업무를 조사한 연구들은 공통적으로 말한다. 실제 모델링에 쓰는 시간은 전체의 10-20%에 불과하다. 나머지는 데이터를 찾고, 합치고, 정제하고, 검증하는 데 쓴다.
파이프라인이 없으면 이 작업이 매번 반복된다. 분석할 때마다 처음부터 다시. 모델을 업데이트할 때마다 처음부터 다시.
둘째, 모델 결과를 신뢰할 수 없다
입력 데이터의 품질이 보장되지 않으면 모델 출력도 신뢰할 수 없다. 어느 날 갑자기 예측 정확도가 떨어지는데, 데이터가 바뀐 건지 모델이 문제인지 알 수 없다.
금융권 신용평가 모델을 운영할 때 가장 중요하게 봤던 것도 이것이었다. 모델 성능보다 데이터 품질의 일관성. 데이터가 흔들리면 아무리 좋은 모델도 흔들린다.
셋째, 실시간 의사결정이 불가능하다
AI를 도입하는 가장 큰 이유 중 하나는 실시간 의사결정이다. 개인화 추천, 실시간 사기 탐지, 동적 가격 책정.
그런데 데이터가 하루에 한 번 배치로 업데이트된다면? 실시간 AI는 불가능하다. 파이프라인의 레이턴시가 AI의 응답 속도를 결정한다.
파이프라인을 먼저 만들어야 하는 이유
파이프라인은 한 번 잘 만들면 이후 모든 AI 프로젝트의 속도를 높인다.
좋은 파이프라인이 갖춰진 조직의 데이터 팀은 새로운 분석 요청이 들어오면 며칠 안에 결과를 낼 수 있다. 파이프라인이 없는 조직의 데이터 팀은 같은 요청에 몇 주를 쓴다.
그리고 파이프라인을 먼저 만드는 과정에서 조직은 스스로 어떤 데이터를 어떻게 쓰고 싶은지를 명확히 하게 된다. 이 과정 자체가 AI 전략을 구체화하는 데 도움이 된다.
어디서부터 시작해야 하는가
모든 데이터를 완벽하게 파이프라인으로 만들 필요는 없다. 처음부터 완벽을 추구하면 아무것도 못 한다.
임팩트가 가장 큰 데이터 소스 하나를 골라서 시작하라.
판매 데이터가 가장 중요한가? 거기서 시작해라. 고객 행동 데이터가 핵심인가? 그것부터 표준화하라.
핵심 데이터 하나가 제대로 흐르기 시작하면, 그 다음은 훨씬 빠르게 확장된다. 파이프라인은 네트워크 효과가 있다.
"AI를 하고 싶다"고 할 때, 내가 먼저 묻는 질문은 항상 같다.
"지금 데이터가 어디에, 어떤 형태로, 누구에 의해 관리되고 있나요?"
이 질문에 명확하게 대답할 수 없다면, AI보다 파이프라인이 먼저다.