포스트

LINE 「기획서 없이 내재화하기: 검증 로직으로 동일함을 증명하다」 리뷰 — 블랙박스는 입력과 출력만 정의하면 통계로 같음을 증명할 수 있다

원문: 기획서 없이 내재화하기: 검증 로직으로 동일함을 증명하다 — LY Corporation Tech Blog, 장효택(LINE Plus Global E-Commerce), 2026-03-20

한 줄 요약

외부 시스템에 의존하던 모듈을 내재화하는데 기획서도 없고 기존 코드도 볼 수 없는 블랙박스였다. “우리가 만든 것이 기존과 정말 같은가”에 답하려면 코드가 아니라 같음을 증명하는 시스템이 필요했다. 뼈대는 하나다. 트리거(CDC·요청·파일 수신을 Kafka로 비동기 전파) → 실행·비교(같은 입력을 양쪽에 주입해 산출물 대조) → 가공·적재(불일치를 OpenSearch에 쌓고 ksqlDB로 실시간 집계해 Slack 알림) → 분석·개선(대시보드 보고 고치고 다시). 이 루프를 조회 API(응답 필드 100개 이상), 통계 업데이트(비동기 시차와 트리거 누락), 수신 파이프라인 E2E(SKU + merchantUpdateDate로 스냅숏 키) 세 케이스에 적용해 불일치를 0으로 수렴시켰다.

배경: 상품·카탈로그·수신

‘상품’은 판매자가 등록한 개별 아이템(여러 판매자의 ‘iPhone 17’은 각각 별개), ‘카탈로그’는 같은 모델을 묶어 가공된 가치를 주는 상위 객체, ‘수신’은 판매자 파일을 시스템으로 가져오는 첫 관문이다. 수천만 카탈로그와 수억 상품이 얽혀 있어 데이터 하나의 영향이 크고, 하루 수백 번 도는 수신 스케줄까지 사람이 수동으로 검증하는 것은 불가능했다.

뼈대: 입력과 출력을 정의한 검증 루프

검증의 목적은 틀린 곳을 찾는 것이 아니라 개발자가 무엇이 왜 틀렸는지 즉시 파악해 고치고, 전후 차이가 0에 수렴하게 하는 환경이다. 핵심은 “무엇을 넣고 무엇을 비교할 것인가”다. 입력은 양쪽이 같은 상태에서 시작하도록 보장하는 값(같은 ID, 같은 시점 스냅숏, 같은 파일), 출력은 시스템 성격에 따른 최종 산출물(API 응답, DB 갱신 결과, 등록된 상품). 이 둘을 연결하면 내부가 아무리 복잡한 블랙박스라도 통계로 같음을 증명할 수 있고, 불일치가 0에 수렴하는 순간 내재화 완료를 선언한다. Kafka는 대량 트래픽을 중계하면서 검증 로직이 실서비스 성능에 영향을 주지 않게 물리적으로 격리하는 보호막이다.

케이스 1: 조회 API — 순서와 기본값

타사 조회 기능을 옮기는데 사양서·기획서·코드가 전혀 없었고 응답 필드가 100개 넘고 필터·정렬이 얽혀 있었다. 카탈로그 DB의 CDC를 트리거로 삼아 변경이 생길 때마다 기존 API와 신규 API를 호출해 응답을 끊임없이 비교했다. 가장 자주 드러난 것은 모르던 정렬 조건DB 값과 다른 반환 기본값이었다. 정렬을 몰라 순서만 미세하게 어긋나는 경우는 안의 실제 값을 개별 추출해 대조했다.

비교 로직은 응답을 클래스로 매핑하지 않고 Map<String, Object>로 바꿔 재귀 탐색해 필드명 기준으로 값을 대조했다. 그래야 구조가 어떻든 하나의 로직으로 된다. 리스트 순서만 다른데 불일치로 잡히는 것은 따로 처리했다. 불일치는 표준 메시지로 Kafka에 넣고 OpenSearch Connector로 인덱싱하며, ksqlDB로 실시간 집계해 이상 징후를 Slack으로 보낸다. 초기에는 수백만 건이 쏟아졌는데 같은 필드의 중복 오류는 잡음이라 필드당 분당 추출 건수를 제한했다. 부수 효과로 기존·신규 API를 같은 시점에 병렬 호출하니 실트래픽에서 성능 비교가 자연히 됐다.

케이스 2: 통계 업데이트 — 시차와 누락

상품이 변경될 때마다 카탈로그 단위 통계를 갱신하는 로직은 상태 변화를 다룬다. 조회 검증 틀에 ‘통계 시뮬레이션’을 넣어, 카탈로그 필드 변경 CDC가 오면 신규 로직으로 예상값을 미리 계산하고 기존 로직이 DB에 쓴 실제값과 대조했다.

걸림돌은 비동기 지연이었다. 기존 통계 로직과 검증 로직이 모두 Kafka로 비동기라 검증 시점에 기존 로직의 DB 갱신이 아직 안 끝나 일시적 불일치가 빈번했다. 먼저 통계와 무관한 필드 변경은 필터링해 비교 자체를 줄였고, 남는 시차는 N회차 재시도 큐로 풀었다. 불일치면 즉시 오류가 아니라 큐 뒤로 보내 다시 본다. 기존 스트림 끝에 검증을 붙여 지연을 없애는 방법도 고민했지만 기존 스트림에 부하를 줄 수 있어 별도 프로세스로 유지했다.

모든 데이터가 맞아 가던 중 사각지대가 나왔다. 갱신이 일어났어야 하는데 아무 일도 안 일어난 케이스는 비교 로직으로 잡을 수 없다. 감지 로직을 리팩터링하며 트리거가 누락된 것이다. 그래서 실시간과 별개로 Iceberg에 최신화하던 카탈로그 정보에 하루 한 번 쿼리해 모든 카탈로그 통계를 전수 조사하는 배치 검증을 두었고, 실시간이 못 잡은 누락 트리거를 여럿 찾았다. 실시간 검증이 정확도를, 배치 검증이 트리거의 완결성을 확보한 뒤에야 같은 생명 주기로 동작한다고 확신했다.

케이스 3: 수신 파이프라인 — 섀도우와 스냅숏 키

판매자 파일 다운로드부터 유효성 검사와 최종 등록까지 긴 여정이고, 판매자마다 수십 개 필드 중 일부만 보내므로 어떤 조합이 와도 같게 처리하는 것이 목표다. 구조가 같은 신규 파이프라인을 병렬로 띄우고(섀도우), 같은 시점에 같은 판매자 파일을 양쪽이 수집하게 했다.

문제는 상품이 파일로 하루 여러 번, API로도 수시로 바뀌어 조금만 시차가 나도 다른 버전을 비교하게 된다는 것. SKU + merchantUpdateDate를 스냅숏 키로 묶어 각 산출물이 어느 시점 파일에서 나왔는지 특정했다. 초반의 방대한 불일치에는 실제 오류가 아닌 의도된 사양 차이가 섞여 있어 알림에 무뎌질 위험이 있었고, 확인이 끝난 차이와 불필요한 필드는 비교 대상에서 빼는 선택적 필터링을 넣었다. 필드 단위 외에 스케줄별로 유효 건수·오류 건수·단계별 상태 같은 큰 단위 정합성도 비교했다. 테이블 구조가 완전히 달라져 DB 레벨 비교가 불가능했기 때문이다.

도구: 대시보드와 관리자 페이지

OpenSearch의 diff는 로그가 아니라 통계다. 일치 건수가 100%로 수렴하는 추이로 완료 시점을 객관적으로 가늠하고, 오류를 필드·유형별로 그룹화해 100만 건 오류의 원인이 ‘특정 필드 타입 변환’ 하나인 것을 드러내며, 타임라인으로 특정 배포나 외부 변화의 영향을 추적한다. 관리자 페이지는 필드 100개 중 원하는 것만 검색하거나 값이 다른 것만 보고, 불일치는 붉은색·순서만 다른 것은 노란색으로 보여 주며, 카탈로그 ID로 신규 통계를 시뮬레이션하고, 수신 단계별 상태와 상품 수를 좌우로 비교한다. 예전엔 프런트엔드를 따로 배워야 했지만 이제 AI 덕에 간단한 관리자 페이지는 쉽게 만들 수 있으니, 수천만 건을 검증하는 장기 관점에서 초기에 전용 도구를 만드는 것이 압도적으로 효율적이라고 한다.

읽고 남는 질문

  • “0에 수렴”의 마지막 단계에서 남은 불일치를 어떻게 처리했는지가 없다. 기존 시스템의 버그였던 것(재현하지 않기로 한 것)과 의도적 개선의 목록이 있으면 “동일함”의 정의가 완결된다.
  • 조회 검증은 CDC 트리거라 변경이 없는 카탈로그는 검증되지 않는다. 오래 변경되지 않은 데이터의 조회 동일성은 별도 샘플링으로 확인했는지 궁금하다.
  • 섀도우 파이프라인을 병렬로 돌리는 비용(수신 처리량이 두 배)과 기간이 얼마였는지, 그리고 최종 전환(컷오버) 방식이 무엇이었는지가 있으면 재현에 도움이 된다.

한 줄로 가져가기

사양 없는 내재화의 답은 사양을 복원하는 것이 아니라 같은 입력을 양쪽에 넣고 출력을 통계로 대조하는 루프를 만드는 것이다. 그 루프에는 비동기 시차를 견디는 재시도, 잡음을 줄이는 rate limit과 필드 필터, 그리고 “아무 일도 안 일어난 것”을 잡는 전수 배치가 있어야 한다.

시리즈

빅테크 기술 블로그 리뷰

31편 중 11편

  1. 1 카카오 「실시간 메시징 시스템 개발기」(3편) 리뷰 — Redis에 몰린 부하를 서버로 옮기고, 그 서버를 pprof로 세 번 깎은 이야기
  2. 2 카카오 「추가배포 없이 API의 case 통일시키기」 리뷰 — 받는 쪽이 자기 케이스에 맞춰 알아서 읽게 하면 배포 순서가 사라진다
  3. 3 카카오 「MySQL DATETIME, TIMESTAMP 데이터 타입에 대한 분석」 리뷰 — 바이트 단위 저장 구조부터 아직 안 고쳐진 Y2K38까지
  4. 4 네이버 D2 「6개월 만에 연간 수십조를 처리하는 DB CDC 복제 도구 무중단/무장애 교체하기」 리뷰 — 복제·검증·복구를 셋으로 나누고, 옛 도구와 새 도구를 서로 모르게 같이 돌린 전환
  5. 5 카카오 「MySQL ALTER DDL 수행 방식에 대한 이해」 리뷰 — Copy·In-Place·Instant는 '무엇을 복사하느냐'보다 '언제 Exclusive 메타 락을 잡느냐'로 구분된다
  6. 6 카카오 「MySQL Orchestrator 기반의 새로운 HA 표준 개발기」 리뷰 — 10년 멈춘 Perl 도구를 떠나 Raft 클러스터로, 그리고 slave_net_timeout 한 줄
  7. 7 카카오 「MySQL Ver. 8.0 New Feature: Instant DDL Algorithm에 대한 이해」 리뷰 — 컬럼을 0.01초에 추가하는 대가는 '읽을 때마다 버전을 대조하는 것'이다
  8. 8 네이버 D2 「CDC 복제 이후 오라클이 느려졌다? child cursor 폭증이 만든 예상치 못한 문제」 리뷰 — 같은 SQL인데 바인딩 타입이 다르면 Oracle은 다른 쿼리로 본다
  9. 9 카카오 「MySQL InnoDB Log에 대한 이해 - (1)」 리뷰 — 트랜잭션 하나가 어떻게 MTR 여러 개로 쪼개져 Redo Log Buffer에 들어가는가
  10. 10 카카오 「PostgreSQL to ES: Kafka Connect CDC 파이프라인」 1·2편 리뷰 — 변경이 없어서 디스크가 차고, LSN이 사라져서 스냅샷을 다시 짜야 했던 CDC의 실제 운영 비용
  11. 11 LINE 「기획서 없이 내재화하기: 검증 로직으로 동일함을 증명하다」 리뷰 — 블랙박스는 입력과 출력만 정의하면 통계로 같음을 증명할 수 있다
  12. 12 뱅크샐러드 「게임을 만들 때 데이터 정합성을 유지하는 법 (feat. 낙관적 락)」 리뷰 — 같은 WHERE version 조건인데, 충돌한 요청을 어떻게 하는가에서 갈리는 두 설계
  13. 13 우아한형제들 「Spring Batch와 Querydsl」 리뷰 — offset을 버린 Reader가 21분을 4분으로 만든 이유, 그리고 그 Reader가 답하지 않는 두 가지
  14. 14 네이버 D2 「테스트는 어떻게 좋은 코드를 만드는가(feat. 험블 객체 패턴)」 리뷰 — 목이 많아지는 것은 테스트의 문제가 아니라 설계의 신호
  15. 15 당근 「QR을 찍으면 무슨 일이 벌어질까? 당근페이 현장 결제의 모든 것」 리뷰 — 카드망을 빌려 7주 만에 낸 결제와, 그 글이 다루지 않은 승인 응답이 사라지는 순간
  16. 16 네이버 D2 「스마트스토어센터 Oracle에서 MySQL로의 무중단 전환기」 리뷰 — 두 DB에 동시에 쓰되 한쪽 실패는 무시하고, 읽기 트래픽을 복제해 성능을 재고, 6개월간 불일치를 0으로 만든 과정
  17. 17 야놀자 「RESTful API validation 자동화 하기」 리뷰 — 인터페이스 하나에서 검증·문서·타입을 뽑는 이유, 그리고 자동화가 없으면 누락이 필연이라는 문장
  18. 18 카카오 「MySQL Json 데이터 타입의 저장 구조와 성능 비교」 리뷰 — 통째로 넣고 통째로 꺼내면 TEXT, 키로 파고들면 JSON
  19. 19 LINE 「도메인에 의존하지 않는 채팅 플랫폼은 어떻게 만들었을까?」 리뷰 — 사용자를 모르는 채팅 플랫폼, 웹으로 만든 클라이언트, SOFT STOP으로 갈아 끼우는 챗봇 시나리오
  20. 20 카카오페이 「MSA 환경에서 네트워크 예외를 잘 다루는 방법」 리뷰 — Unknown을 타입으로 만든 글과, Unknown을 상태로 저장한 프로젝트가 갈리는 지점
  21. 21 카카오 「메시징 서버의 스트레스 테스트 노하우와 AI가 덜어 준 부분」 리뷰 — 지표를 네 층으로 내려가 읽는 법, 그리고 LLM에게 맡긴 것과 맡기지 못한 것
  22. 22 네이버 D2 「일 3,000만 건의 네이버페이 주문 메시지를 처리하는 Kafka 시스템의 무중단 전환 사례」 리뷰 — 두 벌로 발행해 대조한 검증기와, 발행 제어 키를 파티션 키와 같게 둔 이유
  23. 23 카카오 「잃어버린 리포트를 찾아서: 카카오 메시징 시스템의 경쟁 조건 문제와 안티 패턴 제거 과정」 리뷰 — 벤더가 8ms 만에 리포트를 보냈고, 우리는 101ms짜리 트랜잭션 안에 있었다
  24. 24 컬리 「컬리의 입고 시스템이 외부 인입 데이터를 안전하게 동기화하는 방법」 리뷰 — 145회 재시도가 맞는 도메인과 재시도를 금지한 도메인, 그리고 발행부와 수신부가 각자 책임지는 구조
  25. 25 네이버 D2 「@RequestCache: HTTP 요청 범위 캐싱을 위한 커스텀 애너테이션 개발기」 리뷰 — 캐시의 수명을 '요청 하나'로 맞추면 TTL 고민이 사라진다, 그리고 @RequestScope가 안 되는 이유
  26. 26 무신사 「Kafka와 Strimzi를 이용하여 6개의 도메인을 하나의 도메인으로 합쳐보았습니다」 리뷰 — 배치 없이 CDC와 Kafka Streams로 옮긴 결정, 그리고 통합 모델이 원본과 같다는 것을 누가 확인하는가
  27. 27 쿠팡 「대용량 트래픽 처리를 위한 쿠팡의 백엔드 전략」 리뷰 — 캐시 두 겹과 '분 단위 99.99% 동일'이라는 문장, 그리고 그 0.01%를 누가 어떻게 세는가
  28. 28 LINE 「LINE에서 Kafka를 사용하는 방법 - 1편」 리뷰 — 초당 4GB 클러스터가 바이트가 아니라 요청 수를 제한하는 이유, 그리고 2,000틱짜리 파이프라인에서 같은 것을 본 기록
  29. 29 카카오 「MySQL 인증 플러그인 caching_sha2_password에 대한 이해」 리뷰 — 비밀번호 해시가 바뀌는 것보다 '평문이 서버까지 가야 한다'는 점이 전환의 진짜 비용
  30. 30 LINE 「초당 100만 건, LINE 앱에 Apache Kafka 종단 간 암호화 적용기」 리뷰 — 인터셉터와 시리얼라이저만으로 브로커에 평문을 남기지 않는 법
  31. 31 카카오뱅크 「하루 N억 건의 알림 시스템 구축기 (1)」 리뷰 — P99의 80%가 대기였다는 진단, Age 기반 Work-Stealing, 그리고 큐를 나누는 순간 순서를 잃는 문제
이 기사는 저작권자의 CC BY 4.0 라이센스를 따릅니다.

댓글

아직 댓글이 없습니다