pile·
백엔드·stackoverflow-blogStack Overflow Blog·

CherryScript — 데이터 파이프라인을 위한 커스텀 Python 인터프리터 설계

CherryScript는 데이터 기반 워크플로우 최적화를 위한 커스텀 DSL로, Python 기반 인터프리터로 구현됐다. 일반 Python 인터프리터의 메모리 병목과 AST 트리워킹 성능 문제를 극복하기 위해 스트리밍 렉서, 바이트코드 컴파일, 불변 상태 관리의 세 가지 최적화 전략을 채택했다.

핵심 포인트
  • Python generator 패턴(yield)을 활용한 스트리밍 지연 렉서로, 전체 소스 파일을 메모리에 로딩하는 기존 렉서의 메모리 병목을 해소했다
  • AST 트리 워킹 방식 대신 플랫 바이트코드 배열(flattened bytecode)로 전환해 O(1) 룩업 시간을 달성했다
  • layered dictionary 기반 스코프 심볼 테이블로 스코프 격리를 구현하면서 기본적으로 불변성을 유지한다
  • 세 가지 최적화(렉서/컴파일러/실행기)가 데이터 파이프라인 워크플로우의 성능 병목을 각 단계에서 독립적으로 해소한다
상세 정리
  • 배경: 데이터 기반 워크플로우에서 Python 일반 인터프리터의 메모리 사용과 AST 트리워킹 실행 병목이 문제로 대두됨
  • 렉서 설계: 전통 렉서는 전체 소스 파일을 메모리에 올린 뒤 처리, CherryScript 렉서는 Python yield 기반 스트리밍으로 필요한 시점에 지연 평가
  • 컴파일러 변환: AST를 재귀적으로 순회하는 방식에서 선형 명령어 배열(flat bytecode array)로 전환, 인덱스 기반 O(1) 랜덤 접근 달성
  • 상태 관리: 기본적으로 불변성 유지 원칙, layered dictionary system으로 스코프별 심볼 테이블을 계층적으로 중첩 관리
  • 메모리 격리: 변경 가능한 깊은 복사(deep copy) 대신 격리된 불변 청크로 메모리 오버헤드 감소
  • 최적화 패턴 정리: 실행(AST 트리워킹 → 플랫 바이트코드) + 렉서(전체 파일 로딩 → 스트리밍 지연 평가) + 메모리(변경 가능 깊은 복사 → 격리된 불변 청크)
왜 읽나Python으로 DSL이나 커스텀 인터프리터를 구현하려는 엔지니어에게 렉서/컴파일러/실행기 각 단계의 최적화 패턴과 실제 설계 결정을 보여준다.
stackoverflow-blog
Stack Overflow Blog 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. 백엔드·twilio-engTwilio Engineering·

    Programmable Messaging에서 Verify API로 마이그레이션하기

    Twilio의 Programmable Messaging API로 자체 OTP 솔루션을 운영하던 서비스가 Verify API로 전환하는 방법을 코드 예시와 함께 설명한다. Verify는 OTP 전송·검증을 위한 전용 API로, 전화번호 구매, 토큰 생성, DB 저장·만료 관리를 내부에서 처리해 개발자가 직접 구현할 코드를 크게 줄인다.

    요약 이어보기
    #authentication#twilio#sms+2
  2. 백엔드·포스타입포스타입·

    포스타입이 개인화 추천을 하는 방법 2부

    포스타입 백엔드 엔지니어가 벡터 기반 개인화 추천 시스템을 실제 운영하며 맞닥뜨린 성능 장애와 용량 문제를 해결한 과정을 담은 2부다. 수백만 개의 벡터 KNN 검색이 피크 시간대에 전체 Elasticsearch 검색 성능을 흔드는 문제부터 클러스터 OOM 사태까지, 쿼리 최적화와 인프라 분리 두 가지 경로로 근본 해결에 이른다.

    요약 이어보기
    #elasticsearch#vector-search#recommendation-system+2
  3. 백엔드·포스타입포스타입·

    포스타입이 개인화 추천을 하는 방법 1부

    포스타입이 태그 기반 추천의 한계를 극복하고 벡터 임베딩 기반 개인화 추천 시스템을 구축한 과정을 담은 1부다. 유사한 콘텐츠가 다른 용어를 쓰거나 동일한 태그가 전혀 다른 톤의 콘텐츠를 가리키는 문제를 임베딩 벡터로 해결하고, OpenSearch의 HNSW ANN 검색으로 수백만 벡터를 실시간 검색하는 시스템을 구축해 구매율 15% 향상을 달성했다.

    요약 이어보기
    #opensearch#vector-search#recommendation-system+2