pile·
AI / ML·부스트브라더스부스트브라더스·

Claude Code TDD 서브에이전트와 하네스 구축기 — 7개 에이전트, 18종 회귀 평가

Claude Code를 활용해 TDD(Red-Green-Refactor) 파이프라인을 7개 전문 서브에이전트와 자동화된 하네스로 구축한 경험기. "에이전트는 자기 자신을 객관적으로 평가하지 못한다"는 전제를 출발점으로, 권한 격리 + 증거 기반 게이트 전환 + 18종 회귀 평가로 신뢰할 수 있는 TDD 자동화를 구현한다.

핵심 포인트
  • 7개 에이전트 역할 분담: test-scenario-designer(TC ID/Given-When-Then) → test-writer(Red) → implementer(Green) → code-reviewer → refactorer(선택) → orchestrator(게이트 검증) → harness-optimizer(실패 패턴 분석 + 정의 개선 제안)
  • 권한 격리: tools: frontmatter + permissions.yaml으로 각 에이전트 역량 제한, PreToolUse 훅이 금지된 파일 수정을 실행 시점에 물리적 차단 (가이드라인이 아닌 강제)
  • 증거 기반 게이트 전환: orchestrator가 에이전트 자기 보고를 신뢰하지 않고 TC ID/assertion failure/test pass/traceability matrix를 직접 검증
  • 18종 회귀 평가(grader.sh): eval-001(누락 assertion), eval-004(의도치 않은 migration), eval-006(비test-writer의 테스트 파일 수정), eval-018(orchestrator 원칙 위반) 등 반복 실패 패턴 자동 감지
  • 핵심 전제: "단일 에이전트의 핵심 실패 모드는 객관적 자기 인식의 결여" → 모든 구조적 선택(권한 격리, 증거 게이트)의 설계 근거
  • 플러그인 구조: 에이전트 정의는 플러그인 루트에 저장, 업데이트가 모든 프로젝트에 자동 전파. 스킬 진입점: /tdd-pipeline:install, /tdd-pipeline:run
상세 정리
  • Red gate 검증: 컴파일 에러가 아닌 assertion failure 여부 확인 — 테스트가 진짜 실패 중인지 구분
  • Green gate 검증: 테스트 통과 + 테스트 파일 무결성 — implementer가 테스트를 수정해 통과시키는 부정행위 차단
  • Review gate: traceability matrix(TC ID별 커버리지) + 명시적 결정 기록
  • Refactor gate: Green 상태 유지 + 트리거 문서화 — 리팩터링이 외부 행동 변경 없이 수행됐음을 증명
  • 하네스 구조: .claude/harness/evals/(18종 평가 기준) + permissions.yaml + cycles/*.yaml(사이클별 메트릭·결과 누적) + HTML 대시보드
  • harness-optimizer 역할: 사이클 누적 데이터에서 반복 실패 패턴을 읽어 정의(definition) 개선 제안 — 리액티브 패치가 아닌 구조 개선
  • 훅 자동화: SubagentStop(검증 자동화), PreToolUse(데이터 캡처)
  • HTML 대시보드: cycles/*.yaml의 불투명한 YAML 누적을 사이클 상세 + 누적 분석으로 가시화 → 데이터 기반 정의 개선
  • permissions.yaml 구조: 프로젝트 로컬에 접근 제어 정의, 에이전트별 허용·금지 도구/경로를 명시적으로 열거
왜 읽나Claude Code 서브에이전트 아키텍처로 TDD를 자동화하면서 "에이전트 자기 보고 불신"이라는 전제를 권한 격리 + 증거 기반 게이트 + 18종 회귀 평가로 구조화하는 방법을, 실제 하네스 코드와 평가 기준과 함께 배울 수 있다.
부스트브라더스
부스트브라더스 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·stackoverflow-blogStack Overflow Blog·

    에이전틱 SDLC를 QA 엔지니어링 마인드셋으로 구축하기

    Motorola Solutions의 테스트 엔지니어링 선임 매니저 Suneet Malhotra가 Stack Overflow 팟캐스트에 출연해 MCP(Model Context Protocol) 기반 에이전틱 SDLC 파이프라인 구축과 LLM-as-judge 평가 방법론을 소개했다. QA 엔지니어링 관점을 소프트웨어 개발 생애 전반에 적용하고, 설계 단계 직후 스펙을 강화해 결함 비용을 줄이는 'QA shift-left' 접근을 다룬다.

    요약 이어보기
    #llm-agent#mcp#test-automation+2
  2. AI / ML·LINE EngineeringLINE Engineering·

    보안 업무를 위한 AI 에이전트 플랫폼 「SAGE」 개발기 1편: 판단은 사람에게 남기는 설계

    LY Corporation Security Development Division이 보안 업무용 AI 에이전트 플랫폼 SAGE의 개발 과정을 공개했다. "완전 자동화"와 "도입 미루기" 양 극단 사이에서 "판단은 사람에게 남기는 설계"를 핵심 원칙으로 삼고, 3단계 점진적 도입 전략(AI 보조→에이전트 협업→자동화)을 채택했다. 현재는 1단계를 중심으로 파일럿·실운영 중이다.

    요약 이어보기
    #llm-app#opensearch#mcp+2