pile·
AI / ML·AWS KoreaAWS Korea Tech·

A1Mobilsoft의 운영 문의 자동화 여정 (2): 세 에이전트 구현과 사람 vs AI 검증

A1Mobilsoft 운영 문의 자동화 2편으로, 세 에이전트를 실제로 구현한 방식과 7주간 사람 답변과 병렬 비교한 결과를 담았다. AI 는 1차 응답 2초·원인 제시 31초로 사람의 10분·42분을 압도했지만, 정확도는 3.55/5(71%)에 그쳤다. 결론이 갈린 지점은 대부분 Knowledge Base 에도 코드에도 없는 비즈니스 룰이었다.

핵심 포인트
  • Knowledge Agent 는 Retrieve → Rerank → Diagnosis 3단으로 "비슷한데 다른 문제"를 걸러낸다
  • match boolean 과 confidence 를 분리해 전자는 1차 게이트, 후자는 우선순위로 쓴다
  • Code Agent 의 루프 폭주를 프롬프트·temperature·Hook 3중으로 막아 31회/265K 토큰을 3회/14K 로 줄였다
  • Bedrock Prompt Caching 으로 입력 23,877 토큰 중 15,359(64%)를 캐시에서 읽어 입력 비용을 절반으로 낮췄다
  • 최종 결론 일치는 64%(9/14), 사람이 더 깊이 진단한 경우가 29%(4/14)였다
상세 정리
  • Knowledge 1단: Bedrock Knowledge Base 에서 점수 0.4 이상 상위 5건을 뽑는다
  • Knowledge 2단: Haiku 가 문의를 오류·절차·데이터·요청으로 분류하고 점수를 다시 매긴다
  • Knowledge 3단: "정말 같은 문제인가"를 엄격히 판단하며, 같은 키워드지만 목적이 다른 경우 등 부정 조건 4개를 프롬프트에 명시했다
  • Code Agent 진화: GitHub REST API 로 시작해 git clone 을 거쳐, GitHub Actions OIDC 로 S3 에 tar 를 올려두고 세션마다 내려받는 방식으로 굳었다
  • Code Agent 도구: 워크스페이스에서 Serena MCP 의 LSP 기반 심볼 검색과 shell 명령을 함께 쓴다
  • 폭주 방어 1: 프롬프트를 단순 규칙에서 판단 트리와 체크포인트를 갖춘 페르소나로 바꿨다
  • 폭주 방어 2: temperature 를 0.3 으로 낮춰 비결정성을 줄였다
  • 폭주 방어 3: Hook 으로 도구 호출 20회 상한을 걸어 강제 종료시켰다
  • DB Agent 제약: 직접 RDS 접속을 막고 MCP 게이트웨이만 허용하며, SELECT 전용에 LIMIT 를 자동 주입하고 호출 5회로 제한한다
  • 검증 설계: 2026-04-01~05-20 표본 21건 중 식별자 검증을 통과한 14건을, 원인 일치도·데이터 정확성·권고 실용성·누락 4축 5점 루브릭으로 채점했다
  • 축별 점수: 데이터 정확성 3.93, 권고 실용성 3.71, 원인 일치도 3.36, 누락 3.21 순으로 낮아진다
  • 기여도 분해: Knowledge 단독 해결 36%, DB 조회까지 가면 50%, Code 분석까지 필요한 경우 7%였다
  • 성공 사례: 계약서가 안 보이던 건은 사람이 4일·19개 메시지를 쓴 반면 AI 는 65초에 같은 원인과 우회 절차, 근본 수정안까지 냈고 재채점 4.75점을 받았다
  • 실패 사례: 접수번호 수정 요청은 데이터는 맞게 봤지만 외부 시스템 연동 때문에 UPDATE 가 불가하다는 규칙을 몰라 2.50점에 그쳤다
왜 읽나LLM 에이전트를 운영에 붙이려는 팀에게 속도 이득과 정확도 한계를 같은 표본에서 비교한 수치를, 그리고 어디서 무너지는지를 알려준다.
AWS Korea
AWS Korea Tech 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·stackoverflow-blogStack Overflow Blog·

    에이전틱 SDLC를 QA 엔지니어링 마인드셋으로 구축하기

    Motorola Solutions의 테스트 엔지니어링 선임 매니저 Suneet Malhotra가 Stack Overflow 팟캐스트에 출연해 MCP(Model Context Protocol) 기반 에이전틱 SDLC 파이프라인 구축과 LLM-as-judge 평가 방법론을 소개했다. QA 엔지니어링 관점을 소프트웨어 개발 생애 전반에 적용하고, 설계 단계 직후 스펙을 강화해 결함 비용을 줄이는 'QA shift-left' 접근을 다룬다.

    요약 이어보기
    #llm-agent#mcp#test-automation+2
  2. AI / ML·LINE EngineeringLINE Engineering·

    보안 업무를 위한 AI 에이전트 플랫폼 「SAGE」 개발기 1편: 판단은 사람에게 남기는 설계

    LY Corporation Security Development Division이 보안 업무용 AI 에이전트 플랫폼 SAGE의 개발 과정을 공개했다. "완전 자동화"와 "도입 미루기" 양 극단 사이에서 "판단은 사람에게 남기는 설계"를 핵심 원칙으로 삼고, 3단계 점진적 도입 전략(AI 보조→에이전트 협업→자동화)을 채택했다. 현재는 1단계를 중심으로 파일럿·실운영 중이다.

    요약 이어보기
    #llm-app#opensearch#mcp+2