pile·
AI / ML·twilio-engTwilio Engineering·

Twilio Video 룸에 AI 음성 어시스턴트 연동하기

Twilio Conversation Relay를 활용해 Video 룸에 AI 음성 어시스턴트를 연동하는 튜토리얼이다. 2-leg 브리지 콜 구조로 Video 룸에 AI 참여자를 오디오 전용으로 참가시키고 WebSocket 서버를 통해 LLM(GPT-4o-mini)과 실시간 대화를 처리한다.

핵심 포인트
  • A-leg(Voice Call)가 Video 룸에 오디오 전용 참여자로 참가하고, B-leg(Conversation Relay)가 음성을 WebSocket으로 스트리밍하는 2-leg 브리지 구조다.
  • WebSocket 서버가 사용자 발화 텍스트를 받아 GPT-4o-mini로 쿼리하고 텍스트 응답을 TTS로 변환해 돌려보낸다.
  • WebSocket 메시지 타입은 connected/prompt/interrupt/disconnected 4종이며, interrupt로 사용자 발화 중 AI 응답을 중단한다.
  • TwiML App이 incoming call을 Conversation Relay WebSocket 엔드포인트로 라우팅한다.
  • LLM provider-agnostic 설계로 OpenAI 외 다른 모델로 교체 가능하다.
상세 정리
  • 배경: Video 룸에서 AI 어시스턴트가 사람 참여자처럼 음성으로 대화할 수 있는 구조를 Conversation Relay로 구현한다.
  • 의존성: Node.js 18+, ngrok(로컬 터널링), Twilio 계정(Trial 업그레이드 필요), OpenAI API 키.
  • TwiML App 생성: 설정 스크립트가 Conversation Relay WebSocket 엔드포인트로 incoming call을 라우팅하도록 프로그래밍 방식으로 구성한다.
  • Express 서버 엔드포인트 구성: Video 액세스 토큰 발급(/token/video), Voice Handler TwiML, Room Join TwiML, AI 초대(/invite-ai), 정리(cleanup).
  • Video 토큰: 특정 룸에 범위가 제한된 단기 자격 증명을 발급한다.
  • Room Join TwiML: "cr-ai-agent" 아이덴티티로 AI를 Video 룸에 오디오 전용 참여자로 추가한다.
  • WebSocket 처리: connected→세션 초기화, prompt→GPT-4o-mini 쿼리+type:'text' 응답 전송, interrupt→진행 중 응답 중단, disconnected→정리.
  • 멀티턴 대화: 메시지 히스토리를 서버에서 유지해 문맥 있는 대화를 지원하며, 시스템 프롬프트로 간결한 대화형 응답을 유도한다.
  • 프론트엔드: Join/Invite AI/Leave 버튼, 참여자 비디오 타일, 로그 표시를 Twilio Video JS SDK로 구현한다.
  • 트러블슈팅: ngrok URL 변경 시 TwiML App 재업데이트 필요, 브라우저 미디어 권한은 HTTPS/localhost 환경 필수.
왜 읽나WebSocket과 LLM을 결합한 실시간 AI 음성 어시스턴트를 Video 통화에 연동하려는 개발자에게 실전 아키텍처와 구현 흐름을 제공한다.
twilio-eng
Twilio Engineering 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·stackoverflow-blogStack Overflow Blog·

    에이전틱 SDLC를 QA 엔지니어링 마인드셋으로 구축하기

    Motorola Solutions의 테스트 엔지니어링 선임 매니저 Suneet Malhotra가 Stack Overflow 팟캐스트에 출연해 MCP(Model Context Protocol) 기반 에이전틱 SDLC 파이프라인 구축과 LLM-as-judge 평가 방법론을 소개했다. QA 엔지니어링 관점을 소프트웨어 개발 생애 전반에 적용하고, 설계 단계 직후 스펙을 강화해 결함 비용을 줄이는 'QA shift-left' 접근을 다룬다.

    요약 이어보기
    #llm-agent#mcp#test-automation+2
  2. AI / ML·LINE EngineeringLINE Engineering·

    보안 업무를 위한 AI 에이전트 플랫폼 「SAGE」 개발기 1편: 판단은 사람에게 남기는 설계

    LY Corporation Security Development Division이 보안 업무용 AI 에이전트 플랫폼 SAGE의 개발 과정을 공개했다. "완전 자동화"와 "도입 미루기" 양 극단 사이에서 "판단은 사람에게 남기는 설계"를 핵심 원칙으로 삼고, 3단계 점진적 도입 전략(AI 보조→에이전트 협업→자동화)을 채택했다. 현재는 1단계를 중심으로 파일럿·실운영 중이다.

    요약 이어보기
    #llm-app#opensearch#mcp+2