Twilio Conversation Relay 파이프라인에서 배경 소음은 Deepgram STT 전사 단계를 통해 LLM에 그대로 전달되므로, 오디오 전처리보다 모델 선택과 TwiML 속성 튜닝이 소음 대응의 핵심이다. 이 튜토리얼은 C# 환경에서 진공청소기(70-75dB)와 전동드릴(85-90dB)이 동시에 켜진 극한 조건까지 실제 테스트한 결과를 바탕으로, Deepgram Nova-3 튜닝과 Flux 마이그레이션 두 가지 경로를 제시한다.
핵심 포인트- Conversation Relay 아키텍처에서 서버는 원본 오디오를 수신하지 않고 Deepgram 전사 결과만 받아 LLM으로 전달하므로, 전사 정확도가 소음 내성의 병목
- Nova-3 기본 설정은 단일 소음은 통과하나 복합 소음(진공+드릴)에서 전사 실패 2건 발생
- `interruptSensitivity="low"` + `ignoreBackchannel="true"` 두 속성만 추가해 Nova-3 복합 소음 실패 완전 제거
- Deepgram Flux는 전사와 발화종료 감지를 단일 모델로 통합해 기본 설정만으로 모든 소음 조건 통과
- Flux 전환 시 응답 지연 200-600ms 감소, 잘못된 인터럽션 약 30% 감소, 10개 언어 다국어 지원 추가
상세 정리- 음성 처리 체인: 발화 → Deepgram STT → LLM 텍스트 생성 → ElevenLabs TTS; 서버는 전사 JSON 메시지만 수신
- 테스트 조건 4종: 조용한 방(기준), 진공청소기, 전동드릴, 두 가지 동시; 6개 스크립트 교환으로 검증
- `interruptSensitivity` 속성: `medium`(기본) → `low` 변경으로 배경 소음이 에이전트 발화를 끊는 임계값 상향
- `ignoreBackchannel` 속성: `true` 설정 시 에이전트 발화 중 "uh huh", "yeah" 등 단음 긍정에 에이전트 무반응
- Nova-3 풀 설정: `speechModel="nova-3-general"`, `interruptSensitivity="low"`, `ignoreBackchannel="true"` 조합
- Flux 전환: `speechModel="flux"` 단일 변경으로 충분; 추가 속성은 선택적 강화
- Flux `eotThreshold`: 기본값 `0.8`, 극한 소음 환경에서 `0.75`로 낮춰 발화종료 감도 조정 가능 (0.7 미만 비권장)
- 오디오 전처리 불가: Twilio가 음성을 직접 Deepgram으로 라우팅하므로 서버 개입 불가; `<Stream>`과 `<ConversationRelay>` 병행 불가
- ElevenLabs Audio Isolation API는 오프라인 후처리 전용, 실시간 스트리밍 파이프라인과 비호환
왜 읽나Twilio Conversation Relay 기반 AI 음성 에이전트의 소음 내성을 코드 변경 최소화로 개선하는 C# 실전 튜닝 가이드다.