Twilio Conversation Relay를 PHP로 구현할 때 배경 소음이 STT(음성→텍스트) 정확도를 저하시키는 문제를 다룬다. 음성 AI는 STT → LLM → TTS 순차 파이프라인이라 전사 오류가 전체 응답 품질을 망친다. Nova-3 모델 설정 튜닝과 Flux 모델 전환 두 가지 해결책을 실측 테스트 결과와 함께 제시한다.
핵심 포인트- 진공청소기(70~75dB), 드릴(85~90dB), 동시 소음 4가지 조건으로 실측 테스트 진행 — 기본 Nova-3는 고소음 환경에서 전사 실패 2회 발생.
- Nova-3 설정 2가지 조정으로 전사 실패 0회 달성: interruptSensitivity를 low로(소음 피크로 인한 에이전트 발화 중단 방지), ignoreBackchannel을 true로(짧은 추임새 처리 방지).
- Flux 모델은 기본 설정으로도 모든 소음 조건 통과, Nova-3 대비 불필요 중단 약 30% 감소, 지연 200~600ms 단축.
- 서버에서 오디오 전처리(FFmpeg adrc, ElevenLabs Audio Isolation)는 적용 불가 — Twilio가 수신 오디오를 직접 Deepgram으로 라우팅해 서버가 원본 오디오를 받지 못함.
- 초고소음 환경에서는 Flux의 eotThreshold를 0.75로 낮춰 발화 종료 감지 민감도 보정 가능.
상세 정리- 문제 구조: 음성 AI는 STT→LLM→TTS 순차 처리라 전사 오류가 LLM에 그대로 전달됨. 사람 상담원과 달리 AI는 재확인을 요청할 수 없어 전사 정확도가 전체 품질 결정.
- 테스트 방법: 스피커폰을 팔 길이 거리에 두고 조용한 환경, 진공청소기(70~75dB), 드릴(85~90dB), 동시 소음 4조건에서 3개 설정(기본 Nova-3, 튜닝 Nova-3, Flux) 비교.
- 테스트 결과: 기본 Nova-3는 동시 소음 환경에서 전사 실패 2회. 튜닝된 Nova-3와 Flux는 모든 조건에서 실패 0회.
- Nova-3 튜닝 1 — interruptSensitivity: low로 설정하면 소음 피크가 에이전트의 발화 중간에 인터럽트 신호로 처리되는 것을 차단.
- Nova-3 튜닝 2 — ignoreBackchannel: true로 설정하면 "uh huh"처럼 짧은 추임새가 불필요한 응답을 트리거하지 않음.
- Flux 모델 장점: 전사와 발화 종료 감지(turn detection)를 하나로 통합, 200~600ms 지연 단축, 10개 언어 네이티브 지원.
- 오디오 전처리 제약: Twilio 아키텍처상 수신 오디오가 서버를 거치지 않고 Deepgram으로 직접 라우팅됨 → FFmpeg adrc 필터나 ElevenLabs Audio Isolation 같은 서버측 전처리 불가.
- 고소음 환경 보정: Flux의 eotThreshold를 0.75로 낮추면 발화 종료 판단 기준을 더 민감하게 조정 가능.
- 프로덕션 권장사항: Flux로 업그레이드하면 별도 튜닝 없이 우수한 소음 내성 확보. Nova-3 유지 시 위 두 설정 변경으로 충분한 노이즈 내성 달성 가능.
왜 읽나Twilio Conversation Relay로 음성 AI 상담원을 구축 중인 개발자에게 배경 소음 환경에서도 안정적인 STT 정확도를 확보하는 실측 기반 설정 가이드.