기기·통신사 제약 없이 VoiceTalk 통화를 녹음하고 Kanana STT·화자별 요약·검색·Talk Cloud 복원까지 제공하는 기능의 제품·기술 설계를 다룬다. 음성 파일 분리와 pause 동기화, 속도, 그리고 개인정보 보호를 어떻게 동시에 잡았는지가 핵심이다.
핵심 포인트- 제조사·통신사·추가 앱에 따라 달랐던 통화 녹음을 VoiceTalk 안에서 동일하게 제공하고, 최대 30분 기록을 종료 화면·채팅방·최근 통화 목록에서 찾아 재생·화자별 STT·요약·keyword 검색·복원까지 하나의 흐름으로 묶음
- 녹음 시작 시 내 음성·상대 음성·재생용 mix를 서로 다른 file로 실시간 저장해 분리 file은 정확한 STT에, mix는 player에 사용하고, 여러 번 pause해도 저장 안 된 공백을 제거·timestamp를 재계산해 audio와 speech bubble이 어긋나지 않게 맞춤
- Kanana STT는 음성 구간을 먼저 검출해 앞부분부터 결과를 보내고 여러 작업을 병렬화해 최대 30분 통화를 10초 안에 처리, 요약은 대화 특화 5만 건 데이터·quantization·vLLM serving과 자체 평가 지표로 속도·품질을 관리
- 기기에선 audio·transcript DB를 암호화하고 key는 iOS Keychain·Android Keystore에, Talk Cloud backup은 server가 내용을 식별 못 하는 형태로 암호화해 사용자 private password로만 복원, STT server는 신원을 모른 채 분석 후 즉시 폐기하고 통화 데이터를 model 학습에 쓰지 않음
왜 읽나음성 통화에 STT·요약을 얹으면서 정확도·속도·프라이버시를 동시에 지켜야 하는 팀에게, 파일 분리·pause 동기화·병렬 STT·전 구간 암호화를 엮은 실전 설계.