실시간 video 처리는 decode·encode와 AI inference가 동시에 필요한데 범용 CPU·GPU만으로는 비용과 동시 stream 수가 제한된다. 카카오클라우드의 VT1·VT2 media accelerator와 V70 DPU 기반 AI instance를 CPU·GPU와 비교하며, low-latency multi-stream transcoding과 Vision AI inference에 적용하는 방법을 benchmark와 예제로 보여준다.
핵심 포인트- VT1은 FPGA 기반 U30, VT2는 MA35D 계열 accelerator로 codec·multi-stream transcoding을 hardware 처리하며, 지원 해상도·codec·동시 stream과 file 분할 병렬 transcoding 특성에 따라 적합 instance가 달라짐
- V70 DPU AI instance는 Vitis AI·GStreamer component로 quantized model inference에 초점을 두고 decode·preprocessing·inference·postprocessing을 하나의 streaming pipeline으로 연결
- 60초 4K 60fps 영상을 여러 해상도로 동시 변환하는 FFmpeg workload를 CPU·GPU·VT1·VT2에서 비교해, accelerator의 이점이 높은 concurrency에서 더 뚜렷해짐을 확인
- 거리 영상 차량 탐지 예제에서 model name·class·quantization·inference option을 JSON 설정으로 바꾸고 custom component를 compile해, 설정만으로 custom model을 실시간 영상에 적용·재사용
왜 읽나대량 실시간 transcoding·video analytics를 GPU 비용 없이 확장해야 하는 미디어·클라우드 엔지니어에게, media/AI 전용 accelerator의 선택 기준과 pipeline 구성법을 benchmark로 안내한다.