공공기관 음성 AI 응답 지연: 민원 전화에서 1초가 길게 느껴지는 이유

전화망, 발화 종료 감지, 음성 인식, 답변 생성, 음성 합성까지. 첫 응답이 늦어지는 구간과 대화를 끊지 않고 속도를 줄이는 방법을 살펴봅니다.

7분

“주차 과태료는 어디서 확인하나요?” 질문이 끝났는데 전화 너머가 잠시 조용합니다. 사람은 본능적으로 “여보세요?”를 다시 말합니다. 그 순간 AI의 답변이 시작되면 두 목소리가 겹치고, 첫 질문은 다시 처음으로 돌아갑니다.

전화에는 기다림을 채울 화면이 없습니다

웹사이트에서는 로딩 표시가 보이고, 대면 대화에서는 표정과 몸짓이 다음 말을 기다리게 합니다. 하지만 전화에는 목소리밖에 없습니다. 잠시라도 소리가 사라지면 상대가 듣고 있는지, 전화가 끊긴 것인지 확신하기 어렵습니다. 같은 1초라도 화면을 누르는 때보다 통화 중에 더 길게 느껴지는 이유입니다.

실제 사람 대화에서는 순서가 빠르게 바뀝니다. 10개 언어의 질문과 답변을 비교한 연구에서 평균 전환 간격은 약 208밀리초였습니다. 이 수치가 모든 민원 통화의 목표값은 아니지만, 1초의 무음이 사람의 대화 리듬보다 훨씬 길게 느껴질 수 있다는 점은 보여줍니다.

1초는 한 곳에서 생기지 않습니다

사용자가 말을 멈춘 순간부터 AI의 첫 마디가 들릴 때까지, 음성은 여러 단계를 거칩니다. 모델 하나를 빠른 것으로 바꿔도 다른 단계가 순서대로 기다리고 있으면 체감 속도는 크게 바뀌지 않습니다.

구간

전화망

하는 일
사용자의 목소리를 AI 시스템으로 전달합니다.
지연이 생기는 이유
통신사 회선과 중계 장비를 거치며 시간이 더해집니다.
구간

발화 종료 감지

하는 일
사용자의 말이 끝났는지 판단합니다.
지연이 생기는 이유
생각하는 침묵과 답변의 끝을 구분하려면 잠시 기다려야 합니다.
구간

음성 인식

하는 일
목소리를 AI가 읽을 수 있는 글로 바꿉니다.
지연이 생기는 이유
배경 소음과 불분명한 발음을 처리하는 데 시간이 필요합니다.
구간

대화 생성

하는 일
질문의 의도를 파악하고 답변을 만듭니다.
지연이 생기는 이유
정보 조회나 업무 규칙 확인이 필요하면 대기가 늘어납니다.
구간

음성 합성

하는 일
답변을 실제 목소리로 만듭니다.
지연이 생기는 이유
전체 문장을 기다린 뒤 합성하면 첫 소리가 느려집니다.

공공 전화에서 지연은 접근성의 문제입니다

민원 전화에는 어르신, 외국인, 장애인, 앱이나 웹사이트 이용이 어려운 사람도 함께 들어옵니다. 알아듣지 못해 다시 묻는 일이 반복되면 지연은 순식간에 커집니다. 정책 변경이나 재난 안내로 전화가 몰릴 때는 느린 통화 하나가 뒤의 대기 통화까지 늘립니다. 다만 속도만 빠르다고 접근성이 확보되는 것은 아닙니다. 느린 말속도, 다국어, 키패드 입력, 사람 상담 같은 대체 경로가 함께 있어야 합니다.

공공 서비스는 빠르기 전에 알리고 보호해야 합니다

01

AI 사용 사전 고지

기관명과 전화 목적, AI와 대화한다는 사실을 첫 안내에서 분명히 밝힙니다.

02

최소한의 개인정보

해결에 필요한 정보만 요청하고, 녹음·대화문·요약의 보관 기간과 열람 권한을 각각 정합니다.

03

답변 오류의 복구 경로

잘못된 안내를 신고·정정하고 사람에게 이의를 제기할 수 있는 절차를 둡니다.

04

도입 전 영향평가

법적 근거, 민감정보, 보유·파기, 위탁사와 기관의 책임을 시스템 오픈 전에 검토합니다.

빠른 답변과 끝까지 듣기 사이

발화 종료 감지 시간을 줄이면 AI는 빨리 답합니다. 하지만 사용자가 주소나 민원 내용을 잠시 생각하는 사이에 말을 끊을 수 있습니다. 시간을 늘리면 끝까지 듣지만 매번 답이 늦어집니다. 그래서 하나의 고정값보다 질문의 종류와 통화 대상에 맞춘 설정이 필요합니다. 예아니오로 답하는 질문은 빨리 받고, 사연을 설명하는 구간은 좀 더 기다리는 식입니다.

빠른 AI는 일찍 말하는 AI가 아니라, 상대의 말이 끝난 순간을 잘 아는 AI입니다.

맞장구와 진짜 끼어들기는 다르게 처리합니다

사람은 상대의 말을 들으며 “네”, “맞아요”처럼 짧게 반응합니다. 음성 AI가 이런 소리를 모두 끼어들기로 판단하면 말할 때마다 답변을 멈춥니다. 반대로 어떤 소리도 무시하면 사용자가 “잠깐만요”라고 해도 긴 안내를 끝까지 읽게 됩니다.

실제 통화에서는 사용자의 소리를 감지하는 동시에 앞부분의 음성을 글로 바꾸고, 그 내용이 단순한 맞장구인지 대화 방향을 바꾸는 요청인지 판단해야 합니다. 진짜 끼어들기라면 재생 중인 음성을 멈추고, 아직 말하지 않은 답변을 버린 뒤 새 요청을 이어갑니다. 이때 이전 대화 상태를 잃지 않아야 사용자가 같은 말을 반복하지 않습니다.

다 들은 뒤 시작하지 않는 방법

스트리밍은 음성을 전부 받은 뒤 한 번에 처리하지 않고, 들어오는 대로 나누어 처리하는 방식입니다. 음성 인식은 앞부분부터 진행하고, 대화 모델은 가능한 의도와 필요한 조회를 준비할 수 있습니다. 다만 사용자의 말이 끝나기 전에 최종 의도나 답변을 확정해서는 안 됩니다. 발화 종료가 확인되고 답변의 첫 부분이 나오면 음성 합성을 시작해 첫 소리까지의 공백을 줄입니다.

전화가 몰릴수록 평균보다 느린 통화를 봐야 합니다

평소에는 빠른데 민원이 몰리는 시간에만 느려지는 시스템이 많습니다. 서버 대기열, 데이터베이스 조회, 음성 합성 처리가 한꺼번에 몰리기 때문입니다. 평균은 이런 통화를 숨깁니다. 응답 시간의 p95와 p99, 시간대별 대기열, 타임아웃 비율을 함께 봐야 실제 폭주 상황의 느린 통화를 찾을 수 있습니다.

서버 시간보다 사용자가 들은 시간을 측정합니다

  • 첫 음성까지의 시간: 사용자가 말을 멈춘 순간부터 AI의 첫 소리가 들릴 때까지를 잽니다.
  • 느린 통화의 비율: 평균 외에도 p95·p99 응답 시간과 타임아웃 비율을 함께 봅니다.
  • 대화 겹침 횟수: AI가 말을 너무 빨리 시작해 사용자와 겹친 횟수를 확인합니다.
  • 되묻기 횟수: 인식 실패로 같은 질문을 반복한 횟수를 봅니다.
  • 통화 완료율: 속도를 높이려다 대화 완료율이 떨어지지 않았는지 확인합니다.

페보는 모델 앞뒤의 전화망까지 함께 다룹니다

페보는 음성 인식, 대화 모델, 음성 합성뿐 아니라 SIP Trunk, IP-PBX, 미디어 엔진을 함께 운영합니다. 전화망에서 음성이 들어오는 순간부터 다시 사용자에게 나가는 순간까지 한 흐름으로 보기 위해서입니다. 공공 안내처럼 통화량 변동이 큰 업무에서는 운영 시간대별 지연과 통화 완료율을 함께 보며 설정을 다듬습니다.