화면 대신 목소리로… AI 시대, ‘음성 인터페이스’ 다시 뜨는 까닭
기술적 한계 극복하며 웨어러블 기기 선택 받아

최근 몸에 착용하는 웨어러블 디바이스의 출시·개발 소식이 이어지고 있습니다. 시장 규모도 가파르게 성장 중인데요. 글로벌 시장 조사 기관 그랜드 뷰 리서치(Grand View Research)에 따르면, 웨어러블 시장은 연평균 약 12%의 성장률을 기록하며 올해 1031억 달러 수준에서 2033년 2299억 달러에 달할 것으로 전망됩니다.
이 시장이 커지면서 디바이스를 작동하는 수단으로 자연스레 ‘목소리’가 주목받고 있습니다. 핸즈프리(Hands-free). 디스플레이 화면을 들여다보고 손가락으로 터치하는 행동이 생략되며 눈과 손이 자유로워졌기 때문인데요. 길을 걷다 멈춰 서서 메뉴를 누르거나 프롬프트를 입력할 필요가 원천적으로 사라진 거죠. 사용자와 디바이스가 목소리로 소통하는 ‘음성 인터페이스(Voice User Interface, VUI)’가 빠르게 부상하는 배경도 여기 있습니다.
메타, 레이밴·오클리 등 AI 글래스 국내 출시
3K 울트라HD 촬영·오픈 이어 오디오 기능
VUI는 특히 웨어러블 시장의 최전선이자 격전지로 꼽히는 ‘스마트 글래스’ 분야에서 확실한 공통 분모로 자리잡고 있습니다.
실제 메타가 글로벌 안경 브랜드 에실로룩소티카(EssilorLuxottica)와 손 잡고 선보인 메타 글래스는 “헤이 메타”라는 음성 호출어로 촬영이나 메시지 전송같은 주요 기능을 이용할 수 있습니다. 구글이 올 가을 출시할 예정인 스마트 글래스 역시 “헤이 구글”을 통해 기기에 연동된 제미나이와 소통할 수 있죠. 애플 또한 자사의 AI 음성 비서인 시리(Siri)를 탑재한 스마트 글래스 개발에 속도 내는 중입니다.
이들 모두 물리적인 디스플레이 화면이 아닌 음성을 핵심 인터페이스로 삼았는데요. 이는 스마트 글래스만의 이야기가 아닙니다. 스마트 워치, 스마트 링 등 다른 형태의 웨어러블 디바이스에서도 VUI의 비중은 날로 커지고 있죠.
사실 VUI를 상용화하려 했던 시도는 이전부터 있었습니다. 다만 몇 가지 기술적 한계로 인해 기대만큼 시장에 안착하지는 못했는데요. 그렇다면 지금은 무엇이 달라졌을까요? 과거에는 무엇이 발목을 잡았던 걸까요? VUI가 차세대 웨어러블 디바이스의 핵심 인터페이스로 선택되는 까닭. 그 결정적인 이유들을 짚어봤습니다.

VUI를 선택하는 3가지 이유
1. 물리적 한계 극복
웨어러블 디바이스의 물리적 한계와 관련이 있습니다. 몸에 착용하는 웨어러블 디바이스는 크기와 무게를 무작정 키울 수 없는데요. 그렇다 보니 스마트 워치의 40㎜ 남짓한 화면과 스마트 글래스의 좁은 시야각 안에 텍스트나 UI 요소를 몰아 넣으면 사용자에게 극심한 피로를 유발할 수 있죠. 실제 스마트 기기의 화면이 작을 수록 눈의 피로도가 높아진다는 연구 결과도 있습니다.
배터리도 문제입니다. 웨어러블 디바이스를 가볍게 만들려면 배터리가 작아져야 하는데, 디스플레이 화면은 배터리 소모량이 가장 많은 부품 중 하나죠. 때문에 사용자의 피로도를 줄이고 기기 경량화를 위해 웨어러블 디바이스는 화면 없는 스크린리스(Screenless)를 택하고 있고요. 그에 대한 확실한 대안이 VUI인 거죠.
2. AI 에이전트와의 결합
AI로 진화하는 시리, 애플의 디바이스 경험은 어떻게 바뀔까?
화면과 맥락을 이해하는 시리부터 리퀴드 글래스 개편까지
‘AI 에이전트’의 도래도 VUI의 도입을 가속화하고 있습니다. 제한된 역할만 수행했던 기존 음성 AI가 AI 에이전트와 만나, 사용자 의도를 이해하고 여러 앱과 데이터를 넘나들며 스스로 작업을 수행하는 에이전틱 VUI로 진화하고 있는 것인데요.
그 대표 주자로 애플의 시리를 꼽을 수 있습니다. 애플은 지난 6월 개최된 ‘WWDC 2026’에서 음성 비서 시리를 에이전틱 인터페이스 차원으로 전면 개편한다는 내용을 발표했는데요. 그동안 단편적인 질문에 답하거나 간단한 명령 수행에 머물렀던 시리의 개인 맥락 이해도와 앱 간 연동성을 대폭 강화해 기능을 확장하는 것이 핵심이었죠. 이에 따라 사용자가 음성으로 특정 작업을 요청하면 시리가 관련 앱을 열어 수행하는 게 가능해집니다. 예를 들어 사용자가 “지난 주말에 찍은 사진 찾아줘”라고 말하면 시리가 사진 앱에 들어가 특정 시간대와 인물을 포착해 정확한 결과물을 전달해주는 식이죠.
이처럼 음성 AI가 디바이스 생태계 전체를 제어하는 AI 에이전트와 결합되며, VUI 또한 인터페이스 세계의 조연에서 주인공으로 올라가고 있는 셈입니다.

3. 압도적 입력 효율성
말하는 게 문자를 타이핑하거나 메뉴를 터치하는 것보다 빠릅니다. 음성 받아쓰기 애플리케이션 엠버타입(EmberType)이 인용한 미국 스탠퍼드대학교 연구 결과를 보면, 모바일 키보드 입력 속도는 분당 53단어에 그친 반면 음성 입력 속도는 분당 평균 161단어에 달한 것으로 나타났는데요. 말하는 것과 수동 입력 간의 속도와 정보량이 3배나 차이 나는 셈입니다. 알토대학교가 약 17만명 대상으로 실시한 타자 속도 분석 연구에서도, 타이핑 실력이 가장 뛰어난 상위 5%조차 분당 80단어 선에 머물며 음성 속도보다 크게 뒤쳐졌습니다.
일각에선 이 같은 음성의 효율성이 이커머스 영역서 무기가 될 것으로 보는데요. 이미 음성 기반 검색이 어느 정도 자리 잡은 시점에, VUI를 통한 온라인 구매 비율은 증가할 것이라는 분석이죠. 미국 데이터 분석 기업 일렉트로 IQ(ElectroIQ)가 공개한 지난해 음성 커머스 통계 현황에 따르면, 아마존 사용자의 49%는 음성 쇼핑이 편리하다고 느끼는 것으로 나타났고요. 44%는 타이핑 검색 등 기존 방식보다 음성 쇼핑이 더 빠르다고 답했죠.
모바일 앱 개발 기업 프리모텍(Primotech)은 “음성 인식을 이용해 온라인으로 주문하면 일반 앱 사용 대비 시간을 최대 40% 단축할 수 있다”며 “쇼핑 속도가 빨라지면 구매 전환율과 쇼핑 경험 만족도가 높아진다”고 VUI 기반 이커머스의 효과를 설명했습니다. VUI로 기존 이커머스의 검색·탐색·결제 과정이 사라지고 말하는 속도, 생각하는 속도로 쇼핑할 수 있게 된다는 이야기입니다.
VUI 상용화 이제는 가능할까
AI의 급속한 성장과 웨어러블 시장이 맞물리며 VUI도 함께 각광받고 있지만, 사실 VUI는 과거부터 빅테크 기업들이 두드려왔던 신시장이었습니다.
2010년대 스마트폰 초창기 시절부터 음성 비서가 선을 보였고요. 아마존도 2014년부터 음성 서비스 알렉사(Alexa)를 제공했죠. 하지만 당시 모델들은 높은 오인식율과 복잡한 문제 해결에 한계를 보이며 인터페이스의 변두리에 머물렀습니다. 다시 말해 화면을 무대로 하는 ‘그래픽 유저 인터페이스(Graphical User Interface, GUI)’에서 터치 한 번이면 끝날 일을 굳이 버벅거리는 음성으로 처리할 이유가 크지 않았던 거죠.
AI 기반 음성 모델로 한층 고도화된 후에도 특유의 계단식 구조가 지적돼 왔습니다. 사용자 음성을 텍스트 변환 후 대규모 언어모델(LLM)을 거쳐 다시 음성으로 합성하는 구조라 대화 맥락이 끊어지거나 사용자의 감정이 소실되기도 했거든요. 턴 기반으로 작동해 사용자가 말을 마쳐야만 답변을 생성했고요. 외부 소음을 질문으로 인식해 답하기도 했고요. 그렇다면 이번에는 VUI의 진정한 상용화가 가능할까요?
사람과 대화하듯… 양방향 소통 구현할 AI

최근 등장한 AI 음성 모델들은 이러한 고질적 문제를 개선하며 VUI의 실질적인 상용화의 토대가 되고 있는데요. 핵심은 AI와의 음성 소통이 ‘사람과의 대화’에 보다 가까워졌다는 것입니다.
오픈AI는 7월 초 차세대 음성 모델 ‘GPT-라이브(Live)‘를 공개했는데요. 듣기와 말하기를 동시에 수행하는 ‘풀 듀플렉스(Full Duplex)’ 아키텍처를 기반으로 한 모델입니다. 여러 개의 메시지를 순차적으로 처리하는 대신, 응답을 생성하는 동시에 사용자의 입력을 계속 처리하는 구조죠. 덕분에 모델은 초당 여러 번 말할지, 계속 들을지, 잠시 멈출지, 끼어들지, 또는 툴을 사용할지 실시간 판단할 수 있습니다. 사용자가 말하는 도중 뜸을 들이면 기다려주고요. 대화 중에는 “음” “네”와 같이 반응합니다. 실제 사람과 이야기하는 듯한 자연스러운 양방향 음성 소통이 구현되는 것이죠.
이 상호작용의 흐름이 끊기지 않기 위해 오픈AI는 GPT-라이브에서 복잡한 작업을 분리했습니다. 검색, 추론, 높은 수준의 에이전틱 기능이 필요한 질문은 GPT-5.5와 같은 프런티어 모델에 위임하는 방식입니다. GPT-라이브가 사용자와 매끄럽게 대화하는 동안 생성형 AI가 백그라운드에서 작업을 처리하는 거죠.
GPT-라이브는 공개와 동시에 전 세계 챗GPT 사용자에게 순차적으로 제공되고 있는데요. 오픈AI는 “GPT‑라이브는 지금까지 선보인 음성 모델 가운데 가장 뛰어난 모델”이라며 “사람과 AI가 정말 자연스럽게 소통하는 세상이 우리가 그리는 미래”라고 설명했습니다.
“AI 음성 인터페이스 시대 올 것” 9조 원 가치 일레븐랩스 CEO의 비전
21일 한국 시장 공식 진출… “말이야말로 소통의 근본적인 방법”
이 밖에 글로벌 음성 AI 기업 일레븐랩스의 AI 에이전트 플랫폼도 양방향 소통을 가능케 하는 솔루션입니다. 7000개 이상의 보이스와 32개 언어를 지원하고, 지연 시간은 0.5초 미만으로 줄여 사람과 대화하는 듯한 경험을 제공하는데요. 고객지원과 결제, 데이터베이스 조회 등 다양한 워크플로우와도 연동돼 사용자가 대화에 집중하는 동안 업무를 처리할 수도 있습니다.
마티 스타니셰프스키 일레븐랩스 CEO는 지난해 말 한국 시장 진출을 공식 선언하며 “우리는 원래 말을 주고 받으며 소통하는 것에 익숙하기 때문에, 터치나 타이핑 같은 기존의 텍스트 중심 UI의 한계는 분명하다”며 “모든 디바이스가 우리가 무엇을 말하는지 정확히 이해할 수 있다면 제품의 사용자 경험이 완전히 달라질 것”이라고 VUI의 본질적 가치를 설명했죠.
물론 AI 기술의 고도화와 별개로 풀어야 할 숙제는 남아 있습니다. 음성 녹음 시 발생하는 개인정보 보호와 데이터 보안 문제, 음성 정보 복제를 통한 딥페이크(Deepfake) 범죄 가능성 등은 여전히 VUI를 두고 지적되는 쟁점들입니다. 영어권보다 비영어권의 단어 오류율이 높은 점도 지속적인 보완이 필요하고요.
정리하면 VUI는 웨어러블 기기의 구조적 특성과 AI 에이전트와의 결합, 음성 입력의 효율성 등으로 인해 차세대 디바이스의 핵심 인터페이스로 부상하고 있는데요. 이를 전방위 지원하는 음성 AI 기술들도 출시되고 있는 상황입니다.
VUI가 우리 일상에 완전히 자리잡을 날이 그리 멀지 않았다는 기대감이 드는데요. 그 기대란 목소리만으로 인터페이스를 이용하게 됐을 때, 한결 자유로워진 눈과 손이 향할 곳을 상상하는 것에서 비롯되는 듯합니다. 어쩌면 가까운 미래, 슬기로운 디바이스 생활을 위해 눈과 손의 역할은 재정의 될지도 모르겠군요.
구글, 디자인 툴 ‘구글 픽스’ 출시… 캔바 대항마 될까
나노 바나나 기반… 구글 워크스페이스 내 탑재
챗GPT도 클로드도 제미나이도… 왜 모두 ‘채팅창’일까?
요즘 AI가 다들 채팅창 UI를 사용하는 이유
뉴스콘텐츠는 저작권법 제7조 규정된 단서조항을 제외한 저작물로서 저작권법의 보호대상입니다. 본 기사를 개인블로그 및 홈페이지, 카페 등에 게재(링크)를 원하시는 분은 반드시 기사의 출처(로고)를 붙여주시기 바랍니다. 영리를 목적으로 하지 않더라도 출처 없이 본 기사를 재편집해 올린 해당 미디어에 대해서는 합법적인 절차(지적재산권법)에 따라 그 책임을 묻게 되며, 이에 따른 불이익은 책임지지 않습니다.
- 에디터최석영 (csyeong720@ditoday.com)

