구글이 2026년 9월 15일 새로운 실시간 음성 AI 모델 ‘Gemini 3.8 Live’와 ‘Gemini 3.8 Live Extended Thinking’​을 공개했다. 불과 하루 전에 나온 발표인 만큼 현재 확인할 수 있는 제미나이 관련 소식 중에서도 가장 최신에 해당한다.

이번 발표의 핵심은 단순히 AI의 음성을 자연스럽게 만드는 데 있지 않다. 사용자와 대화하는 동안 시각 정보를 확인하고, 외부 도구를 실행하고, 복잡한 작업을 여러 단계로 처리하는 실시간 AI 에이전트에 초점이 맞춰졌다.

다만 구글이 공개한 성능 수치와 기능 설명은 적용되는 제품과 이용 조건에 따라 차이가 있을 수 있다. 아직 모든 사용자가 모든 기능을 동일하게 이용할 수 있는 것도 아니다. 새 모델의 특징과 한계를 공식 자료를 중심으로 살펴봤다.

Gemini 3.8 Live와 Extended Thinking의 차이

이번에 공개된 모델은 크게 두 가지다.

Gemini 3.8 Live는 빠르고 자연스러운 실시간 음성 대화와 비용 효율을 중심으로 설계됐다. 사용자의 말을 듣고 음성으로 답하는 것뿐 아니라 카메라 등을 통해 들어오는 시각 정보도 거의 실시간으로 처리할 수 있다.

Gemini 3.8 Live Extended Thinking은 복잡한 다단계 작업을 수행하도록 설계된 모델이다. 구글은 이 모델이 내부적으로 문제를 처리하는 동안에도 대화를 중단하지 않고, 먼저 짧게 반응하거나 작업 진행 상황을 음성으로 알려줄 수 있다고 설명한다.

예를 들어 사용자가 여러 조건이 포함된 예약이나 자료 제작을 요청했을 때, AI가 아무런 반응 없이 결과만 기다리게 하는 것이 아니라 현재 어떤 작업을 처리하고 있는지 대화를 통해 전달하는 방식이다.

그렇다고 AI의 내부 사고 과정 전체가 사용자에게 공개된다는 의미는 아니다. 공식 발표에서 말하는 ‘진행 설명’은 작업 상태를 자연스럽게 전달하는 기능에 가깝다.

대화하면서 외부 도구를 실행한다

Gemini 3.8 Live에서 눈에 띄는 기능은 외부 도구와 API를 백그라운드에서 실행하면서 사용자와의 대화를 이어갈 수 있다는 점이다.

기존 음성 AI는 외부 정보를 검색하거나 특정 기능을 호출할 때 대화가 멈추는 경우가 많았다. 구글은 새 모델이 먼저 사용자의 요청을 확인하고 대화를 계속하면서, 필요한 도구 호출과 작업을 뒤에서 처리할 수 있다고 설명한다.

개발자는 Gemini Live API를 이용해 쇼핑 도우미, 고객 상담, 교육용 AI, 실시간 통역, 차량이나 스마트 안경용 음성 인터페이스 등을 개발할 수 있다. Live API는 음성·이미지·텍스트를 연속적으로 입력받고 음성으로 응답하는 구조다.

공식 개발자 문서에 따르면 Live API는 사용자가 AI의 말을 도중에 끊고 새롭게 말하는 ‘Barge-in’ 기능과 함수 호출, Google 검색 연동, 실시간 음성 기록 등의 기능을 지원한다.

음성뿐 아니라 화면도 함께 이해한다

Gemini 3.8 Live는 음성 전용 모델이 아니다. Google DeepMind가 공개한 모델카드에 따르면 입력으로 음성, 이미지, 영상, 텍스트를 처리하며 최대 128K 토큰의 컨텍스트 창을 지원한다. 출력은 음성과 텍스트 형태로 제공되며 최대 출력 길이는 64K 토큰으로 기재돼 있다.

카메라에 보이는 사물이나 사용자가 보고 있는 화면을 바탕으로 설명을 제공하는 방식도 가능하다. 구글은 실시간 직원 교육, 화면을 보며 진행하는 문제 해결, 체스판을 확인하면서 나누는 음성 대화 등을 활용 사례로 제시했다.

그러나 시각 정보를 처리한다고 해서 모든 장면과 사물을 항상 정확하게 인식한다는 뜻은 아니다. 공식 모델카드에도 일반적인 생성형 AI와 마찬가지로 사실과 다른 내용을 생성하는 환각 현상이 발생할 수 있다고 명시돼 있다.

언어 지원 숫자는 서비스별 확인이 필요하다

구글의 신모델 발표문에는 Gemini 3.8 Live가 97개 지원 언어를 자동으로 감지하고 대화 중 언어를 전환할 수 있다고 설명돼 있다.

반면 2026년 9월 15일 업데이트된 Gemini Live API 개발자 문서에는 대화 지원 언어가 70개, 실시간 음성 번역은 70개 이상 언어​로 표기돼 있다.

두 숫자가 다른 이유가 구체적으로 설명되지는 않았다. 모델이 인식할 수 있는 언어 범위와 개발자용 API에서 공식 지원하는 대화·번역 언어 범위가 다르거나, 서비스별 제공 범위에 차이가 있을 가능성이 있다.

따라서 현재 시점에서 “모든 환경에서 97개 언어를 완전히 지원한다”고 단정하기는 어렵다. 실제 서비스를 개발하거나 특정 언어로 이용하려면 Gemini 앱, Google Workspace, Live API 등 사용하는 환경의 최신 지원 목록을 별도로 확인해야 한다.

성능 수치는 어떻게 봐야 할까

구글은 Gemini 3.8 Live Extended Thinking이 Artificial Analysis의 Speech-to-Speech Quality Index에서 82.6점을 기록했다고 발표했다. 음성 에이전트의 작업 수행 능력을 평가하는 τ-Voice에서는 68.6%, Sierra의 은행 업무 관련 τ-Voice 벤치마크에서는 35.1%를 기록했다고 설명한다.

오디오 기반 추론 성능을 평가하는 Big Bench Audio 결과로는 97.7%가 제시됐다. 또 일반 Gemini 3.8 Live는 사용자 선호도를 평가하는 Speech Agent Arena에서 2위를 기록했다고 구글은 밝혔다.

이 수치들은 모델의 특성을 확인할 수 있는 자료지만, 실제 환경의 모든 성능을 보장하지는 않는다. 일부 평가는 구글이 특정 플랫폼과 조건에서 수행했고, 벤치마크마다 측정 대상과 기준도 다르다. 이를 근거로 “가장 뛰어난 음성 AI”라고 일반화해서는 안 된다.

AI 음성에는 SynthID 적용

구글은 자사 AI 제품이 생성하는 음성에 SynthID 워터마크를 적용한다고 밝혔다. SynthID는 사람이 듣기 어려운 신호를 음성 출력에 포함해 AI 생성 여부를 식별할 수 있도록 돕는 기술이다.

AI 음성이 실제 사람의 목소리처럼 자연스러워질수록 사칭과 허위 정보에 악용될 가능성도 커진다. SynthID는 이러한 문제에 대응하기 위한 장치지만, 워터마크가 모든 오용을 자동으로 차단하거나 원본의 진위를 완벽하게 보장하는 것은 아니다.

지금 누구나 사용할 수 있을까

Gemini 3.8 Live는 Gemini API와 Google AI Studio를 통해 개발자에게 제공되기 시작했으며 일반 사용자는 Search Live에서 이용할 수 있다고 구글은 밝혔다. 기업용 Gemini Enterprise에서는 비공개 미리보기 형태로 제공된다.

Gemini 3.8 Live Extended Thinking도 Gemini API와 Google AI Studio에서 제공되기 시작했다. 일반 사용자는 Gemini Live에서 접근할 수 있으며, Google Workspace에서는 구독 유형과 서비스에 따라 Docs, Gmail, Keep 등에 순차적으로 적용된다.

공식 발표에서 사용한 표현은 ‘출시 완료’가 아니라 ‘롤아웃 시작’​이다. 국가와 계정, 구독 상품, 서비스에 따라 기능이 표시되는 시점이 다를 수 있으므로 모든 이용자가 즉시 사용할 수 있다고 단정해서는 안 된다.

공식 모델카드가 밝힌 한계

Google DeepMind 모델카드에는 Gemini 3.8 Live와 Extended Thinking도 사실이 아닌 내용을 생성할 수 있다고 적혀 있다. 간헐적으로 응답이 느려지거나 시간 초과가 발생할 가능성도 명시돼 있다.

공개된 모델카드 기준 지식 마감일은 2025년 1월이다. 따라서 최신 사건이나 현재 상황에 관한 질문에는 검색과 외부 도구 연결이 필요하며, 검색 기능이 연결되지 않은 상태에서 모델의 답변만 믿는 것은 주의해야 한다.

개인정보나 금융·의료 정보가 포함된 실시간 대화에서도 별도의 검토가 필요하다. 공식 활용 사례에 의료와 금융 분야가 포함돼 있지만, 이것이 전문 의료진이나 금융 전문가를 대체할 수 있다는 뜻은 아니다.

음성 AI가 ‘대답’에서 ‘업무 수행’으로 이동한다

Gemini 3.8 Live 발표에서 가장 중요한 변화는 목소리가 조금 더 자연스러워졌다는 데 그치지 않는다. AI가 사용자의 음성 및 시각 정보를 받아들이고, 대화를 유지하면서 도구를 실행하는 방향으로 발전하고 있다는 점에 의미가 있다.

특히 Extended Thinking은 시간이 필요한 복잡한 업무에서도 침묵한 채 결과만 생성하는 대신, 사용자와 상호작용하면서 작업을 이어가는 음성 에이전트를 지향한다.

다만 발표 영상에 등장한 시연과 실제 사용 환경은 구분해서 볼 필요가 있다. 언어 지원 범위가 공식 자료마다 다르게 표기돼 있고, 서비스별 이용 조건도 복잡하다. 환각과 지연 가능성 역시 사라진 것이 아니다.

현재 확인되는 사실만 놓고 보면 Gemini 3.8 Live는 모든 문제를 해결하는 완성형 음성 비서라기보다, AI가 실시간 대화와 도구 실행을 동시에 수행하는 방향을 보여주는 최신 모델이라고 정리하는 것이 가장 정확하다.