01VOICE (음성)
음성 대화 모델 'Gemini 3.1 Flash Live', 구글 제품 전반에 적용
구글이 실시간 음성 대화용 모델 Gemini 3.1 Flash Live를 내놓고 Gemini Live와 검색의 Search Live에 넣었습니다. 응답이 빨라지고 대화 흐름을 이전보다 두 배 오래 이어 간다는 것이 구글 설명입니다. 이 모델 덕분에 Search Live가 200개 넘는 국가·지역으로 확대됐고, 개발자는 Live API에서 프리뷰로 쓸 수 있습니다.
핵심 사실 · 한눈에 보기
- 3월 26일 구글이 Gemini 3.1 Flash Live를 발표했습니다.
- 개발자는 Google AI Studio의 Gemini Live API에서 프리뷰(gemini-3.1-flash-live-preview)로, 기업은 Gemini Enterprise for Customer Experience에서 쓸 수 있습니다.
- 일반 사용자는 Gemini Live와 Search Live에서 만나며, Search Live는 같은 주 200개 넘는 국가·지역으로 확대됐습니다.
- 구글은 Gemini Live가 이전 모델보다 빨리 답하고, 대화 흐름을 두 배 오래 이어 간다고 밝혔습니다.
- 3.1 Flash Live로 생성한 모든 음성에는 SynthID 워터마크가 들어갑니다.
무엇이 나아졌나
구글은 3.1 Flash Live를 '지금까지 가장 품질 높은 음성 모델'이라고 소개했습니다. 핵심은 지연 시간, 신뢰성, 자연스러움입니다. 음높이와 말 빠르기 같은 소리의 미묘한 차이를 이전 모델(2.5 Flash Native Audio)보다 잘 알아듣고, 사용자가 답답해하거나 헷갈려할 때 반응을 조절한다고 했습니다.
개발자용 글에서는 실제 환경의 소음도 강조했습니다. 자동차 소리나 TV 소리 속에서 필요한 말을 더 잘 가려내, 대화 중 외부 도구를 부르는 작업의 완료율이 높아졌다는 것입니다. 실시간 대화를 지원하는 언어는 90개가 넘습니다.
- 여러 단계 함수 호출 평가 ComplexFuncBench Audio: 90.8%
- Scale AI의 Audio MultiChallenge('생각' 켠 상태): 36.1%
- 모두 구글 발표 수치
SOURCE공식 원문 + 추가 출처
- PRIMARY · 공식Gemini 3.1 Flash Live: Making audio AI more natural and reliableGoogle (The Keyword · AI) · blog.google · 발표 2026.03.26 · 확인 2026.10.05
- SECONDARY · 공식Gemini 3.1 Flash Live: Making audio AI more natural and reliableGoogle DeepMind · deepmind.google · 발표 2026.03.26 · 확인 2026.10.05
- SECONDARY · 공식Build real-time conversational agents with Gemini 3.1 Flash LiveGoogle (The Keyword · AI) · blog.google · 발표 2026.03.26 · 확인 2026.10.05
수집 2026.10.01 · 정리 2026.10.01 · 수정 2026.10.05 · 원문 본문은 옮기지 않았습니다. 회사가 밝힌 수치·성능은 본문에서 출처를 붙여 구분했습니다.