AI

Gemini 3.8 Live, AI 고객 서비스에 실시간 얼굴 도입

Adrian Kessler
Google에서 추가하기

이 시스템은 Live Avatar를 탑재한 Gemini 3.8 Live다. Google의 음성 간 음성 모델에 실시간 영상 레이어를 결합해 입술 움직임과 표정을 만들어내며, 대화를 멈추지 않고 백그라운드에서 도구 호출도 처리한다. 언어도 자동으로 감지한다. 통화 중간에 사용 언어가 바뀌어도 연결을 넘기거나 시스템을 다시 불러오지 않고, 사용자가 알아차릴 만한 지연 없이 아바타가 다른 언어로 전환한다.

기존의 영상 오버레이 방식과 이 기술을 가르는 차이는 음성과 영상 생성이 순차적으로 이뤄지는 단계가 아니라 하나의 실시간 추론 경로에서 함께 작동한다는 점이다. 두 과정을 결합해 자연스러운 대화 흐름을 유지할 만큼 지연 시간을 낮췄다. Google은 음성과 영상 출력 모두에 SynthID 워터마크를 눈에 띄지 않게 삽입한다. 스트림을 녹화한 뒤 나중에 재생하더라도 매초 AI 생성 콘텐츠임을 식별할 수 있는 기계 판독용 태그가 남는다. 워터마크는 재인코딩을 거쳐도 유지되므로, 내보낸 영상 클립의 출처를 검증할 수 있다.

인도 전역에서 기업용 서비스를 운영하는 Equal AI는 이 기술이 실제 운영 규모에서 무엇을 가능하게 하는지 가장 분명하게 보여준다. 지원 언어는 총 97개이며, 인도 언어 9개를 동시에 활성화해 하루 100만 건이 넘는 실시간 통화를 처리한다. 이와 같은 가동률과 근무 일정 범위를 인간 상담원으로 구현하려면 경제적으로 감당하기 어렵다. 이 배포의 설계 전제는 개념 증명이 아니라 처리량이다.

이번 출시에서 공개되지 않은 것은 가격이다. Google은 비용을 발표하지 않고 문의는 기업 영업팀으로 안내하고 있다. 조직이 자체 참고 이미지를 바탕으로 얼굴을 만드는 맞춤형 아바타 제작 기능을 이용하려면 별도의 검증 절차를 거쳐 기업용 허용 목록에 등록돼야 하며, 셀프서비스로 이용할 수는 없다. Live 모델의 Extended Thinking 기능은 아직 비공개 프리뷰 단계에 머물러 있어, 다른 Gemini 제품에 비해 추론의 깊이가 제한된다. 동시 세션 한도도 공개되지 않았다. 가격과 용량을 발표하는 대신 협의를 통해 정하는 Google의 단계별 기업용 출시 방식에 비춰 보면, 이번에도 제한적으로 공개한 것은 일관된 행보다.

Live Avatar를 탑재한 Gemini 3.8 Live는 현재 Gemini Enterprise 콘솔과 Live API에서 이용할 수 있으며, 미국과 유럽연합에 엔드포인트를 두고 있다. Live 모델의 Extended Thinking 기능은 현재 비공개 프리뷰 참여자 외에 더 널리 제공할 일정이 아직 공개되지 않았다.

이 기술이 답해주지 못하는 질문은 이를 도입하는 기업들이 답하게 될 것이다. 자동화된 응대임을 드러내는 시각적 신호를 없애면 사용자의 경험이 나아질까, 아니면 자동화가 이뤄지고 있다는 사실을 솔직하게 알려주는 마지막 단서마저 사라질까.

태그: , , , , ,

Google에서 추가하기

토론

댓글 0개가 있습니다.