AI

OpenAI 음성 AI, 더 이상 말할 차례를 기다리지 않는다 — 분당 $0.05

Susan Hill

현재 시장에 나와 있는 모든 음성 AI는 사용자에게 말하기 전에 기다리라고 요구한다. 하지만 OpenAI의 GPT-Live-1은 그렇지 않다. 이 모델은 OpenAI의 API를 통해 제공되며, 듣기와 말하기를 동시에 수행한다 — 사람이 통화 중에 하는 것처럼 끼어들기, 멈춤, 겹치는 말을 처리한다.

가격은 음성 레이어 기준 분당 0.05달러다 — 30분 대화에 1.50달러, 대화 1,000분당 50달러다. 개발자는 추론 백엔드에 대해 별도로 비용을 지불한다: OpenAI 자체의 GPT-6 Astra 또는 도구 호출과 비즈니스 로직을 처리하는 호환 가능한 모델이다. 음성 레이어는 대화의 메커니즘을 관리하고, 추론 레이어는 AI가 실제로 말하고 행동할 내용을 결정한다.

이러한 분리가 실제로 의미하는 바: 고객 서비스 봇이 “잠깐, 사실 다른 옵션을 원해요”라는 말을 문장 중간에 듣고 그에 반응할 수 있으며, 준비된 답변을 그대로 밀어붙이지 않는다. 언어 튜터는 학생이 단어를 더듬는 것을 기다리지 않고 바로 잡아줄 수 있다. 예약 시스템은 사람들이 같은 말을 반복하고, 마음을 바꾸고, 서로 말을 겹쳐 하는 현실의 통화를 처리할 수 있다.

Full Duplex Bench — 동시 방향 음성 처리를 테스트하기 위해 특별히 설계된 평가 — 에서 GPT-Live-1은 전작인 GPT-Realtime-2.1보다 30% 포인트 더 높은 점수를 기록했다. 추론 백엔드로 GPT-6 Astra와 함께 사용하면, 대화 중단 없이 복잡한 다단계 질의를 처리하는 고객 서비스 벤치마크인 Tau3에서 최고 성능을 보인다.

이러한 2계층 아키텍처는 의도적인 설계 선택을 반영한다. 음성 타이밍과 추론은 확장 방식이 다르기 때문에 별도로 과금된다: 경량 튜터링 앱을 구축하는 스타트업은 GPT-6 Astra에서 수천 개의 동시 고객 서비스 통화를 운영하는 기업보다 두 레이어 모두에서 비용이 적게 든다. 음성의 최저 요금은 분당 0.05달러이며, 뒤에서 어떤 모델이 실행되든 동일하다.

GPT-Live-1이 바꾸지 않는 것은 답변의 품질이다. 음성 레이어는 AI가 언제, 어떻게 말할지를 처리할 뿐, 무엇을 아는지는 관여하지 않는다. 적절한 타이밍의 나쁜 답변은 여전히 나쁜 답변이다. 고객 서비스 애플리케이션을 구축하는 개발자는 두 레이어를 별도로 평가해야 하며, 추론 백엔드가 음성 레이어 자체보다 청구 금액을 더 높일 수 있다. OpenAI는 또한 전이중(full-duplex) 아키텍처가 저대역폭 환경이나 잡음이 많은 전화 회선에서 어떻게 작동하는지에 대한 데이터를 공개하지 않았으며, 이러한 환경에서는 지속적인 오디오 입력을 유지하기가 더 어렵다.

GPT-Live-1은 현재 OpenAI의 API에서 사용할 수 있다. 회사는 이 모델을 기반으로 한 소비자용 제품을 발표하지 않았지만, 향후 ChatGPT 음성 모드 버전이 동일한 기본 아키텍처를 활용할 수 있다고 시사했다. 분당 0.05달러 요금은 출시 시점에 적용되며, OpenAI는 요금 변경 일정이나 음성 레이어와 함께 사용할 수 있는 승인된 타사 추론 모델 목록을 공개하지 않았다.

태그: , , , , ,

토론

댓글 0개가 있습니다.