OpenAI가 오디오, 비전, 텍스트를 실시간으로 추론할 수 있는 ChatGPT의 새로운 플래그십 모델인 GPT-4o(omni)를 공식 발표했다.
GPT-4o는 훨씬 더 자연스러운 인간-컴퓨터 상호 작용을 향한 한 단계로 텍스트, 오디오 및 이미지의 모든 조합을 입력으로 받아들이고, 텍스트, 오디오 및 이미지 출력의 조합을 생성한다.
GPT-4o는 232ms(밀리세컨드) 안에 오디오 입력에 응답할 수 있는데 이는 평균 320ms인 인간의 응답 시간과 비슷하다. 대화 중 영어 및 코드 텍스트의 GPT-4 Turbo 성능과 일치하며, 영어가 아닌 언어의 텍스트에 상당한 개선이 이뤄져 API에서 훨씬 빠르고 50% 저렴하다. 특히 기존 모델에 비해 시각 및 청각 이해도가 더 뛰어난 것으로 알려졌다.
OpenAI에 따르면 GPT-4o 이전에는 음성 모드를 사용하여 평균 2.8초(GPS-3.5) 및 5.4초(GPT-4)의 지연 시간으로 ChatGPT와 대화할 수 있었는데, 이를 달성하기 위한 음성 모드는 오디오를 텍스트로 변환하고, 텍스트를 가져와 텍스트를 출력하며, 이를 다시 오디오로 변환하는 과정을 거치면서 지능의 주요 원천인 GPT-4가 음색, 여러 화자 또는 배경 소음과 같은 정보를 직접 입력받지 못하고 웃음, 노래 또는 감정 표현을 출력할 수 없었다고 한다.
그러나 GPT-4o를 통해 텍스트, 비전, 오디오 전반에 걸쳐 새로운 단일 모델을 처음부터 끝까지 훈련함으로써 모든 입력과 출력이 동일한 신경망에서 처리되된다고 한다. 다만 GPT-4o는 이러한 모든 양식을 결합한 첫 번째 모델이기 때문에 여전히 모델이 수행할 수 있는 작업과 한계를 탐색하는 표면적인 단계에 불과하다고 설명했다.
기존 벤치마크에서 측정한 바와 같이 GPT-4o는 텍스트, 추론 및 코딩 지능에서 GPT-4 Turbo 수준의 성능을 달성하는 동시에 다국어, 오디오 및 비전 기능에서 새로운 최고 수준을 설정했다.
영어 뿐만 아니라 20개 언어는 다양한 언어군에 걸친 새로운 토크나이저 압축을 대표하는 언어로 선택되었는데, 한국의 경우 45개에서 27개로 1.7배 가량의 감소 효과를 보인 것으로 나타났다.
OpenAI는 GPT-4o의 텍스트 및 이미지 기능이 오늘부터 ChatGPT에서 출시되기 시작했으며, 무료 계층에서 GPT-4o 사용할 수 있고 Plus 사용자에게는 최대 5배 더 높은 메시지 제한을 제공할 거라고 밝혔다. 앞으로 몇 주 안에 ChatGPT Plus 내에서 GPT-4o 알파 버전의 음성 모드 새 버전을 출시할 예정이다.
개발자는 이제 API에서 텍스트 및 비전 모델로 GPT-4o에 액세스 할 수 있으며, GPT-4o는 GPT-4 Turbo에 비해 2배 빠르고 가격은 절반이며 속도 제한은 5배 더 높다.
그 밖에 OpenAI는 앞으로 몇 주 안에 API의 신뢰할 수 있는 소규모 파트너 그룹에 GPT-4o의 새로운 오디오 및 비디오 기능에 대한 지원을 시작할 계획이라고 덧붙였다. |