바이두, 새로운 AI 모델이 GPT-5를 능가한다고 주장

xtalfi

11.12 21:44

(퍼플렉시티가 정리한 기사)

바이두는 11월 11일 ERNIE-4.5-VL-28B-A3B-Thinking을 공개했다. 이는 오픈소스 멀티모달 AI 모델로, 중국 기술 대기업은 이 모델이 여러 벤치마크에서 OpenAI의 GPT-5와 구글의 Gemini 2.5 Pro를 능가한다고 주장한다. 이번 출시는 중국과 서구 기술 기업 간 격화되는 인공지능 경쟁에서 중요한 확대를 의미한다.

허용적인 Apache 2.0 라이선스로 공개된 이 모델은 총 280억 개의 파라미터를 가진 전문가 혼합(Mixture-of-Experts) 아키텍처를 사용하지만, 추론당 30억 개만 활성화하여 높은 성능을 유지하면서도 계산 비용을 획기적으로 줄인다. 바이두의 발표에 따르면, 이 모델은 문서 및 차트 이해 분야의 VQA, MMBench, SEED-Bench 평가에서 Gemini 2.5 Pro를 능가한다.

효율성과 성능의 만남

경량 설계를 통해 ERNIE-4.5-VL은 비슷한 수준의 전체 매개변수 모델보다 2~3배 빠른 추론 속도를 제공하면서도 훨씬 적은 메모리를 요구합니다. 이 모델은 이미지의 특정 영역을 확대하고, 잘라낸 뷰를 분석하며, 국소적 관찰을 종합적인 답변으로 통합할 수 있는 혁신적인 "이미지를 통한 사고(Thinking with Images)" 기능을 도입했습니다.

바이두 연구진은 동적 난이도 샘플링을 적용한 GSPO 및 IcePop을 포함한 고급 강화 학습 전략을 활용하여 대규모 시각-언어 추론 데이터에 대한 광범위한 중간 학습 단계를 통해 이 모델을 훈련했습니다. 이 모델은 시각적 추론, STEM 문제 해결, 시각적 그라운딩, 도구 활용 및 비디오 이해 분야에서 뛰어난 성능을 발휘합니다.

전략적 오픈소스 추진

이번 출시는 중국이 미국 기업들과 경쟁하기 위해 오픈소스 AI 전략을 강화하는 가운데 이루어졌습니다. 최근 분석에 따르면, 중국은 오픈소스 AI 다운로드에서 미국을 앞질렀으며, DeepSeek, Alibaba, Baidu 같은 기업들이 서구 경쟁사들보다 더 빠르고 저렴하게 고성능 모델을 생산할 수 있음을 입증하고 있습니다.

남가주대학교(University of Southern California)의 Sean Ren은 CNBC에 "주요 연구소가 강력한 모델을 오픈소스로 공개할 때마다 업계 전체의 기준이 높아진다"고 말했습니다. 이러한 움직임은 독점 API와 프리미엄 가격에 의존하는 OpenAI와 Anthropic 같은 비공개 소스 제공업체들에 압박을 가하고 있습니다.

Baidu는 11월 13일 베이징에서 열리는 Baidu World 2025 컨퍼런스에서 ERNIE 라인업과 추가 AI 발전 사항을 선보일 예정입니다. 이는 중국의 경쟁적인 AI 환경에서 선두주자로서의 입지를 굳히기 위한 노력의 일환입니다.