Qwen2.5-Max 공개: 대규모 MoE 모델의 지능 탐구 및 API 제공
Qwen 팀이 20조 개 이상의 토큰으로 사전 학습된 대규모 MoE 모델 Qwen2.5-Max를 공개하고 Alibaba Cloud API를 통해 제공한다. 이 모델은 주요 벤치마크에서 선도적인 모델들과 비교하여 우수한 성능을 보인다.
Qwen 팀은 대규모 MoE(Mixture-of-Expert) 모델인 Qwen2.5-Max를 공개하고, Alibaba Cloud API를 통해 개발자들에게 제공한다. 이 모델은 20조 개 이상의 토큰으로 사전 학습되었으며, SFT(Supervised Fine-Tuning)와 RLHF(Reinforcement Learning from Human Feedback) 방법론을 통해 후속 학습 과정을 거쳤다. Qwen2.5-Max는 Qwen Chat에서도 직접 사용 가능하며, API 모델명은 `qwen-max-2025-01-25`이다.
이번 모델 출시는 데이터 및 모델 크기 확장이 모델 지능 향상에 중요한 역할을 한다는 광범위한 인식 속에서 이루어졌다. 그러나 연구 및 산업계에서는 밀집(dense) 모델이든 MoE 모델이든 초대규모 모델을 효과적으로 확장하는 데 대한 경험이 제한적이었다. 최근 DeepSeek V3의 출시를 통해 이러한 확장 과정의 핵심 세부 사항들이 공개되었으며, Qwen 팀은 이와 동시에 Qwen2.5-Max를 개발하여 대규모 언어 모델의 지능을 한층 더 끌어올리는 데 기여한다.
Qwen2.5-Max의 성능은 MMLU-Pro(대학 수준 지식), LiveCodeBench(코딩 능력), LiveBench(종합 능력), Arena-Hard(인간 선호도 근사), GPQA-Diamond 등 다양한 벤치마크를 통해 평가되었다. 인스트럭트 모델(instruct model) 비교에서는 DeepSeek V3, GPT-4o, Claude-3.5-Sonnet과 같은 선도적인 모델들과 경쟁했다. Qwen2.5-Max는 Arena-Hard, LiveBench, LiveCodeBench, GPQA-Diamond 벤치마크에서 DeepSeek V3를 능가하는 성능을 보였으며, MMLU-Pro에서도 경쟁력 있는 결과를 나타냈다.
기반 모델(base model) 성능 비교에서는 독점 모델인 GPT-4o 및 Claude-3.5-Sonnet에 대한 접근이 불가능하여, 선도적인 오픈웨이트 MoE 모델인 DeepSeek V3, 가장 큰 오픈웨이트 밀집 모델인 Llama-3.1-405B, 그리고 최상위 오픈웨이트 밀집 모델 중 하나인 Qwen2.5-72B와 비교가 진행되었다. 이 비교에서 Qwen2.5-Max 기반 모델은 대부분의 벤치마크에서 상당한 우위를 입증했다. Qwen 팀은 후속 학습 기술의 발전을 통해 다음 버전의 Qwen2.5-Max 성능이 더욱 향상될 것으로 기대한다.
개발자들은 Qwen2.5-Max API를 활용하여 다양한 애플리케이션을 구축할 수 있다. Qwen API는 OpenAI-API와 호환되므로, 기존 OpenAI API 사용 방식과 유사하게 모델을 통합할 수 있다. 이를 위해 Alibaba Cloud 계정을 등록하고 Alibaba Cloud Model Studio 서비스를 활성화한 후, 콘솔에서 API 키를 생성해야 한다. Python을 이용한 API 호출 예시가 제공되어 개발자들이 쉽게 시작할 수 있도록 지원한다.
Qwen 팀은 데이터 및 모델 크기 확장이 모델 지능 향상뿐만 아니라 선구적인 연구에 대한 지속적인 노력을 반영한다고 강조한다. 향후 연구 방향으로는 확장된 강화 학습의 혁신적인 적용을 통해 대규모 언어 모델의 사고 및 추론 능력을 향상시키는 데 전념할 계획이다. 이러한 노력은 모델이 인간 지능을 초월하여 미지의 지식 영역을 탐색할 잠재력을 열어줄 것으로 기대된다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Qwen (Alibaba)
Qwen2.5-Max: Exploring the Intelligence of Large-scale MoE Model
원문 발행: 2025-01-29 00:00:04
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 엔비디아, 추가 훈련 없는 표 데이터 파운데이션 모델 쿠모 태뷸러 공개 · Hugging Face Blog · 2026-09-30
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.