한국어 箭头
Podcast Cover

[AI의 미래를 여는 핵심 기술: Mixture of Experts(MoE)와 인프라의 진화]-[Lowering the Cost of Intelligence With NVIDIA's Ian Buck - Ep. 284]

NVIDIA AI Podcast · B2 · 2025-12-29

Technology
또는 웹버전으로 공부하세요

📋 Summary

AI 모델의 새로운 표준, Mixture of Experts (MoE)

현재 인공지능 업계에서 가장 주목받는 기술은 단연 **Mixture of Experts (MoE)**입니다. NVIDIA의 Ian Buck 부사장은 최근 팟캐스트에서 MoE가 어떻게 AI 모델의 지능을 높이면서도 비용을 획기적으로 절감하는지 설명했습니다. 과거의 신경망 모델은 질문 하나를 처리하기 위해 모델 내의 모든 파라미터(뉴런)를 활성화해야 했습니다. 이로 인해 모델이 거대해질수록 연산 속도는 느려지고 비용은 기하급수적으로 증가하는 문제가 발생했습니다.

MoE는 모델을 여러 개의 작은 '전문가(Experts)'로 나누어, 질문의 성격에 따라 필요한 전문가만을 활성화하는 방식을 취합니다. 예를 들어, 4050억 개의 파라미터를 가진 모델이 모든 뉴런을 사용하는 대신, 1200억 개의 파라미터를 가진 MoE 모델은 질문을 처리할 때 약 50억 개의 파라미터만 활성화합니다. 이러한 '압축 메커니즘' 덕분에 모델은 더 스마트해지면서도 실제 추론 비용은 10분의 1 수준으로 낮아질 수 있게 되었습니다.

전문가의 배분과 라우터의 역할

MoE의 핵심은 모델이 스스로 지식의 덩어리(pockets of knowledge)를 형성한다는 점입니다. 이는 인위적으로 수학이나 과학 등 특정 분야를 하드코딩하는 것이 아니라, 데이터를 학습하는 과정에서 자연스럽게 그룹화됩니다. 이때 **'라우터(Router)'**라는 구성 요소가 질문의 맥락을 파악하여, 해당 문제를 가장 잘 해결할 수 있는 전문가에게 요청을 전달합니다. 이러한 구조는 마치 각 분야의 전문가들이 협업하는 회사 조직과 유사하며, 이를 통해 연산 효율성을 극대화합니다.

DeepSeek 모멘텀과 인프라의 중요성

MoE 구조가 대중적으로 주목받게 된 결정적 계기는 약 1년 전 'DeepSeek 모멘텀'이었습니다. DeepSeek 연구진은 MoE를 극한으로 활용해 세계 최고 수준의 모델을 구현했고, 이는 업계에 큰 충격을 주었습니다. 하지만 MoE는 단순히 모델 구조의 문제가 아닙니다. 전문가들이 연산 과정에서 서로 데이터를 주고받는 '통신' 과정에서 발생하는 숨겨진 비용이 존재하기 때문입니다.

Ian Buck은 이를 해결하기 위해 NVLink와 같은 고속 연결 기술이 필수적이라고 강조합니다. 단순히 GPU 개수를 늘리는 것이 아니라, 72개의 GPU가 마치 하나의 거대한 GPU처럼 작동하게 만드는 인프라가 갖춰져야만 통신 병목 현상을 방지할 수 있습니다. 실제로 NVIDIA의 GB200 NVL72 아키텍처는 이러한 극한의 공동 설계(Extreme Co-design)를 통해 이전 세대 대비 토큰당 비용을 10배 이상 절감하는 성과를 거두었습니다.

AI의 미래: 지능의 가성비와 기술의 선순환

AI의 발전 방향은 단순히 모델의 크기를 키우는 것이 아니라, 지능당 비용(Cost of Intelligence)을 낮추는 것입니다. Ian Buck은 "지능이 기회를 창출한다"며, MoE가 챗봇뿐만 아니라 신약 개발, 기상 예측, 로보틱스 등 과학 전반에 걸쳐 활용될 것이라고 전망했습니다.

결론적으로, NVIDIA가 추구하는 미래는 하드웨어와 소프트웨어가 밀접하게 결합된 '극한의 공동 설계'를 통해 더 똑똑한 모델을 더 저렴하게 운영하는 것입니다. 이는 복잡성을 높여 비용이 상승하는 것처럼 보일지라도, 결과적으로는 X-factor 수준의 성능 향상을 이끌어내어 AI 대중화를 가속화하는 선순환 구조를 만들고 있습니다.

🎯Key Sentences

1
So let's jump right into it.
그럼 바로 본론으로 들어가 보죠.
2
What does mixture of experts mean?
전문가 혼합 모델(Mixture of Experts)이 무엇을 의미하나요?
3
That's a very expensive person to hire and have on staff.
그 사람을 채용해서 직원으로 두기에는 비용이 너무 많이 듭니다.
4
It makes a lot of sense why they're MOE.
그들이 왜 MOE인지 충분히 이해가 가네요.
5
It's everywhere you know, including the news, the business section, if you will.
뉴스나 경제면을 포함해서, 어디를 가나 그 얘기뿐이에요.
모두 펼치기

📝Key Phrases

1
jump right into it
바로 본론으로 들어가죠.
2
in lay terms
알기 쉽게 설명하자면
3
come on the scene
현장에 나타나다
4
put some numbers behind it
그 뒤에 숫자를 좀 붙여주세요.
5
fast forward to
시간을 건너뛰어 ~로 넘어가다
모두 펼치기

📖 Transcript

Hello, and welcome to the NVIDIA AI Podcast.
I'm your host, Noah Kravitz.
Ian Buck is here with us today.
Ian is Vice President of Hyperscale and High-Performance Computing here at NVIDIA, and he's here to discuss mixture of experts, the architecture powering the world's leading frontier models and how extreme co-design can both drive down the cost of generating intelligence today and future-proof your AI platform for whatever advances come tomorrow.
Ian, welcome.
Thanks so much for taking the time to join the podcast.

ListenLeap이 실제 문맥에서 학습하도록 이끌어줌

🎨 흥미로운 콘텐츠
🌍 실제 자료
📱 언제든 듣고 보기