Podcast Cover

[AI의 미래: 비디오 생성 모델에서 범용 언어 모델로의 전환]-[Why Video Agent models are next — Ethan He, xAI Grok Imagine]

Latent Space: The AI Engineer Podcast · B2 · 2026-06-01

AI
또는 웹버전으로 공부하세요

📋 Summary

AI 모델링의 진화: 비디오 생성에서 월드 모델까지

최근 팟캐스트에 출연한 이선 헤(Ethan He)는 NVIDIA의 'Cosmos' 프로젝트부터 XAI의 'Grok Imagine'에 이르기까지 비디오 생성 AI 분야의 최전선에서 경험한 기술적 여정을 공유했습니다. 그는 비디오 생성 모델이 단순한 픽셀 생성을 넘어, 실시간 상호작용이 가능한 '월드 모델(World Model)'로 진화하고 있다고 설명합니다.

1. 비디오 생성의 핵심 기술과 데이터 전략

비디오 생성 모델을 구축할 때 가장 큰 도전 과제는 데이터의 상관관계입니다. 인터넷상의 비디오와 텍스트는 서로 일치하지 않는 경우가 많기 때문에, 고품질의 '합성 데이터(Synthetic Data)'를 생성하는 것이 필수적입니다. 이선 헤는 blind person(시각 장애인)이 텍스트 설명만으로 비디오의 내용을 재구성할 수 있을 만큼 상세한 묘사가 필요하다고 강조했습니다. 또한, 효율적인 학습을 위해 VAE(Variational Autoencoder)를 사용하여 비디오를 잠재 공간(Latent Space)으로 압축하고, 이를 통해 토큰 수를 줄이는 과정이 필수적임을 언급했습니다.

2. '월드 모델'의 정의와 실시간성

이선 헤는 자신이 정의하는 월드 모델을 '실시간, 상호작용 가능, 장기 기억(Long-horizon)을 갖춘 비디오 생성'으로 규정합니다. 특히 '플립북(Flipbook)'과 같은 데모를 통해 생성형 UI가 어떻게 미래의 인터페이스를 대체할 수 있는지 보여주었습니다. 그는 인퍼런스 비용이 하락함에 따라, 향후 모든 웹 페이지와 UI가 고정된 코드가 아닌 실시간 생성형 픽셀로 대체되는 시대가 올 것이라고 예측했습니다.

3. 언어 모델이 주도하는 비주얼 인텔리전스

놀라운 점은 비디오 모델의 성능 향상이 모델 그 자체보다는 '언어 모델(LLM)'의 지능에서 비롯된다는 점입니다. 이선 헤는 Grok Imagine의 성공 요인 중 하나로 강력한 '프롬프트 재작성기(Prompt Rewriter)'를 꼽았습니다. 사용자로부터 입력받은 단순한 명령을 LLM이 매우 상세한 비디오 묘사로 변환해주기 때문에, 비디오 생성 모델은 이를 바탕으로 고품질의 결과물을 만들어낼 수 있습니다. 즉, 시각적 모델은 '지능'을 가진 언어 모델의 지시를 수행하는 도구의 역할을 하게 됩니다.

4. 비디오 에이전트와 미래의 전망

향후 1년 내에 '비디오 에이전트'가 프로덕션급 품질의 영상 콘텐츠를 생성하는 주류가 될 것이라고 이선 헤는 전망합니다. 비디오 에이전트는 단순히 모델의 출력에 의존하는 것이 아니라, FFmpeg와 같은 전통적인 도구를 직접 호출하고, 반복적으로 결과를 수정하며, 긴 시간의 영상을 생성할 수 있는 능력을 갖추게 됩니다. 이는 코딩 모델이 단순 자동 완성을 넘어 에이전트 형태로 진화한 것과 유사한 궤적을 걷고 있습니다.

5. 결론: LLM으로의 집중

이선 헤는 XAI를 떠나며 자신의 연구 방향을 언어 모델(LLM) 쪽으로 옮길 계획임을 밝혔습니다. 그는 비디오 모델의 한계를 돌파하기 위해서는 모델의 컨텍스트 관리 능력과 스스로를 프로그래밍하는 '자기 수정적 에이전트(Self-modifying agent)' 연구가 핵심이라고 주장합니다. 모델이 자신의 컨텍스트가 80% 이상 찼음을 인지하고 스스로 정보를 압축하거나, 필요한 도구를 호출하여 문제를 해결하는 방식이 차세대 AI의 핵심이 될 것입니다.

🎯Key Sentences

1
I learned a lot, I think three years non-stop.
정말 많은 걸 배웠어요. 3년 내내 쉼 없이 배운 것 같아요.
2
I cannot comment specifically how I did, but it's a quite standard process.
어떻게 했는지 구체적으로 언급할 수는 없지만, 꽤 일반적인 절차를 따랐습니다.
3
That speed up things a lot.
그 덕분에 일이 훨씬 빨라졌어요.
4
It's kind of boring, but a lot of the improvements does not come from new algorithms.
좀 지루하긴 하지만, 상당 부분의 개선은 새로운 알고리즘에서 비롯되는 것이 아니에요.
5
Those give the biggest boost to the model quality.
모델 품질을 가장 크게 향상시키는 요소들입니다.
모두 펼치기

📝Key Phrases

1
bring us up to speed
지금까지의 상황을 간략하게 설명해 주세요.
2
scaling law
스케일링 법칙
3
compute resources
컴퓨팅 자원
4
communication bandwidth
통신 대역폭
5
counterintuitive
직관에 반하는
모두 펼치기

📖 Transcript

Okay, we're here in the studio with Ethan He, most recently of XAI.
Welcome.
Yes, thank you.
Glad being here.
We're also here with Vibhu.
You were first coming to us or joining the late in space world because you were working on Cosmos and NVIDIA and you did a great paper.

ListenLeap이 실제 문맥에서 학습하도록 이끌어줌

🎨 흥미로운 콘텐츠
🌍 실제 자료
📱 언제든 듣고 보기