한국어 箭头
Podcast Cover

[불완전 정보 게임의 정복: AI 'DeepStack'과 포커 전략의 혁신]-[Ep. 15: How AI Beat the Pros at Texas Hold'em, and Why It Matters]

NVIDIA AI Podcast · B2 · 2017-03-25

Technology
또는 웹버전으로 공부하세요

📋 Summary

불완전 정보 게임의 정복: AI 'DeepStack'과 포커 전략의 혁신

NVIDIA AI 팟캐스트에 출연한 앨버타 대학교의 마이클 볼링(Michael Bolling) 교수는 인공지능 연구의 새로운 지평을 연 'DeepStack'에 대해 심도 있는 대화를 나누었습니다. 체스나 바둑과 같은 '완전 정보 게임'과 달리, 포커는 상대방의 패를 알 수 없는 '불완전 정보 게임'으로서 AI에게 훨씬 더 복잡한 도전 과제를 제시합니다.

1. 포커가 AI에게 어려운 이유: 불확실성과 심리전

체스나 바둑은 보드 위에 모든 정보가 드러나 있어 현재 상태만으로 판단이 가능합니다. 반면, 볼링 교수는 포커를 **"상대방의 카드를 알 수 없다는 점이 본질인 게임"**이라고 정의합니다. 단순히 카드를 보는 것을 넘어, 상대의 베팅 액션(betting actions)을 통해 상대가 가진 패를 추론하고, 동시에 자신의 패를 숨겨야 하는 고도의 심리적, 수학적 전략이 요구됩니다. 특히 '헤즈업 노 리미트 텍사스 홀덤(Heads Up No Limit Texas Hold'em)'은 결정 가능한 경우의 수가 우주의 원자 수보다 많은 10의 160승에 달해, 기존의 고전적인 탐색 방식으로는 해결이 불가능합니다.

2. DeepStack의 핵심: 직관(Intuition)과 즉석 추론

DeepStack은 게임 시작 전 모든 경우의 수를 계산하는 대신, 게임이 진행되는 동안 실시간으로 판단을 내리는 방식을 택했습니다. 볼링 교수는 이를 **'DeepStack의 직관'**이라고 부릅니다.

  • 의식적 추론 단계: 게임의 다음 몇 단계만을 짧게 예측하여 베팅 전략을 수립합니다.
  • 직관 단계: 더 이상 계산이 불가능한 시점에서, 딥러닝을 통해 학습된 '직관'을 사용하여 현재 상황의 가치를 즉각적으로 평가합니다.

이러한 접근은 DeepStack이 슈퍼컴퓨터 없이도 일반 게이밍 노트북(GTX 1080 GPU 기반) 환경에서 프로 선수들을 상대로 승리할 수 있는 원동력이 되었습니다. 이는 단순히 모든 수를 계산하는 것이 아니라, 인간처럼 경험을 통해 상황을 일반화하고 판단하는 방식을 모사한 것입니다.

3. 자기 대국(Self-play)을 통한 학습

DeepStack은 스스로와 끊임없이 대국하며 학습합니다. 볼링 교수는 이를 '후회(regret) 최소화' 과정이라고 설명합니다. AI는 매 액션마다 '내가 다른 선택을 했다면 결과가 어땠을까?'를 계산하며, 좋은 패를 가졌을 때 폴드(fold)한 것에 대해 후회를 느끼고, 이를 보완하기 위해 전략을 수정합니다. 이러한 반복적인 '스파링(sparring)'을 통해 AI는 블러핑(bluffing)의 최적 확률을 스스로 깨닫게 되며, 상대방이 자신의 패를 예측하지 못하게 만드는 수학적 균형점을 찾아갑니다.

4. AI의 미래와 사회적 적용

볼링 교수는 포커 연구가 단순히 게임을 이기기 위한 것이 아니라, **'불확실성 속에서의 의사결정'**이라는 AI의 근본적인 한계를 극복하기 위함이라고 강조합니다. 이는 현실 세계의 보안 인프라 배치, 자원 할당 등 정보가 제한된 상황에서 최적의 전략을 수립해야 하는 다양한 분야에 응용될 수 있습니다.

결론적으로 DeepStack은 인간의 직관과 논리적 추론을 결합한 새로운 AI 패러다임을 제시했습니다. 볼링 교수는 앞으로도 프로 선수들과의 '프리즈 아웃(freeze-out)' 토너먼트 등을 통해 AI의 한계를 시험하며, 기술적 발전을 지속할 계획임을 밝혔습니다.

🎯Key Sentences

1
I'm glad to be on the show.
오늘 쇼에 출연하게 되어 기쁩니다.
2
Right. I can see that.
네, 알겠습니다.
3
It's a huge part of the game.
그것은 게임에서 아주 큰 부분을 차지합니다.
4
I actually don't have much patience for the game.
솔직히 말해서 저는 그 게임에 별로 끈기가 없어요.
5
Let's see what happens.
어떻게 되는지 한번 봅시다.
모두 펼치기

📝Key Phrases

1
to be precise
정확히 말하자면
2
a field of
…의 분야
3
as it compares to
에 비해
4
the likes of
…와 같은 것들, …따위
5
give away
나눠주다
모두 펼치기

📖 Transcript

Welcome to NVIDIA's AI podcast where we explore the expanding world of artificial intelligence.
It's been 20 years now since IBM's chess-playing computer Deep Blue beat world chess champion Garry Kasparov in a six-game rematch.
More recently, Google's AI-powered AlphaGo beat Lee Sedol in a five-game Go match, and that was just last year in 2016.
So it turns out we love building machines and systems to challenge humans and games.
And that is what our guest, Professor Michael Bolling, has done. but not for chess or go, but for poker.
And to be precise, heads up, no limit, Texas Hold'em.

ListenLeap이 실제 문맥에서 학습하도록 이끌어줌

🎨 흥미로운 콘텐츠
🌍 실제 자료
📱 언제든 듣고 보기