한국어 箭头
Podcast Cover

[복권 가설(Lottery Ticket Hypothesis): 신경망의 효율성과 미래]-[MIT’s Jonathan Frankle on “The Lottery Hypothesis” - Ep. 115]

NVIDIA AI Podcast · B2 · 2020-04-14

Technology
또는 웹버전으로 공부하세요

📋 Summary

복권 가설과 신경망의 효율성: Jonathan Frankel과의 대담

NVIDIA AI 팟캐스트의 이번 에피소드에서는 MIT의 박사 과정 학생이자 AI 연구자인 조나단 프랭클(Jonathan Frankel)을 초청하여, 그가 공동 저술한 '복권 가설(The Lottery Ticket Hypothesis)'에 대해 깊이 있는 논의를 진행했다.

신경망의 과도한 크기와 가지치기(Pruning)

프랭클은 현대의 신경망이 실제 필요한 것보다 10배에서 100배 이상 크다는 점을 지적한다. 수십억 개의 매개변수(parameters)를 가진 모델은 학습과 운영에 막대한 컴퓨팅 자원과 비용을 소모한다. 이를 해결하기 위해 수십 년 전부터 '신경망 가지치기(neural network pruning)' 기법이 사용되어 왔다. 이는 학습이 완료된 신경망에서 성능에 영향을 주지 않는 매개변수를 90% 이상 제거하는 방식이다. 하지만 프랭클은 기존의 의문, 즉 "왜 처음부터 작은 네트워크를 학습시킬 수는 없는가?"에 주목한다. 실험 결과, 가지치기된 네트워크의 구조를 그대로 가져와 처음부터 다시 학습시키면 성능이 현저히 떨어지는 현상이 발생했다.

복권 가설의 핵심 개념

프랭클이 제시한 '복권 가설'은 이 문제의 해답을 '초기값(initialization)'에서 찾는다. 그는 큰 신경망 안에 사실은 매우 작은 하위 네트워크(sub-network)가 존재하며, 이들이 학습 초기에 운 좋게 적절한 초기값을 받았기 때문에 학습이 성공적으로 이루어진다고 주장한다. 즉, 큰 네트워크는 수많은 하위 네트워크 중 성공할 가능성이 있는 '복권'을 찾기 위한 공간을 제공한 셈이다. 프랭클은 실험을 통해, 가지치기된 네트워크의 연결 구조와 그 당시의 동일한 초기값을 결합하면 다시 학습이 가능하다는 것을 증명했다.

연구의 함의와 한계

프랭클은 자신의 연구가 단순히 이론에 그치지 않고 실질적인 응용으로 이어질 수 있다고 본다. 첫째, 하위 네트워크를 효율적으로 찾는 전략을 개발하는 것, 둘째, 특정 작업에서 찾은 '복권'을 다른 작업에 전이(transfer learning)하여 재사용하는 것, 셋째, 더 나은 신경망 구조와 초기화 방식을 설계하는 통찰을 얻는 것 등이다. 다만, 그는 현재의 연구 결과가 상대적으로 작은 신경망에 국한되어 있다는 점을 강조하며, AI 분야의 과도한 '하이프(hype)'를 경계해야 한다고 역설한다. 그는 연구를 자연과학처럼 대하며 경험적 증거를 바탕으로 가설을 검증해야 한다고 믿는다.

정책과 기술의 균형

기술 연구 외에도 프랭클은 AI 정책 분야에서 활발히 활동하고 있다. 그는 기술적 이해도가 낮은 정책 결정자들에게 실질적인 도움을 주기 위해 조지타운 대학교에서 법대생들을 대상으로 프로그래밍을 가르치고, OECD의 신뢰할 수 있는 AI 원칙 수립에도 기여하고 있다. 그는 기술의 현장에 직접 머물러야만 정책 조언의 실효성을 높일 수 있다고 강조한다.

미래를 향한 전망

프랭클은 5년 후에는 '복권 가설'이라는 용어가 더 이상 언급되지 않기를 바란다고 말한다. 이는 그만큼 신경망의 작동 원리에 대한 인류의 이해가 성숙해져서, 지금의 단순한 가설이 과거의 유물처럼 느껴질 정도로 발전하기를 기대하기 때문이다. 그는 현재의 AI 이해 수준이 매우 원시적임을 인정하며, 앞으로 더 견고한 프레임워크를 통해 신경망의 학습과 오류, 개선 방안이 명확히 규명되기를 희망한다.

🎯Key Sentences

1
I can give you lots of different examples of this.
이것에 대한 다양한 예시를 얼마든지 보여드릴 수 있습니다.
2
This works really well.
이거 정말 효과가 좋네요.
3
This is being used actively to get networks onto your devices today.
이것은 현재 여러분의 기기에 네트워크를 연결하기 위해 활발하게 사용되고 있습니다.
4
It's a decades-old idea and technique, as you say.
말씀하신 대로, 그건 수십 년 된 아이디어이자 기술이죠.
5
What do you think my performance is gonna look like?
제 퍼포먼스가 어떨 것 같으세요?
모두 펼치기

📝Key Phrases

1
take a step back
한 발 물러서다
2
the big picture
큰 그림
3
with certainty
확실히
4
expensive proposition
비용이 많이 드는 제안
5
deal with something scientifically
어떤 일을 과학적으로 처리하다
모두 펼치기

📖 Transcript

Hello and welcome to the NVIDIA AI Podcast.
I'm your host, Noah Kravitz. In the spring of 2019, a paper published at the ICLR conference detailed what the MIT Technology Review called a simple but dramatic discovery. we've been using neural networks far bigger than we actually need.
In some cases, they're 10 or even 100 times bigger.
So training them costs us orders of magnitude more time and computational power than necessary.
Our guest today co-authored that paper, which is the subject of a GTC digital talk that he recorded for this year's online conference.
Deep Dive with Jonathan Frankel. The Lottery Ticket Hypothesis.

ListenLeap이 실제 문맥에서 학습하도록 이끌어줌

🎨 흥미로운 콘텐츠
🌍 실제 자료
📱 언제든 듣고 보기