한국어 箭头
Podcast Cover

[AI를 통한 수어와 언어의 장벽 허물기: 시드 아흐메드의 비전]-[Ep. 28: How Syed Ahmed Taught AI to Translate Sign Language]

NVIDIA AI Podcast · B2 · 2017-06-28

Technology
또는 웹버전으로 공부하세요

📋 Summary

AI를 활용한 수어 번역의 혁신

최근 NVIDIA의 AI 팟캐스트에서는 학부생 연구원인 시드 아흐메드(Syed Ahmed)가 수어를 영어로 실시간 번역하는 딥러닝 모델에 대해 소개했다. 이 기술은 청각 장애인과 비장애인 사이의 의사소통 방식을 근본적으로 변화시킬 잠재력을 가지고 있다. 현재 청각 장애인들은 주로 글을 쓰거나 타이핑을 통해 소통하지만, 이 모델은 수어 영상을 실시간으로 텍스트 캡션으로 변환하여 스마트폰이나 홀로렌즈(HoloLens)와 같은 웨어러블 기기에 투영하는 방식을 지향한다.

기술적 접근: 영상을 시퀀스로 해석하기

아흐메드는 수어 번역을 '비디오를 시퀀스로 처리하는 과정'으로 정의한다. 그는 "영어를 벡터의 시퀀스로 표현할 수 있듯이, 비디오 역시 프레임 단위의 시퀀스로 분석할 수 있다"고 설명한다. 수어에는 손동작, 표정, 보디랭귀지가 포함되는데, 그는 이를 "비디오의 ABCD"라고 지칭하며, 고차원의 비디오 데이터를 텍스트라는 저차원으로 매핑하여 복잡성을 줄이는 방식을 취하고 있다. 모델 학습을 위해 CCNY에서 공개한 17,000개의 유튜브 영상과 캡션 쌍을 데이터셋으로 활용하였으며, 이를 통해 알고리즘이 'hello'나 'goodbye'와 같은 수어의 의미를 반복적으로 학습하게 했다.

실시간 처리와 데이터의 중요성

실시간 번역의 핵심 과제는 처리 지연(lag)을 최소화하는 것이다. 아흐메드는 TensorFlow의 XLA 컴파일러를 통한 그래프 크기 최적화와 NVIDIA Jetson과 같은 고성능 하드웨어 배포를 통해 이 문제를 해결하고자 한다. 또한, 그는 "모델은 데이터셋만큼만 우수하다(your model is as good as your data set)"는 점을 강조하며, 형식적인 수어뿐만 아니라 전 세계의 다양한 구어체 수어(colloquial sign languages)를 포함한 방대한 데이터 확보가 모델의 견고함을 결정짓는 핵심 요소라고 언급했다.

미래 전망: 보편적 소통 도구로서의 AI

아흐메드의 궁극적인 비전은 사용자가 기기를 직접 조작하지 않아도 되는 '증강 현실(augmented reality)' 환경이다. 그는 특정 언어의 장벽을 넘어 보편적인 공통 언어를 찾는 '유니버설 링구아(universal lingua)' 개념이 수어와 일반 언어 사이에도 적용될 수 있다고 믿는다.

이러한 '비디오-텍스트 변환' 기술은 단순히 수어 번역에 그치지 않는다. 아흐메드는 이를 비디오 요약(video summarization)이나 의료 분야에도 적용할 수 있다고 설명한다. 예를 들어, 보행 패턴을 분석하여 신경 손상이나 골다공증 같은 건강 상태를 조기에 진단하는 시스템 등, 영상 속에 인코딩된 방대한 정보를 유의미한 데이터로 치환하는 다양한 응용 가능성을 제시했다. 아흐메드의 연구는 기술이 단순히 정보를 전달하는 도구를 넘어, 인간의 소통 방식을 확장하고 삶의 질을 개선할 수 있음을 보여주는 중요한 사례이다.

🎯Key Sentences

1
how did this come about?
어쩌다 이렇게 된 거죠?
2
so what would you do in that case
그럼 그런 상황에서는 어떻게 하시겠어요?
3
if there's no facility for that at the moment
현재로서는 그와 관련된 시설이 마련되어 있지 않다면
4
Maybe it's something else.
아마 다른 이유가 있을지도 모르겠네요.
5
just a new form of communication.
그저 새로운 형태의 소통 방식일 뿐이에요.
모두 펼치기

📝Key Phrases

1
revert to
~로 되돌리다
2
in a timely fashion
적시에
3
data-driven approach
데이터 기반 접근 방식
4
ongoing problem
지속적인 문제
5
out in the wild
야생에서
모두 펼치기

📖 Transcript

Welcome to NVIDIA's AI Podcast, recording from the floor of the 2017 GPU Technology Conference. a gathering of the AI faithful here in San Jose, California.
We all know how far AI, and in particular deep learning, have pushed speech recognition. whether that is an Apple Siri, Amazon's Alexa, or Google Assistant.
Our guest on this segment, Syed Ahmed, is directing the power of AI toward another form of communication, American Sign Language.
And what Syed has done is set up a deep learning model that translates American Sign Language into the English language.
Syed, welcome. Thank you. It's a pleasure to be here.
Now, tell us, you're an undergrad. Clearly, you're in the computer science department, I imagine. how did this come about?

ListenLeap이 실제 문맥에서 학습하도록 이끌어줌

🎨 흥미로운 콘텐츠
🌍 실제 자료
📱 언제든 듣고 보기