한국어 箭头
Podcast Cover

[AI의 연료, 합성 데이터(Synthetic Data)의 현재와 미래: Rendered AI CEO 네이선 쿤츠 인터뷰]-[Rendered.ai CEO Nathan Kundtz on Using AI to Build Better AI - Ep. 177]

NVIDIA AI Podcast · B2 · 2022-08-31

Technology
또는 웹버전으로 공부하세요

📋 Summary

인공지능의 새로운 연료: 합성 데이터의 부상

현대 인공지능(AI)과 머신러닝 시스템의 성능을 결정짓는 가장 핵심적인 요소는 바로 '데이터'입니다. 하지만 실제 환경에서 고품질의 데이터를 수집하는 과정은 비용이 많이 들고 복잡하며, 때로는 불가능에 가깝습니다. NVIDIA AI 팟캐스트에 출연한 Rendered AI의 창립자이자 CEO인 네이선 쿤츠(Dr. Nathan Kuntz) 박사는 이러한 데이터 부족 문제를 해결하기 위한 대안으로 '합성 데이터(Synthetic Data)'의 중요성을 강조합니다.

1. 왜 합성 데이터가 필요한가?

네이선 쿤츠 박사는 실제 데이터를 수집하는 데 있어 세 가지 주요한 장벽이 있다고 설명합니다.

  • 희귀 이벤트 및 엣지 케이스(Rare events and edge cases): 고속도로에서 전복된 차량을 발견하는 상황이나 제조 공정에서의 미세한 오류 등은 매우 중요하지만 실제로는 좀처럼 일어나지 않는 상황입니다. 이러한 데이터를 수집하기 위해 위험을 감수하거나 긴 시간을 기다리는 것은 비효율적입니다.
  • 비표준 센서 데이터의 한계: 컴퓨터 비전은 주로 RGB 이미지에 집중되어 있지만, 산업 현장에서는 적외선(Infrared)이나 레이더(Radar) 이미지 등 훨씬 복잡한 센서 데이터가 요구됩니다. 이러한 데이터는 사람이 직접 주석(Annotation)을 달기 매우 어렵습니다.
  • 설계 목적과 AI 활용의 불일치: 기존의 카메라는 사람의 시각적 기록을 위해 설계되었습니다. 하지만 특정 AI 문제를 해결하기 위해 센서를 역으로 설계해야 할 경우, 기존의 데이터셋으로는 해결이 불가능합니다.

2. 물리 기반 시뮬레이션의 역할

Rendered AI는 '물리 기반 시뮬레이션(Physics-based simulation)'을 통해 이러한 문제를 해결합니다. 쿤츠 박사는 빛의 상호작용이나 레이더 신호와 같은 물리적 과정을 정확히 모델링함으로써, 현실에 존재하지 않거나 수집하기 어려운 데이터를 '데 노보(de novo, 처음부터)' 방식으로 생성할 수 있다고 설명합니다. 이는 단순한 시각적 효과를 넘어 비즈니스 의사결정과 품질 보증(QA)의 핵심 도구로 작용합니다.

3. 합성 데이터의 효율성 검증: '무엇이 좋은 데이터인가?'

쿤츠 박사는 단순히 '보기 좋은 이미지'가 좋은 데이터가 아님을 분명히 합니다. 합성 데이터의 품질을 평가하기 위해 Rendered AI는 다음과 같은 방식을 사용합니다.

  • UMAP 분석: 실제 데이터셋과 합성 데이터셋의 특징을 차원 축소하여 클러스터링함으로써 데이터 간의 유사성을 시각적으로 확인합니다.
  • 도메인 적응(Domain Adaptation): 데이터 간의 차이가 발생할 경우, 'CycleGAN'과 같은 생성형 도구를 활용하여 합성 데이터를 실제 센서 출력값에 맞게 정교화합니다.
  • 학습 알고리즘 검증: 실제 탐지 알고리즘을 합성 데이터로 학습시킨 뒤, 그 성능(Efficacy)을 테스트하여 실질적인 데이터의 가치를 측정합니다.

4. 합성 데이터 시장의 확장과 미래

과거에는 자율주행 분야에서 주로 사용되었던 합성 데이터는 이제 위성 이미지(Geospatial), 산업 검사, 의료 분야 등 다양한 산업으로 확장되고 있습니다. 쿤츠 박사는 합성 데이터가 단순히 데이터 과학자들만을 위한 도구가 아니라, 비즈니스 개발 및 판매 팀에게도 '우리 시스템이 이 문제를 해결할 수 있는가?'를 입증하는 강력한 수단이 되고 있다고 전했습니다.

결론적으로, 쿤츠 박사는 미래의 모든 AI 기업이 CAD 소프트웨어를 필수적으로 사용하듯, '합성 데이터 엔지니어링 팀'을 갖추게 될 것이라고 전망합니다. 물리 기반의 정확한 시뮬레이션과 생성형 AI 기술이 결합되면서, 합성 데이터는 디지털 트윈(Digital Twin)과 함께 AI 산업의 중추적인 인프라로 자리 잡을 것입니다.

🎯Key Sentences

1
So let's get into it.
그럼 바로 시작해 보죠.
2
we appreciate you finding the time to join us.
바쁘신 와중에 시간 내어 참석해 주셔서 감사합니다.
3
So let's get into that then.
그럼 본격적으로 시작해 보죠.
4
maybe if I could... unzip that just a little bit and get into it.
혹시 괜찮다면... 지퍼를 살짝 열어서 안을 좀 들여다봐도 될까요?
5
So you're spot on that the data that we have to train AI really is the dominant factor
AI 학습에 필요한 데이터가 가장 결정적인 요소라는 말씀이 정확합니다.
모두 펼치기

📝Key Phrases

1
get into it
본격적으로 시작해 보자.
2
dialing in
조정 중
3
at the thick of it
한창일 때
4
spot on
정확해요
5
drowning in data
데이터의 홍수 속에 빠져 있다
모두 펼치기

📖 Transcript

Hello and welcome to the NVIDIA AI podcast.
I'm your host, Noah Kravitz. Data is the fuel that makes artificial intelligence go.
Training, machine learning, and AI systems requires data, and the quality of datasets has a big impact on the results you get out of your systems.
Compiling quality real-world data for AI and ML use can be difficult and expensive.
That's where synthetic data comes in. Our guest today is Dr. Nathan Kuntz, founder and CEO of Rendered AI, a platform as a service for creating synthetic data to train AI models.
Nathan is a physicist by training, holds a PhD from Duke University, and previously founded Chimeta, a hybrid satellite cellular network company.

ListenLeap이 실제 문맥에서 학습하도록 이끌어줌

🎨 흥미로운 콘텐츠
🌍 실제 자료
📱 언제든 듣고 보기