한국어 箭头
Podcast Cover

[데이터 라벨링의 한계를 넘어: Malong Technologies의 제품 인식 AI 혁신]-[Ep. 40: Using Deep Learning to Scan Your Shopping Basket]

NVIDIA AI Podcast · B2 · 2017-10-25

Technology
또는 웹버전으로 공부하세요

📋 Summary

데이터 라벨링의 한계를 넘어서는 AI: Malong Technologies의 도전과 성과

최근 NVIDIA AI 팟캐스트에서는 Malong Technologies의 공동 창업자이자 CTO인 Matt Scott을 초청하여, 인간의 수작업 라벨링(Human Annotation) 없이도 고성능 AI 모델을 구축하는 기술적 접근 방식과 그 비전에 대해 심도 있는 대화를 나누었습니다. 본 요약은 이들이 어떻게 '노이즈가 섞인 데이터(Noisy Labels)'를 활용하여 산업계의 난제를 해결하고 있는지 다룹니다.

1. 딥러닝의 '어두운 이면': 데이터 라벨링의 한계

현재 딥러닝은 이미지 분류 분야에서 뛰어난 성능을 보이지만, 이를 위해선 수만 명의 인력이 필요한 'Amazon Mechanical Turk' 스타일의 수작업 라벨링이 필수적입니다. Matt Scott은 이를 딥러닝의 '어두운 이면(Dark side of deep learning)'이라고 지칭합니다. ImageNet 데이터셋을 구축하는 데 5만 명의 인력이 2년 넘게 투입된 사례처럼, 인간의 라벨링 의존은 비용 문제와 물리적 속도 지체라는 큰 병목 현상을 야기합니다.

2. WebVision Challenge와 약지도 학습(Weakly Supervised Learning)

Malong Technologies는 이러한 한계를 극복하기 위해 '약지도 학습(Weakly Supervised Learning)'에 집중합니다. 이들은 CVPR에서 주최한 'WebVision Challenge'에 참여하여, 인간의 라벨링 없이 웹에서 직접 가져온 노이즈 섞인 데이터를 활용해 94.78%라는 인간 수준의 인식 정확도를 달성했습니다. 이는 기존의 엄격한 데이터 정제 과정을 거치지 않고도, 수억에서 수십억 단위의 대규모 데이터를 통해 AI가 스스로 제품의 속성을 파악할 수 있음을 입증한 결과입니다.

3. Product AI: 제품 인식의 새로운 표준

Malong의 핵심 서비스인 'Product AI'는 단순히 제품을 인식하는 것을 넘어, 바코드 없는 매장(Frictionless retail) 구현을 목표로 합니다.

  • 주의 메커니즘(Attention Model): 이 기술은 이미지 내에서 중요한 영역(key zone)을 스스로 찾아내어, 처음 보는 제품이라도 그 속성을 파악합니다. 예를 들어, 와인 병을 볼 때 단순히 전체를 보는 것이 아니라 병의 형태와 특정 부분에 집중하여 정확도를 높입니다.
  • 범용적 이해(General Understanding): 개별 제품을 하나씩 학습시키는 방식에서 벗어나, 방대한 데이터를 바탕으로 제품의 일반적인 특성을 이해함으로써 새로운 제품이 추가되어도 즉각적인 인식이 가능합니다.

4. 산업 현장에서의 확장성

이 기술은 단순히 이커머스 검색에 국한되지 않습니다.

  • 품질 검사: 기존에 현미경을 보며 수작업으로 섬유의 품질을 검사하던 방식에서 AI를 도입하여 검사 빈도와 정확도를 비약적으로 높였습니다.
  • 보안 검사: 지하철역 등의 엑스레이(X-ray) 보안 검색대에서 금지 물품을 자동으로 인식하는 등 다층적 제품 인식(Multi-level product recognition) 기술로 확장하고 있습니다.

5. 결론: AI의 일반화(Generalization)를 향하여

Matt Scott은 향후 5년 내에 AI가 특정 분야에 국한되지 않고 보다 '일반적인(General)' 이해를 갖추게 될 것이라고 전망합니다. Malong Technologies는 앞으로도 비정형 데이터를 활용한 제품 인식의 범용성을 높이고, 이를 통해 고객들이 더 낮은 비용으로 고성능 AI 인프라를 '렌트(Rent intelligence)'할 수 있는 생태계를 구축하는 데 주력할 계획입니다.

결국 Malong의 사례는 AI 산업이 '인간의 노동력'에 의존하던 시대를 지나, 대규모 데이터를 스스로 학습하여 실질적인 비즈니스 가치를 창출하는 단계로 진입했음을 보여주는 중요한 이정표가 될 것입니다.

🎯Key Sentences

1
So, let's start at the beginning.
자, 처음부터 시작해 봅시다.
2
No one likes to talk about too much about this.
누구나 이 문제에 대해 깊이 이야기하는 것을 꺼립니다.
3
It's just a logistical, it's a cost, and it's physically slow.
그건 단순히 물류 문제이고, 비용이 들 뿐만 아니라 물리적으로도 속도가 느려요.
4
ImageNet is kind of not a thing any longer.
ImageNet은 이제 거의 의미가 없어졌어요.
5
A little bit of progress, huh?
아주 조금이나마 진전이 있었네, 그렇지?
모두 펼치기

📝Key Phrases

1
put a twist on
변주를 주다
2
come up with
떠올리다
3
problem space
문제 공간
4
spring up
솟아오르다
5
break through
돌파하다
모두 펼치기

📖 Transcript

Welcome to the NVIDIA AI Podcast. I'm your host, Noah Kravitz.
Deep learning excels at image classification, but you generally need to label your images before you can use them to train a model.
A Chinese company called Melon Technologies has put a twist on things with classification of unlabeled images.
Here to explain how it works and what it means is Matt Scott, co-founder and CTO of Malung Technologies.
Matt, welcome. Hey, Noah. It's great to be here.
Thanks for joining us. So, let's start at the beginning.

ListenLeap이 실제 문맥에서 학습하도록 이끌어줌

🎨 흥미로운 콘텐츠
🌍 실제 자료
📱 언제든 듣고 보기