한국어 箭头
Podcast Cover

[AI는 왜 그렇게 많은 엠 대시(em dash)를 사용할까?]-[Why AI loves em dashes, with Sean Goedecke]

Grammar Girl Quick and Dirty Tips for Better Writing · B2 · 2026-02-05

Language
또는 웹버전으로 공부하세요

📋 Summary

AI의 엠 대시(em dash) 과다 사용 현상에 대한 분석

최근 많은 작가와 편집자들 사이에서 '엠 대시(em dash)'의 빈번한 사용이 AI가 작성한 글의 대표적인 징후라는 인식이 퍼지고 있습니다. 소프트웨어 엔지니어이자 블로거인 션 게데케(Sean Gedeke)는 이러한 현상이 단순한 우연이 아니라, AI 모델의 학습 과정과 인간의 선호도가 결합하여 나타난 '창발적 행동(emergent behavior)'이라고 분석합니다.

1. 학습 데이터의 변화: 엠 대시의 기원

초기 언어 모델인 GPT-3.5는 엠 대시를 거의 사용하지 않았습니다. 그러나 모델이 고도화되면서 엠 대시의 사용량이 급증했습니다. 게데케는 그 원인을 데이터셋의 변화에서 찾습니다. 초기 모델은 주로 인터넷상의 짧은 텍스트(The Pile 등)로 학습되었으나, 이후 모델들은 성능 향상을 위해 19세기 후반과 20세기 초반의 방대한 '디지털화된 서적(digitized books)'을 학습 데이터로 대거 도입했습니다. 당시 문학 작품(예: 허먼 멜빌의 '모비딕')에서는 엠 대시가 매우 흔하게 사용되었고, 이 고전 문체들이 AI의 학습 과정에 녹아들면서 모델이 엠 대시를 빈번하게 생성하게 된 것입니다.

2. 강화학습과 인간의 피드백(RLHF)

그렇다면 왜 모델은 고전적인 문체 전체를 모방하지 않고 엠 대시만 선호할까요? 게데케는 이를 '인간의 피드백을 통한 강화학습(Reinforcement Learning from Human Feedback)' 단계에서 설명합니다. AI 모델을 훈련할 때 수많은 인간 평가자가 결과물에 대해 '좋아요' 또는 '싫어요'를 표시하는데, 인간 평가자들은 엠 대시가 포함된 문장을 더 전문적이고 세련된(마치 '뉴요커' 스타일의) 문체로 느끼는 경향이 있습니다. 즉, 엠 대시는 모델이 인간의 선호도를 학습하는 과정에서 '살아남은' 문장 부호입니다. 게데케는 이를 두고 "인간 평가자들이 엠 대시를 선호하기 때문에 모델이 이를 유지하는 것"이라고 지적합니다.

3. 오해와 진실: 토큰화와 합성 데이터

일각에서는 엠 대시가 '토큰(token)' 측면에서 효율적이기 때문에 AI가 이를 선호한다는 주장을 제기하지만, 게데케는 이를 회의적으로 봅니다. AI가 효율성 때문에 엠 대시를 쓴다면 다른 부분에서도 효율성을 추구해야 하지만, 실제 모델은 불필요하게 장황한 글을 쓰는 경우가 많기 때문입니다. 또한, AI가 생성한 글이 다시 학습 데이터로 들어가는 '합성 데이터(synthetic data)' 문제에 대해서도, 아직은 모델들이 데이터의 질을 구분하는 능력을 갖추고 있어 우려할 만큼의 '데이터 오염' 현상은 발생하지 않았다고 평가합니다.

4. 결론: 인간의 문체에 미치는 영향

흥미로운 점은 인간들이 AI처럼 보이지 않기 위해 오히려 엠 대시를 의도적으로 피하거나, 일부러 오타를 넣는 등 글쓰기 방식을 바꾸고 있다는 사실입니다. 게데케는 이러한 현상이 매우 안타깝다고 지적합니다. AI의 특징적인 문체(예: 'delve'와 같은 단어 사용이나 특정 이름 생성 패턴)는 모델 개발자들이 비슷한 데이터와 비슷한 환경에서 훈련하기 때문에 발생하는 '공통적인 결과물'일 뿐입니다. 결국 엠 대시 과다 사용은 AI가 인간의 문학적 관습을 학습하고, 인간 평가자가 이를 긍정적으로 받아들인 결과물로 이해해야 할 것입니다.

🎯Key Sentences

1
That was one of the things that absolutely fascinated me.
그것은 정말 저를 매료시킨 것들 중 하나였어요.
2
So that's a clue, right?
그거 단서 맞죠?
3
Yeah, well, it's a mystery.
글쎄, 그거 참 미스터리네.
4
What is the difference between those early and late data sets?
초기 데이터 세트와 후기 데이터 세트 간의 차이점은 무엇인가요?
5
I mean, it's just clear to me that they do.
제 생각에는 그들이 분명히 그렇다는 겁니다.
모두 펼치기

📝Key Phrases

1
you bet
당연하죠.
2
preempting the podcast
팟캐스트 방송을 예정보다 먼저 시작하다
3
from scratch
처음부터
4
emergent behavior
창발적 거동
5
plausible-sounding text
그럴듯하게 들리는 텍스트
모두 펼치기

📖 Transcript

Grammar Girl here.
I'm Mignon Fogarty and I bet many of you are as tired as I am of hearing about em dashes being a sign of AI writing.
But today I have someone really interesting who can help us answer a question that is more interesting, which is why
Why does AI use so many em dashes?
Sean Gedeke is a software engineer for GitHub.
He's from Melbourne, and he is a prolific blogger who writes about all these issues.

ListenLeap이 실제 문맥에서 학습하도록 이끌어줌

🎨 흥미로운 콘텐츠
🌍 실제 자료
📱 언제든 듣고 보기