ChatGPT는 왜 긴 대시를 이렇게 많이 쓸까?

AI의 서명이 되어버린 문장 부호, 그리고 그 해결 방법.

ChatGPT가 긴 대시를 사용하는 이유는 책, 에세이, 저널리즘처럼 전문적으로 편집된 문장으로 학습했기 때문입니다. 이런 글에서는 구를 구분할 때 긴 대시를 쓰는 것이 표준입니다. 이 문자를 거의 입력하지 않는 일반적인 사람들과 달리 모델은 그 습관을 훨씬 일관되게 재현합니다. 문자 자체가 아니라 그 일관성의 차이가 AI의 서명처럼 읽히게 만드는 것입니다.

이 습관은 어디서 왔을까

대규모 언어 모델은 다른 모든 것을 배우는 것과 같은 방식으로 문장 부호를 배웁니다. 학습 데이터에서 패턴을 흡수하는 것입니다. 그 데이터는 출판되고 전문적으로 편집된 글 — 책, 장문 저널리즘, 에세이, 문서 — 에 크게 치우쳐 있습니다. 그 세계에서 긴 대시는 완전히 평범한 것입니다. 교정자들은 삽입구를 구분하거나, 요약을 도입하거나, 마지막 절 앞에 여백을 만들 때 끊임없이 사용합니다.

일상적인 인터넷 글쓰기는 전혀 다릅니다. 채팅 메시지, 포럼 게시물, 이메일에서는 쉼표, 괄호, 마침표를 씁니다. 표준 키보드에는 긴 대시 키가 없기 때문에 대부분의 사람들은 아예 입력하지 않습니다.

학습 데이터 위에 또 하나의 압력이 있습니다. 모델은 독자가 명확하고 잘 쓰였다고 평가하는 문장을 만들도록 조정되는데, 긴 대시는 그 일에 유난히 능합니다. 영어 문장 부호 중 가장 유연한 부호로, 쉼표, 콜론, 세미콜론, 괄호 쌍 모두를 대신할 수 있습니다. 하나의 문장에 여러 부호가 가능할 때 긴 대시를 선택하는 것은 언제나 무난합니다. 유창하고 자신감 있게 들리는 텍스트를 최적화하는 시스템은 결국 그것을 계속 선택하게 됩니다.

긴 대시가 AI의 흔적이 된 이유

긴 대시가 의심받게 된 것은 드물기 때문이 아닙니다. 얼마나 일관되게 나타나는가 때문입니다.

긴 대시 하나를 입력하는 데는 의식적인 노력이 필요합니다. Mac에서는 Option + Shift + -, Windows에서는 Alt + 0151 또는 자동 교정 규칙이 필요합니다. 대부분의 휴대폰 키보드는 길게 눌러야 나오는 곳에 숨겨 두었습니다. 그래서 사람이 긴 대시를 쓸 때는 보통 의식적인 문체적 선택이며, 드문드문 나타납니다. 긴 문서에서 몇 번, 글쓴이가 극적인 멈춤을 원한 곳에 모여 있는 식입니다.

언어 모델에는 그런 마찰이 없습니다. 모든 문자의 비용이 같습니다. 그 결과 뚜렷한 통계적 지문이 생깁니다.

  • 긴 대시가 불규칙한 덩어리가 아니라 모든 문단에 걸쳐 일정한 비율로 나타납니다.
  • 대부분의 사람들이 쉼표를 쓸 자리에서 삽입구를 감싸는 으로 자주 사용됩니다.
  • 짧은 답장, 글머리 목록 항목, 버그 리포트처럼 원래는 쓰이지 않을 문체에도 등장합니다.

이 패턴들 중 어느 것도 틀린 것은 아닙니다. 다만 사람의 글쓰기보다 규칙적일 뿐이고, 독자가 알아차리는 것은 바로 그 규칙성입니다.

문장을 망가뜨리지 않고 긴 대시를 제거하는 방법

흔한 실수는 모든 긴 대시를 하이픈으로 바꾸는 것입니다. 하이픈은 다른 역할을 하는 다른 문자이며, 결과는 깔끔한 문장이 아니라 오타처럼 읽힙니다. 대시가 하던 일에 맞는 대체 부호를 고르세요.

삽입구를 감싸는 긴 대시 쌍은 보통 쉼표 쌍이 됩니다. 삽입구가 진짜 곁가지라면 괄호가 더 낫습니다.

결론 앞의 긴 대시 하나는 콜론을 대신하고 있는 것입니다. 콜론으로 바꾸거나, 문장을 끝내고 새 문장을 시작하세요.

문장 중간의 긴 대시 하나는 문장에 실제로 필요한 것보다 강한 끊김을 표시하는 경우가 많습니다. 두 문장으로 나누는 것이 어떤 대체 부호보다 거의 항상 더 잘 읽힙니다.

대시가 하는 일 더 나은 대체 부호
가벼운 삽입구 감싸기 쉼표
곁가지 감싸기 괄호
요약 도입하기 콜론
강한 끊김 표시 마침표, 문장 분리
범위 표시(2020—2024) 긴 대시가 아니라 en 대시

긴 문서를 작업하고 있다면 긴 대시 제거 도구가 모든 긴 대시를 선택한 대체 부호로 바꾸고 변경 개수를 알려줍니다. 조용히 실행되는 찾기-바꾸기를 믿는 대신 직접 읽은 것과 개수를 대조할 수 있습니다.

AI 초고The resultswhich surprised uswere clear.정리 후The results, which surprised us, were clear.
AI 초고에서 흔히 볼 수 있는 긴 대시 사용 패턴과, 같은 문장을 쉼표로 다시 쓴 모습입니다.

긴 대시를 유지해야 할 때

글에서 긴 대시를 모두 제거하는 것은 과잉 교정입니다. 이 부호가 존재하는 것은 대안들이 할 수 없는 일을 하기 때문입니다. 쉼표보다 강하고 마침표보다 덜 단절적인 멈춤을 만들면서, 세미콜론의 관료적인 느낌 없이요.

다음 경우에는 유지하세요.

  • 문장에 정말로 강한 끊김이 필요하고 쉼표로는 너무 약할 때.
  • 긴 대시를 쓴 출처를 인용할 때. 인용문 안의 문장 부호를 수정하면 인용문이 바뀝니다.
  • 소속 기관의 스타일이 요구할 때. 대부분의 출판사와 많은 언론사는 긴 대시를 자유롭게 씁니다.
  • 기계적으로 중립적으로 보이는 것보다 리듬이 더 중요한 소설이나 개인 에세이를 쓸 때.

현실적인 목표는 긴 대시 0개가 아닙니다. 자신의 목소리를 반영하는 비율로, 선택해서 나타나는 긴 대시입니다. 긴 글에서 한두 개는 의도적으로 읽힙니다. 문단마다 하나씩 있으면 기본값처럼 읽힙니다.

긴 대시는 AI 글쓰기의 증거가 아닙니다

온라인의 많은 조언이 이 부분을 잘못 짚고 있으므로 분명히 말할 가치가 있습니다. 긴 대시가 있다는 사실은 아무것도 증명하지 않습니다.

사람이 쓴 글에도 긴 대시가 가득한 경우가 많습니다. Microsoft Word와 Google Docs는 모두 하이픈 두 개를 자동으로 긴 대시로 변환하므로, 글쓴이는 그 문자를 선택한 적 없이 만들어 냅니다. 편집 글쓰기 훈련을 받은 사람은 본능적으로 씁니다. 아예 의무화하는 매체도 있습니다.

문장 부호로 AI 생성 텍스트를 탐지하는 신뢰할 만한 방법은 없으며, 그렇다고 주장하는 상용 도구들은 잘 문서화된 오탐률을 가지고 있습니다. 비영어권 사용자가 불균형적으로 피해를 보는 것으로요. 긴 대시를 증거로 취급하는 것은 그 비난이 학생이나 동료에게 향할 때 실제 비용을 만듭니다.

서식 분석이 정직하게 말해 줄 수 있는 것은 기계적인 것뿐입니다. 이 문서에 긴 대시가 몇 개인지, 곡선 따옴표가 몇 개인지, 보이지 않는 문자가 몇 개인지. 그것은 개수이지 판결이 아닙니다. 저희 AI 텍스트 정리 도구는 정확히 그 숫자들만 보고할 뿐 누가 또는 무엇이 텍스트를 썼는지 주장하지 않으며, 그것이 서식 도구가 할 수 있는 유일하게 옹호 가능한 일입니다.

AI 출력물에 따라다니는 서식 흔적의 전체 그림을 원한다면 AI가 쓴 텍스트의 징후 가이드에서 나머지를 다룹니다.

자주 묻는 질문

긴 대시를 쓰면 제 글이 AI가 쓴 것처럼 보이나요?

그것만으로는 그렇지 않습니다. 긴 대시는 편집된 영어에서 표준이며 사람의 글 전반에 나타납니다. Word와 Google Docs가 하이픈 두 개에서 자동으로 만들어 주기 때문이기도 합니다. 기계적으로 읽히는 것은 문서 전체에 걸쳐 문단당 하나 정도로 고르게 분포된 높은 비율이며, 보통 곡선 따옴표나 이모지로 시작하는 목록 같은 다른 흔적과 함께 나타납니다.

긴 대시를 무엇으로 바꿔야 하나요?

기능에 맞는 대체 부호를 고르세요. 삽입구를 감싸는 쌍은 쉼표나 괄호로, 결론을 도입하는 단독 대시는 콜론으로 바꾸고, 강한 끊김을 표시하는 대시는 보통 두 개의 별도 문장이 더 잘 읽힙니다. 긴 대시를 하이픈으로 바꾸는 것은 피하세요. 다른 목적을 가진 다른 문자입니다.

ChatGPT는 왜 쉼표 대신 긴 대시를 쓰나요?

긴 대시는 영어에서 가장 유연한 부호로, 쉼표, 콜론, 세미콜론, 괄호를 모두 대신할 수 있습니다. 여러 부호가 문법적으로 모두 가능할 때 언제나 안전한 선택이므로, 유창한 문장을 만들도록 조정된 모델은 그것을 불균형적으로 자주 선택합니다.

ChatGPT가 긴 대시를 쓰지 못하게 할 수 있나요?

프롬프트에 직접 요청할 수 있습니다. 예를 들어 '긴 대시를 쓰지 말고 쉼표나 별도 문장을 사용하라'처럼요. 준수는 불완전하고 긴 응답에서는 점점 흐트러지는 경향이 있으므로, 보통은 평소처럼 작성한 뒤 대시를 나중에 제거하는 것이 더 빠릅니다.

긴 대시와 하이픈은 같은 것인가요?

아니요. 하이픈(-, U+002D)은 합성어를 연결합니다. En 대시(–, U+2013)는 2020–2024 같은 범위를 표시합니다. 긴 대시(—, U+2014)는 문장 안에서 구를 구분합니다. 세 문자는 너비가 점점 넓어지는 별개의 문자이며 서로 바꿔 쓸 수 없습니다.

이 가이드에 소개된 도구

관련 가이드