ChatGPT는 왜 긴 대시를 이렇게 많이 쓸까?

AI의 서명이 되어버린 문장 부호, 그리고 그 해결 방법.

ChatGPT가 긴 대시를 사용하는 이유는 책, 에세이, 저널리즘처럼 전문적으로 편집된 문장으로 학습했기 때문입니다. 이런 글에서는 구를 구분할 때 긴 대시를 쓰는 것이 표준입니다. 이 문자를 거의 입력하지 않는 일반적인 사람들과 달리 모델은 그 습관을 훨씬 일관되게 재현합니다. 문자 자체가 아니라 그 일관성의 차이가 AI의 서명처럼 읽히게 만드는 것입니다.

이 습관은 어디서 왔을까

대규모 언어 모델은 다른 모든 것을 배우는 것과 같은 방식으로 문장 부호를 배웁니다. 학습 데이터에서 패턴을 흡수하는 것입니다. 그 데이터는 출판되고 전문적으로 편집된 글 — 책, 장문 저널리즘, 에세이, 문서 — 에 크게 치우쳐 있습니다. 그 세계에서 긴 대시는 완전히 평범한 것입니다. 교정자들은 삽입구를 구분하거나, 요약을 도입하거나, 마지막 절 앞에 여백을 만들 때 끊임없이 사용합니다.

일상적인 인터넷 글쓰기는 전혀 다릅니다. 채팅 메시지, 포럼 게시물, 이메일에서는 쉼표, 괄호, 마침표를 씁니다. 표준 키보드에는 긴 대시 키가 없기 때문에 대부분의 사람들은 아예 입력하지 않습니다.

학습 데이터 위에 또 하나의 압력이 있습니다. 모델은 독자가 명확하고 잘 쓰였다고 평가하는 문장을 만들도록 조정되는데, 긴 대시는 그 일에 유난히 능합니다. 영어 문장 부호 중 가장 유연한 부호로, 쉼표, 콜론, 세미콜론, 괄호 쌍 모두를 대신할 수 있습니다. 하나의 문장에 여러 부호가 가능할 때 긴 대시를 선택하는 것은 언제나 무난합니다. 유창하고 자신감 있게 들리는 텍스트를 최적화하는 시스템은 결국 그것을 계속 선택하게 됩니다.

긴 대시가 AI의 흔적이 된 이유

긴 대시가 의심받게 된 것은 드물기 때문이 아닙니다. 얼마나 일관되게 나타나는가 때문입니다.

긴 대시 하나를 입력하는 데는 의식적인 노력이 필요합니다. Mac에서는 Option + Shift + -, Windows에서는 Alt + 0151 또는 자동 교정 규칙이 필요합니다. 대부분의 휴대폰 키보드는 길게 눌러야 나오는 곳에 숨겨 두었습니다. 그래서 사람이 긴 대시를 쓸 때는 보통 의식적인 문체적 선택이며, 드문드문 나타납니다. 긴 문서에서 몇 번, 글쓴이가 극적인 멈춤을 원한 곳에 모여 있는 식입니다.

언어 모델에는 그런 마찰이 없습니다. 모든 문자의 비용이 같습니다. 그 결과 뚜렷한 통계적 지문이 생깁니다.

  • 긴 대시가 불규칙한 덩어리가 아니라 모든 문단에 걸쳐 일정한 비율로 나타납니다.
  • 대부분의 사람들이 쉼표를 쓸 자리에서 삽입구를 감싸는 으로 자주 사용됩니다.
  • 짧은 답장, 글머리 목록 항목, 버그 리포트처럼 원래는 쓰이지 않을 문체에도 등장합니다.

이 패턴들 중 어느 것도 틀린 것은 아닙니다. 다만 사람의 글쓰기보다 규칙적일 뿐이고, 독자가 알아차리는 것은 바로 그 규칙성입니다.

문장을 망가뜨리지 않고 긴 대시를 제거하는 방법

흔한 실수는 모든 긴 대시를 하이픈으로 바꾸는 것입니다. 하이픈은 다른 역할을 하는 다른 문자이며, 결과는 깔끔한 문장이 아니라 오타처럼 읽힙니다. 대시가 하던 일에 맞는 대체 부호를 고르세요.

삽입구를 감싸는 긴 대시 쌍은 보통 쉼표 쌍이 됩니다. 삽입구가 진짜 곁가지라면 괄호가 더 낫습니다.

결론 앞의 긴 대시 하나는 콜론을 대신하고 있는 것입니다. 콜론으로 바꾸거나, 문장을 끝내고 새 문장을 시작하세요.

문장 중간의 긴 대시 하나는 문장에 실제로 필요한 것보다 강한 끊김을 표시하는 경우가 많습니다. 두 문장으로 나누는 것이 어떤 대체 부호보다 거의 항상 더 잘 읽힙니다.

대시가 하는 일 더 나은 대체 부호
가벼운 삽입구 감싸기 쉼표
곁가지 감싸기 괄호
요약 도입하기 콜론
강한 끊김 표시 마침표, 문장 분리
범위 표시(2020—2024) 긴 대시가 아니라 en 대시

긴 문서를 작업하고 있다면 긴 대시 제거 도구가 모든 긴 대시를 선택한 대체 부호로 바꾸고 변경 개수를 알려줍니다. 조용히 실행되는 찾기-바꾸기를 믿는 대신 직접 읽은 것과 개수를 대조할 수 있습니다.

AI 초고The resultswhich surprised uswere clear.정리 후The results, which surprised us, were clear.
AI 초고에서 흔히 볼 수 있는 긴 대시 사용 패턴과, 같은 문장을 쉼표로 다시 쓴 모습입니다.

긴 대시를 유지해야 할 때

글에서 긴 대시를 모두 제거하는 것은 과잉 교정입니다. 이 부호가 존재하는 것은 대안들이 할 수 없는 일을 하기 때문입니다. 쉼표보다 강하고 마침표보다 덜 단절적인 멈춤을 만들면서, 세미콜론의 관료적인 느낌 없이요.

다음 경우에는 유지하세요.

  • 문장에 정말로 강한 끊김이 필요하고 쉼표로는 너무 약할 때.
  • 긴 대시를 쓴 출처를 인용할 때. 인용문 안의 문장 부호를 수정하면 인용문이 바뀝니다.
  • 소속 기관의 스타일이 요구할 때. 대부분의 출판사와 많은 언론사는 긴 대시를 자유롭게 씁니다.
  • 기계적으로 중립적으로 보이는 것보다 리듬이 더 중요한 소설이나 개인 에세이를 쓸 때.

현실적인 목표는 긴 대시 0개가 아닙니다. 자신의 목소리를 반영하는 비율로, 선택해서 나타나는 긴 대시입니다. 긴 글에서 한두 개는 의도적으로 읽힙니다. 문단마다 하나씩 있으면 기본값처럼 읽힙니다.

긴 대시는 여러 습관 중 하나일 뿐입니다

대시가 주목받는 이유는 검색할 수 있는 단일 문자이기 때문입니다. 하지만 유일한 규칙성은 아니며, 다른 습관들도 같은 두 가지 압력에서 비롯됩니다. 편집되고 구조화된 글로 가득한 학습 데이터, 그리고 독자가 명확하다고 평가하는 답변 쪽으로의 조정입니다.

  • 핵심 구절에 굵게 표시. 제목이 아니라 문단 안에서 강조된 한두 구절, 흔히 목록 항목의 첫 몇 단어입니다. 채팅 인터페이스가 최적화하는 대상인, 훑어보기 쉬운 답변을 만듭니다.
  • 산문으로 충분한 곳에 글머리 목록. 세 문장짜리 생각이 세 개의 글머리 항목으로 나옵니다. 목록은 답변으로서 평가가 좋기 때문에, 항목들이 실제로는 병렬적이지 않을 때조차 모델은 기본적으로 목록을 씁니다.
  • 짧은 답변에 붙는 제목. 네 문단짜리 답변 위에 두 개의 섹션 제목이 붙습니다. 이 구조는 제자리를 찾을 만한 문서에서 빌려온 것인데, 탐색이 전혀 필요 없을 만큼 짧은 텍스트에 적용됩니다.
  • 장식으로 쓰이는 이모지. 표현이 아니라 글머리 기호나 섹션 아이콘으로 쓰입니다 — 모든 항목 앞의 체크 표시, "다음 단계" 블록 위의 로켓처럼요.
  • "단순히 X가 아니라 Y다." 정정한 뒤 격상시키는 화법이며, "주목할 점은"과 "핵심은"도 함께 나타납니다. 평범한 구문이지만, 눈에 띄는 것은 짧은 글 하나에 이런 표현이 얼마나 자주 몰려 나타나는가입니다.
  • 3의 법칙. 세 가지가 완결된 느낌을 주기 때문에 예시 세 개, 글머리 세 개, 형용사 세 개가 쓰입니다. 사람의 초고는 더 들쭉날쭉합니다 — 실제로 몇 개였는지에 따라 이유가 두 개이거나 다섯 개이기도 합니다.

이 중 어느 것도 워터마크가 아닙니다. 어떤 업체도 평범한 텍스트에 숨겨진 신호를 새겨 넣지 않으며, 이 습관들 중 어느 것도 표식으로 설계되지 않았습니다. 이것들은 문체의 기본값이며, 다른 문체 기본값과 마찬가지로 제거하거나 없애 달라고 요청할 수 있습니다. 이미 가지고 있는 문서에서 이런 습관을 지우고 싶다면 AI 텍스트를 사람처럼 만들기가 문장 부호, 보이지 않는 문자, 장식용 이모지 같은 기계적인 층을 벗겨내고, 글머리 기호를 문장으로 변환은 목록으로 지나치게 나뉜 텍스트를 다시 산문으로 되돌립니다. 둘 다 탐지기를 속인다고 주장하지 않으며, 그렇다고 주장하는 도구는 의심해야 합니다.

셀 수 있는 것을 포함한 전체 목록은 AI가 쓴 텍스트의 징후 가이드에 있습니다.

긴 대시는 AI 글쓰기의 증거가 아닙니다

온라인의 많은 조언이 이 부분을 잘못 짚고 있으므로 분명히 말할 가치가 있습니다. 긴 대시가 있다는 사실은 아무것도 증명하지 않습니다.

사람이 쓴 글에도 긴 대시가 가득한 경우가 많습니다. Microsoft Word는 입력하는 중에 하이픈 두 개를 자동으로 긴 대시로 변환하므로, 글쓴이는 그 문자를 선택한 적 없이 만들어 냅니다. 편집 글쓰기 훈련을 받은 사람은 본능적으로 씁니다. 아예 의무화하는 매체도 있습니다.

문장 부호로 AI 생성 텍스트를 탐지하는 신뢰할 만한 방법은 없으며, 그렇다고 주장하는 상용 도구들은 잘 문서화된 오탐률을 가지고 있습니다. 비영어권 사용자가 불균형적으로 피해를 보는 것으로요. 긴 대시를 증거로 취급하는 것은 그 비난이 학생이나 동료에게 향할 때 실제 비용을 만듭니다.

서식 분석이 정직하게 말해 줄 수 있는 것은 기계적인 것뿐입니다. 이 문서에 긴 대시가 몇 개인지, 곡선 따옴표가 몇 개인지, 보이지 않는 문자가 몇 개인지. 그것은 개수이지 판결이 아닙니다. 저희 AI 텍스트 정리 도구는 정확히 그 숫자들만 보고할 뿐 누가 또는 무엇이 텍스트를 썼는지 주장하지 않으며, 그것이 서식 도구가 할 수 있는 유일하게 옹호 가능한 일입니다.

AI 출력물에 따라다니는 서식 흔적의 전체 그림을 원한다면 AI가 쓴 텍스트의 징후 가이드에서 나머지를 다룹니다.

자주 묻는 질문

긴 대시를 쓰면 제 글이 AI가 쓴 것처럼 보이나요?

그것만으로는 그렇지 않습니다. 긴 대시는 편집된 영어에서 표준이며 사람의 글 전반에 나타납니다. Word가 하이픈 두 개에서 자동으로 만들어 주기 때문이기도 합니다. 기계적으로 읽히는 것은 문서 전체에 걸쳐 문단당 하나 정도로 고르게 분포된 높은 비율이며, 보통 곡선 따옴표나 이모지로 시작하는 목록 같은 다른 흔적과 함께 나타납니다.

긴 대시를 무엇으로 바꿔야 하나요?

기능에 맞는 대체 부호를 고르세요. 삽입구를 감싸는 쌍은 쉼표나 괄호로, 결론을 도입하는 단독 대시는 콜론으로 바꾸고, 강한 끊김을 표시하는 대시는 보통 두 개의 별도 문장이 더 잘 읽힙니다. 긴 대시를 하이픈으로 바꾸는 것은 피하세요. 다른 목적을 가진 다른 문자입니다.

ChatGPT는 왜 쉼표 대신 긴 대시를 쓰나요?

긴 대시는 영어에서 가장 유연한 부호로, 쉼표, 콜론, 세미콜론, 괄호를 모두 대신할 수 있습니다. 여러 부호가 문법적으로 모두 가능할 때 언제나 안전한 선택이므로, 유창한 문장을 만들도록 조정된 모델은 그것을 불균형적으로 자주 선택합니다.

ChatGPT가 긴 대시를 쓰지 못하게 할 수 있나요?

프롬프트에 직접 요청할 수 있습니다. 예를 들어 '긴 대시를 쓰지 말고 쉼표나 별도 문장을 사용하라'처럼요. 준수는 불완전하고 긴 응답에서는 점점 흐트러지는 경향이 있으므로, 보통은 평소처럼 작성한 뒤 대시를 나중에 제거하는 것이 더 빠릅니다.

긴 대시와 하이픈은 같은 것인가요?

아니요. 하이픈(-, U+002D)은 합성어를 연결합니다. En 대시(–, U+2013)는 2020–2024 같은 범위를 표시합니다. 긴 대시(—, U+2014)는 문장 안에서 구를 구분합니다. 세 문자는 너비가 점점 넓어지는 별개의 문자이며 서로 바꿔 쓸 수 없습니다.

이 가이드에 소개된 도구

관련 가이드