ChatGPT 使用长破折号,是因为它的训练语料以经过专业编辑的书面文字为主——书籍、散文和新闻报道——在这些文本中,用长破折号引出插入语是标准做法。模型对这一习惯的复现远比普通写作者稳定,而后者几乎从不输入这个字符。真正让它看起来像 AI 标志的,不是这个符号本身,而是这种一致性上的差异。
这种习惯从何而来
大型语言模型学习标点的方式与学习其他一切相同:从训练数据中吸收模式。这些语料严重偏向已出版、经过专业编辑的文字——书籍、长篇新闻报道、散文和文档。在那个世界里,长破折号再普通不过。文字编辑不断用它来引出插入语、引入总结,或在收尾分句前制造一个停顿。
日常网络写作完全是另一番景象。在聊天消息、论坛帖子和电子邮件中,人们用的是逗号、括号和句号。大多数人根本不会输入长破折号,因为标准键盘上没有这个按键。
在训练数据之上还有第二层压力。模型被调整为产出读者评价为清晰、文笔好的文字,而长破折号恰好特别擅长这项工作。它是英文标点中最灵活的符号——可以代替逗号、冒号、分号或一对括号。当一个句子可以用好几种不同标点时,选择长破折号永远说得过去。一个以流畅、自信的文风为优化目标的系统,会一次又一次地落在它上面。
长破折号为何成了 AI 的破绽
长破折号之所以变得可疑,不是因为它罕见,而是因为它出现的稳定程度。
输入它需要刻意付出努力。在 Mac 上是 Option + Shift + -;在 Windows 上是 Alt + 0151 或一条自动更正规则。大多数手机键盘则把它藏在长按后面。所以当一个人类写出长破折号时,通常是有意识的风格选择,而且出现得很零散——长文档里只有几处,集中在作者想要制造戏剧性停顿的地方。
语言模型没有这种摩擦。每个字符的成本都一样。结果就是一个辨识度很高的统计指纹:
- 长破折号在每一段中以稳定频率出现,而不是集中爆发。
- 它们经常成对使用,包裹一个插入成分,而大多数人在这里会用逗号。
- 它们出现在本不该出现的语域中,比如简短回复、列表条目或 bug 报告。
这些模式没有一种是错误的。它们只是比人类写作更有规律,而规律性恰恰是读者会注意到的东西。
如何删除长破折号而不破坏句子
常见的错误是把每个长破折号都替换成连字符。连字符是另一个字符,承担另一项工作,替换的结果读起来像错别字,而不是干净的文字。替换方式要与破折号原本承担的功能相匹配。
成对包裹插入语的长破折号通常应改为一对逗号。如果插入内容是真正的题外话,括号效果更好。
引出结论的单个长破折号实际上是在代替冒号。把它换成冒号,或者结束当前句子另起一句。
句中的单个长破折号往往标出了比句子实际需要的更强烈的断裂。拆成两个句子几乎总比任何替代标点读起来更好。
| 破折号的功能 | 更好的替换方案 |
|---|---|
| 包裹轻微的插入语 | 逗号 |
| 包裹题外话 | 括号 |
| 引出总结 | 冒号 |
| 标示强烈断裂 | 句号,拆分句子 |
| 表示范围(2020—2024) | 用短破折号(en dash),而非长破折号 |
如果你在处理一份长文档,删除文本中的长破折号工具可以把每个长破折号替换成你选择的符号,并报告改动了多少处,这样你可以对照自己的阅读核对数量,而不是盲目相信一次静默的查找替换。
什么时候应该保留长破折号
把写作中的每个长破折号都删掉是一种矫枉过正。这个符号存在是有原因的:它做的事是替代品做不到的——它创造的停顿比逗号更有力,又不像句号那样戛然而止,还没有分号那种公文腔。
在以下情况保留它:
- 句子确实需要一个强烈的打断,逗号显得太软。
- 你在引用使用了长破折号的原文。改动引文内的标点就等于改动了引文本身。
- 所属机构的文体规范要求使用。大多数图书出版商和许多新闻编辑室都自由使用长破折号。
- 你在写小说或个人随笔,节奏感比"看起来不像机器写的"更重要。
现实的目标不是零长破折号,而是让每一个长破折号都出自你的主动选择,出现频率反映你自己的声音。一篇长文里出现一两个,读起来是刻意的;每段一个,读起来就是默认值了。
长破折号只是众多习惯之一
长破折号之所以格外引人注意,是因为它是一个可以直接搜索的单一字符。但它并不是唯一的规律性表现,其他习惯都来自同样的两股压力:训练语料里充斥着经过编辑、结构化的书面文字,以及朝着读者评价为清晰的答案方向调优。
- 关键短语加粗。 不是标题,而是段落里被强调的一两个短语,常常是列表条目开头的几个字。这让答案便于快速浏览,而这正是聊天界面所追求的优化目标。
- 本该用散文表达却用了项目符号。 一个三句话就能说清的想法,变成了三条项目符号。列表作为答案的评分往往更高,所以即便各要点并不真正并列,模型也会默认使用列表。
- 短回答也加标题。 一段只有四个自然段的回复,却带着两个小节标题。这种结构是从文档写作里借来的——在那里它确实有用——却被用在了远用不着导航的短文本上。
- 表情符号当装饰。 不是用来表达情绪,而是当作项目符号或小节图标——每条前面一个对勾,"下一步"板块上方一个火箭。
- "这不只是 X——而是 Y。" 先纠正、再升华的句式,还有"值得注意的是""关键在于"这类说法。这些都是普通的表达方式,显眼的是它们在一篇短文里扎堆出现的频率。
- 三的法则。 三个例子、三条项目符号、三个形容词,因为三听起来很完整。人类的草稿更参差不齐——两个理由,或者五个,取决于实际情况有多少。
这些都不是水印。没有任何供应商会在普通文本里悄悄嵌入隐藏信号,这些习惯也没有一个是被设计出来当破绽用的。它们只是风格上的默认设置,和其他任何风格默认设置一样,可以被删除或用提示词要求去掉。如果你想把它们从已有的文档里清除,AI 文本人性化工具会剥离机械层——标点、不可见字符、装饰性表情符号——而项目符号转段落能把过度列表化的文本重新变回散文。这两个工具都不声称能骗过检测器,任何这么宣称的工具你都应该心存怀疑。
完整的清单,包括那些可以计数的,都在AI 写作痕迹识别指南里。
长破折号不是 AI 写作的证据
这一点需要直说,因为网上很多建议都搞错了:长破折号的存在证明不了任何事。
大量人类写作中也满是长破折号。Microsoft Word 会在你输入时把两个连字符自动转换为长破折号,所以写作者可能从未主动选择过这个字符就写出了它。受过编辑写作训练的人会本能地使用它。有些出版物甚至硬性要求使用。
不存在能凭标点可靠检测 AI 生成文本的方法,而那些声称可以做到的商业工具,其误报率有大量记录——非英语母语者受到的影响尤为严重。当指控落在学生或同事身上时,把长破折号当作证据是有实际代价的。
格式分析能诚实告诉你的是机械性的事实:这份文档里有多少个长破折号、多少个弯引号、多少个不可见字符。这些是计数,不是判决。我们的 AI 文本清理工具报告的正是这些数字,并且不对文本出自谁手作任何断言——这也是一个格式工具唯一站得住脚的立场。
如果你想全面了解哪些格式痕迹会伴随 AI 输出,AI 写作痕迹识别指南涵盖了其余内容。
常见问题
使用长破折号会让我的文字看起来像 AI 写的吗?
单凭这一点不会。长破折号在编辑过的英文中是标准用法,在人类写作中也随处可见——部分原因是 Word 会把双连字符自动转换成长破折号。真正显得像机器写的,是高频且均匀分布的出现率——整篇文档大约每段一个——通常还伴随着弯引号和表情符号开头的列表等其他痕迹。
长破折号应该替换成什么?
替换方案要与它的功能匹配。成对包裹插入语的改为逗号或括号;引出结论的单个破折号改为冒号;标示强烈断裂的破折号通常拆成两个独立句子读起来更好。避免把长破折号替换成连字符——那是另一个字符,用途不同。
为什么 ChatGPT 用长破折号而不是逗号?
长破折号是英文中最灵活的标点,可以代替逗号、冒号、分号或括号。当好几种标点在语法上都成立时,它永远是一个稳妥的选择,所以一个以流畅文风为优化目标的模型会格外频繁地选中它。
能阻止 ChatGPT 使用长破折号吗?
可以直接在提示词中提出要求,比如"不要使用长破折号,改用逗号或拆成独立句子"。但它的遵从度并不完美,而且在长回复中会逐渐回退,所以通常更快的做法是正常生成,事后再把破折号清理掉。
长破折号和连字符是一回事吗?
不是。连字符(-,U+002D)用于连接复合词。短破折号(–,U+2013)表示范围,如 2020–2024。长破折号(—,U+2014)用于引出句中的插入成分。它们是三个宽度递增的不同字符,不能互换。