最可靠的迹象是机械性的:长破折号以稳定频率出现、弯引号、不可见的 Unicode 字符,以及用表情符号开头的项目符号列表。文风层面的迹象——模棱两可的措辞、"not just X, but Y" 句式、异常均匀的段落长度——则较弱。它们中的任何一个都不能单独证明什么;它们是模式,不是证据。
四个真正可以量化的机械性迹象
这些是可以计数的。你可以把文本丢进工具里得到一个数字,而不是一种印象——这正是它们比"凭感觉检测"更有用的地方。
1. 长破折号以稳定频率出现。 聊天模型输出长破折号(—)的一致性远高于人类,因为输入长破折号需要一个大多数写作者从未学过的键盘快捷键。在长文档里出现一两个很正常;但如果大致每段一个、分布均匀,就不正常了。长破折号指南解释了这个习惯为何如此根深蒂固。
2. 弯引号与排版标点。 AI 输出往往自带方向性引号(" ")、弯撇号('),以及真正的省略号字符(…)而不是三个句号。文字处理软件也会自动生成这些符号,所以它们只在不涉及自动更正的场景下才有意义——比如纯文本输入框、代码注释、CSV 文件。
3. 不可见的 Unicode 字符。 零宽空格、不间断空格和窄不间断空格经常从聊天窗口的复制粘贴中残留下来。它们用肉眼无法察觉,是最强的单一机械性标记,因为几乎没有任何手写输入会产生它们。
4. 表情符号开头的项目符号列表。 每条要点前带装饰性表情符号的结构化回答、用加粗文本而非真正标题充当小节标题、嵌套三层深的列表——这是聊天界面鼓励的一种"房屋风格",而大多数人类写作者并不使用。
三个文风层面的迹象——较弱,但值得了解
文风层面的模式更容易误判,因为大量认真的人类写作也有这些特征。把它们当作深入查看的提示,绝不能当作结论。
5. 措辞含糊、两面讨好的行文。 把每个问题都呈现为有两个合理立场的句子、开头先复述一遍问题的段落、只做总结而不增加任何内容的结尾。这来自一种训练方式:既要有帮助,又不能有立场。
6. "not just X, but Y" 句式。 类似的还有 "it's worth noting that"、"delve into"、"navigate the complexities of"、"in today's fast-paced world"。这些并不是禁用词——它们就是普通的英语。真正显眼的是它们在一篇短文里扎堆出现的频率。
7. 异常均匀的结构。 段落长度几乎一致、各小节的项目符号数量可疑地相等、结尾与开头镜像呼应。人类的草稿是参差不齐的——某一段特别长,只是因为写作者对那一点有更多话要说。
尤其是词汇层面的信号,失效得很快。每一份流传的"AI 词汇表"都会被人们吸收进自己的写作,也会进入下一代模型的调优过程。机械性迹象更持久,因为它们是编码的副产品,而不是文风的副产品。
如何一次性检查一个文档
一个实用的操作顺序,从成本最低的检查开始:
- 扫描不可见字符。 这是信号最强、成本最低的检查。把文本粘贴到不可见字符扫描工具中——它会列出找到的每一个零宽空格、软连字符、字节序标记和方向控制符,并附上数量。
- 一起统计各类机械性痕迹。 AI 文本清理工具 可以一次性报告长破折号、弯引号、不可见字符和表情符号,让你看到多个信号是否同时出现,而不是一次只追一个。
- 带着数据去读文风。 只有拿到统计数字之后再读。先看数字,可以避免你说服自己接受一个预设的结论。
- 掂量上下文。 从 Word 粘贴的文本无论如何都会带上弯引号,不管是谁写的;直接在纯文本输入框里敲出来的则不会。
关键是多个信号的共现。一个孤零零的长破折号什么也说明不了。但在一段直接敲进纯文本表单的文字里,长破折号加上弯引号加上两个零宽空格再加上表情符号列表,就是一个真正不寻常的组合了。
为什么这些都不能算作证据
上面每一个迹象都有无辜的解释。
Word 和 Google Docs 会自动把双连字符变成长破折号、把直引号变成弯引号。从任何现代网站复制内容都可能带来不可见字符。专业编辑写出来的文字,恰恰就是那种读起来像机器生成的、平衡而含糊的语域。非英语母语者往往写得更加正式、结构更加规整——这正是商用 AI 检测器误报他们作品的比例明显更高的原因。
还有一个显而易见的循环论证问题:一个人可以把 AI 输出粘贴到文本编辑器里,做一遍清理,大约十秒钟就能抹掉所有机械性迹象。最容易测量的信号,恰恰也是最容易清除的。
所以诚实的立场是这样:格式分析能告诉你文档里有哪些字符,但它不能告诉你是谁把它们放进去的。我们的工具刻意只报告数量、从不给出判定,因为所谓判定不过是披着数字外衣的猜测。如果你真的需要知道某段文字是不是某个人写的,答案来自与对方的交谈——草稿历史、资料来源、以及解释自己论点的能力——而不是来自数破折号。
常见问题
判断文本由 AI 生成,最可靠的迹象是什么?
零宽空格等不可见的 Unicode 字符是最强的机械性标记,因为普通打字几乎不会产生它们,而从聊天窗口复制粘贴经常会带上。即便如此,它们也可能来自从网站复制文本,所以它们说明的更多是粘贴来源,而不是作者身份。
AI 检测器真的有用吗?
不可靠。它们会把人类写作误判为 AI 生成——非英语母语者受到的影响尤其严重——而且稍加编辑就能绕过。格式分析可以统计具体的痕迹,但包括我们的工具在内,没有任何工具能仅凭文本确定作者身份。
使用长破折号或弯引号会让我被指责用了 AI 吗?
不应该,这也不是站得住脚的指责依据。Word 和 Google Docs 会从普通打字中自动生成这两种符号。如果你担心文档的观感,把标点转换为纯 ASCII 即可去除这些痕迹,而不改动你写的任何一个字。
可以把这些迹象从 AI 生成的文本中去除吗?
可以,而且很快——这正是它们作为证据很弱的原因。替换长破折号、统一引号、删除不可见字符只需几秒钟。这一点应该让你对检测结论保持怀疑,而不是被当作冒充他人成果的技巧。