最も信頼できる兆候は機械的なものです。一定の頻度で現れる長いダッシュ、曲線引用符、不可視のUnicode文字、絵文字付きの箇条書きが該当します。文体レベルの兆候――遠回しな表現、「XだけでなくY」という構文、不自然に揃った段落の長さ――は弱い手がかりにすぎません。どれも単独では何も証明しません。これらは証拠ではなく、あくまでパターンです。
実際に測定できる4つの機械的な兆候
これらは数えられます。ツールにかければ印象ではなく数値が得られるため、雰囲気頼みの判定よりもはるかに有用です。
1. 一定の頻度で現れる長いダッシュ。 チャットモデルは長いダッシュ(—)を人間よりもはるかに一定の頻度で使います。キーボードショートカットを必要とするため、ほとんどの人は入力方法自体を知らないからです。長い文書に1つか2つなら普通です。おおよそ段落ごとに1つ、均等に散りばめられているのは普通ではありません。この習性が根強い理由は長いダッシュの解説で詳しく扱っています。
2. 曲線引用符と組版上の句読点。 AIの出力には、方向のある引用符(“ ”)、曲線アポストロフィ(’)、3つのピリオドではなく本来の省略記号(…)が含まれがちです。ワープロソフトもこれらを自動で生成するため、自動修正が介入しない文脈――プレーンテキストの入力欄、コードのコメント、CSVファイルなど――でのみ意味を持ちます。
3. 不可視のUnicode文字。 ゼロ幅スペース、ノーブレークスペース、狭いノーブレークスペースは、チャット画面からのコピー&ペーストでしばしば残存します。目では検出できず、手入力でこれらが混入することはほぼないため、機械的な指標としては最も強力です。
4. 絵文字付きの箇条書き。 各項目の先頭に装飾的な絵文字が付いた構造化された回答、本物の見出しではなく太字で作られたセクション見出し、3段階にネストされたリストは、チャットインターフェースが促すハウススタイルであり、ほとんどの人間の書き手は使いません。
3つの文体的な兆候――弱いが、知っておく価値はある
文体レベルのパターンは判断を誤りやすいものです。丁寧な人間の文章にも同じ特徴が多く見られるからです。これらは結論ではなく、詳しく見るためのきっかけとして扱ってください。
5. 曖昧で均等にバランスの取れた構成。 あらゆる問いに妥当な両面があるかのように提示する文、問いを繰り返して始まる段落、何も付け加えずに要約して終わる結び。この傾向は、有用であることと無難であることを同時に求める学習に由来します。
6. 「XだけでなくY」という構文。 「注目に値するのは」「深く掘り下げる」「複雑さを乗り越える」「今日のめまぐるしい世界では」といった表現も同様です。これらは禁句ではなく、普通の英語です。目立つのは、短い文章の中にこれらが異常な頻度で集中することです。
7. 不自然に均一な構造。 ほぼ同じ長さの段落、疑わしいほど箇条書きの数が揃ったセクション、序論をなぞる結論。人間の下書きはもっと凸凹しています。その話題について書きたいことが多ければ、その段落は長くなります。
特に語彙のシグナルは急速に陳腐化します。「AIっぽい単語」のリストが出回るたびに、それは人々の書き方にも次世代モデルの調整にも吸収されていきます。機械的な兆候の方が長持ちするのは、文体ではなくエンコーディングの副産物だからです。
構造的な習慣――そして、それが最も弱いシグナルである理由
ここまでの兆候は、文字や言い回しに関するものでした。文よりもさらに上の層――文章全体がどう形作られているか――もあり、これは人が何かを「AIっぽい」と言うとき、最もよく指摘する層です。
- 均一な段落の長さ。 3〜4文の段落が延々と続き、強調のための1行だけの段落もなければ、書き手が話題に興味を持って長く書いてしまう箇所もありません。
- 質問を言い換えて始まる書き出し。 「良い質問ですね。データベースの選定にはいくつかの検討事項があります」。本題に入る前の前置きの段落で、プロンプトを言い換えることが妥当な始め方とされるチャット形式から受け継がれたものです。
- 何も付け加えない結び。 「結論として」「全体として」「最終的には」に続けて、今読んだ内容の要約が来ます。論点を着地させる必要があるエッセイなら妥当ですが、300語程度の回答では不自然です。
- 既定で両論併記になる構成。 すべてのトレードオフがバランスの取れたものとして提示され、明らかに一方が優れている場面でも、あらゆる推奨に「あなたの具体的なニーズによります」という留保が付きます。
- 何でもリスト化する。 順序も並列構造も持たない内容に見出しや箇条書き、番号付き手順が適用されます。箇条書きを文章に変換ツールが存在するのは、これを手作業で元に戻すのが面倒だからです。
ここからが重要な部分です。 これらは、このページの中で最も弱いシグナルであり、文体的な兆候よりもさらに弱いものです。その理由について率直に述べる価値があります。
このリストの項目はすべて、学校で教わるものです。均一な段落と質問を言い換える書き出しは、まさに学校の作文指導が求めるものです。「結論として」は標準的な学術的な言い回しです。バランスの取れた構成は職業上の慎重さの表れであり、コンサルタントや弁護士、医師が書くよう訓練される方法です。過度な主張には代償が伴うからです。リストを多用するのは、技術文書や企業の報告書、社内Wikiの大半に共通するハウススタイルです。モデルがこう書くのは人間がこう書くからであり、このパターンはそもそも人間の文章に由来しています。
だからこそ、構造的な特徴を採点する検出ツールは、最も丁寧に編集され、最も形式的で、正式な指導を通じて英語を学んだ非母語話者が書くことの多い文章に対して、まさに誤検出を起こします。均一性は反復練習によって高まる性質であり、多くの人がまさにその反復練習をしてきたのです。
つまり、このセクションが目指しているのは判定基準を与えることではなく、文体のレジスターを見分ける手助けをすることです。長いダッシュの解説は句読点について同じ趣旨を述べていますが、ここではその話がさらに強く当てはまります。文書が上記の構造的パターンをすべて満たしていても完全に人間が書いたものであることはあり得ますし、逆に1つも満たしていなくても完全に生成されたものであることもあり得ます。このページのどの記述も、このサイトのツールが報告する内容も、誰が書いたかを確定するものではありません。
文書を一度にチェックする方法
実際的な手順を、最も手軽なチェックから順に示します。
- 不可視文字をスキャンする。 最もシグナルが高く、手間も最小のチェックです。まずは文章を不可視文字を表示に貼り付けてください。何も削除せず、隠れ文字をその場で
[ZWSP]、[SHY]、[BOM]、[LRM]、[NBSP]、[NNBSP]とラベル付けするため、ノーブレークスペースや狭いノーブレークスペースも含めて、いくつあってどこにあるかが分かります。もう一方の不可視文字を削除は、隠れ文字の総数、ゼロ幅文字、ソフトハイフンの件数をレポートしてそれらを取り除きます(ノーブレークスペースはそのまま残します)。 - 機械的な痕跡をまとめて数える。 AI文章クリーナーは、長いダッシュ、曲線引用符、不可視文字、絵文字を一度にレポートします。1つずつ追いかけるのではなく、複数のシグナルが同時に現れているかを確認できます。
- 文体的なパターンを読み取る。 件数を確認した後でのみ行います。数字を先に見ることで、自分を納得させるような結論に流されずに済みます。
- 文脈を考慮する。 Wordから貼り付けた文章には、誰が書いたかに関わらず曲線引用符が含まれます。プレーンなテキストエリアに直接入力された文章には含まれません。
重要なのは同時出現です。長いダッシュが1つあるだけでは何の意味もありません。プレーンテキストのフォームに直接入力されたはずの文書に、長いダッシュと曲線引用符と2つのゼロ幅スペースと絵文字付き箇条書きが揃っているなら、それは本当に珍しい組み合わせです。
どれも証拠にならない理由
上記のすべての兆候には、無辜の説明が存在します。
Wordはハイフン2つを長いダッシュに自動変換し、WordとGoogleドキュメントはどちらも直線引用符を曲線引用符に自動変換します。現代のWebサイトからコピーすれば不可視文字が混入することもあります。プロの編集者は、まさに機械生成に見えるバランスの取れた曖昧な文体で書きます。英語を母語としない書き手は、より形式的で構造的に整った文体で書くことが多く、商用のAI検出ツールが彼らの文章を著しく高い割合で誤検出するのはそのためです。
明白な循環性もあります。AIの出力をテキストエディタに貼り、クリーンアップを実行すれば、機械的な兆候は約10秒ですべて除去できます。最も測定しやすいシグナルは、最も消去しやすいシグナルでもあるのです。
ですから、正直な結論はこうです。書式分析が教えてくれるのは文書にどんな文字が含まれているかです。誰がそれを入れたかは教えてくれません。私たちのツールがあえて件数だけを報告し、判定を下さないのは、判定とは数字という衣をまとった推測にすぎないからです。誰かが書いたものかどうかを知る必要があるなら、答えはダッシュを数えることではなく、本人と話すこと――草稿の履歴、参照元、自分の主張を説明できるかどうか――から得られます。
よくある質問
AI生成文章の最も信頼できる兆候は何ですか?
ゼロ幅スペースなどの不可視のUnicode文字が最も強力な機械的指標です。通常のタイピングでこれらが生成されることはほぼない一方、チャット画面からのコピー&ペーストではしばしば混入します。ただし、Webサイトからのコピーでも混入し得るため、示せるのは執筆者ではなく貼り付け元の出所にとどまります。
AI検出ツールは実際に機能しますか?
信頼できるほどではありません。人間の文章に誤検出を出し――英語を母語としない書き手が特に影響を受けています――軽い編集で回避もできます。書式分析は具体的な痕跡を数えられますが、私たちのツールを含め、文章だけから執筆者を特定できるツールはありません。
長いダッシュや曲線引用符を使うと、AI使用を疑われますか?
疑われるべきではありませんし、非難の根拠としても不適切です。Wordは通常のタイピングから両方を自動生成しますし、Googleドキュメントも同じように引用符を曲線化します。文書の印象が気になる場合は、句読点をプレーンなASCIIに変換すれば、文章を一文字も変えずに痕跡を除去できます。
AI生成文章からこれらの兆候を除去できますか?
はい、しかもすぐに――それこそが、これらが弱い証拠である理由です。長いダッシュの置換、引用符の正規化、不可視文字の除去は数秒で済みます。これは検出の主張を懐疑的に見るための理由であり、他人の成果を自分のものとして偽るための手法ではありません。