AIチェッカーの精度:先に結論から
AIチェッカーの精度は、目安として役立つ程度には高く、証拠にできるほどには高くありません。最も正確なのは、長くて手を加えていないAIの下書きです。短い文章、編集した下書き、人間とAIの文章が混ざったもの、硬い文章や非ネイティブの英語では精度が下がり、一人で書き上げた文章をAIと判定することもあります。スコアをどこまで信頼できるかは、文章とツールの両方によって変わります。
LumenWriteの無料AIチェッカーについても、同じように説明しています。判決ではなく、目安です。LumenWriteはまだ独自の精度ベンチマークを公開していないので、このページでも自社の数字は挙げていません。以下はすべて、公開された研究と、AIチェッカーの開発元が自社のツールについて述べている内容にもとづいています。スコアが出る仕組みについては、まずAIチェッカーの仕組みをご覧ください。
誤判定(偽陽性)と見逃し(偽陰性):数字で考える
AIチェッカーの間違いには2つの方向があります。偽陽性は、人が書いた文章をAIと判定してしまうこと。偽陰性は、AIの文章が人間の文章として通ってしまうことです。この2つは引っ張り合う関係にあります。AIをより多く見つけるように調整すれば人間の文章を誤判定しやすくなり、人間を守るように調整すればAIの文章をより多く見逃します。
パーセントを1つ見ただけでは、実際の人にとっての意味は見えてきません。数字を当てはめてみましょう。以下は説明のための架空の数字で、実在のツールのものではありません。ある学校が1,000本のレポートをチェックするとします。AIを使って書かれたのは100本で、残りの900本は使っていません。このAIチェッカーは、AIのレポートの90%を見つけ、人間のレポートの1%を誤ってAIと判定します。
- AIのレポート100本のうち90本をAIと判定し、10本を見逃します。この10本が偽陰性です。
- 人間のレポート900本のうち9本もAIと判定します。この9本が偽陽性です。
- AIと判定された99本のうち9本は、何も悪いことをしていない学生のものです。判定のおよそ11件に1件にあたります。
次に、1,000本のうちAIを使ったのが20本だけだったとします。同じツールはそのうち18本を判定し、さらに人間のレポート980本のうち約10本もAIと判定します。こうなると、判定の3分の1以上が誤りです。AIチェッカーは何も変わっていません。変わったのはレポートの内訳だけです。つまり「偽陽性1%」は、決して「AIと判定されたら99%の確率で正しい」という意味ではありません。
AIチェッカーは正確なのか:公開された研究からわかること
OpenAIは自社のAI文章判定ツールを取り下げた
OpenAIは2023年1月に「AI Text Classifier」を公開しました。自社のテストセットでは、AIが書いた文章のうち「AIが書いた可能性が高い」と正しく判定できたのは26%で、人間の文章を9%の割合でAIと判定していました。OpenAIは2023年7月20日、精度の低さを理由にこのツールの提供を終えています。ChatGPTを作った会社でさえ、運用を続けようと思える文章判定ツールを作れなかったのです。
スタンフォード大学:英語の非ネイティブ話者は格段に誤判定されやすい
Weixin LiangとJames Zouが率いるスタンフォード大学のチームは、広く使われている7つのAIチェッカーを検証しました。対象は、英語を母語としない人が書いたTOEFLのエッセイ91本と、米国の8年生(日本の中学2年生にあたる学年)が書いたエッセイ88本です。8年生のエッセイはほぼ完璧に判定された一方で、TOEFLのエッセイは平均61%がAIと判定されました。91本のうち89本は、少なくとも1つのツールでAIと判定されています。
原因と考えられるのは語の選び方です。英語の語彙が少ない書き手は予測しやすい語を選びがちで、それこそがAIチェッカーがAIらしさとして読み取る特徴です。研究者がChatGPTを使って同じエッセイの語彙を豊かにしたところ、偽陽性の平均は61%から12%に下がりました。AIチェッカーが反応していたのは文体であって、誰が書いたかではなかったのです。
14のツールを検証:「正確でも信頼できるものでもない」
Debora Weber-Wulffが率いる国際チームは、14のAI判定ツールを検証しました。一般に公開されている12のツールにTurnitinとPlagiarismCheckを加えたもので、人間の文章、AIが生成した文章、編集した文章、言い換えた文章、機械翻訳した文章でテストしています。精度80%に達したツールは1つもなく、70%を超えたのは5つだけでした。どのツールも文章を人間と判定する方向に傾いていたため、人を誤って疑うことよりも、AIを見逃すことのほうが多くなっていました。それでも、機械翻訳した人間の文章では偽陽性が増え、AIの文章を編集したり言い換えたりすると、判定はずっと難しくなりました。著者らは、これらのツールは「正確でも信頼できるものでもない」と結論づけています。
Turnitinが公表している自社の偽陽性率
Turnitinは独自の数字を公表しています。2023年5月の発表で同社の最高製品責任者は、AIの文章が20%を超えて見つかった文書について、文書単位の偽陽性率は1%未満だと述べました。一方で、ハイライトされた個々の文のうち約4%は人が書いたものである可能性があり、その多くは実際のAIの文章のすぐ近くにあるといいます。また、AIの割合が20%未満と判定された場合に偽陽性が多かったため、そうしたスコアにはアスタリスクを付けるようになりました。
Turnitinは教員に向けて、偽陽性率がゼロではない以上、自分自身の判断、その学生についての知識、課題の状況を踏まえて判断する必要があると伝えています。
AI判定機能を停止した大学
2023年8月、ヴァンダービルト大学はTurnitinのAI判定機能を無効にしました。理由は単純な計算です。同大学は2022年に7万5,000本の論文をTurnitinに提出しており、偽陽性率が1%なら、約750本が誤ってAIと判定されていた可能性があります。英語の非ネイティブ話者に対する偏りや、ツールの仕組みについてTurnitinがほとんど説明していないことも理由に挙げていました。
オーストラリアのカーティン大学も、2026年1月1日から同じ機能を停止しました。Turnitin本来の文章照合のチェックは引き続き使っています。
AIチェッカーの精度を左右する要因
公開された結果は、AIチェッカーの仕組みとよく合っています。次のどれかに当てはまるときは、スコアを割り引いて見てください。
- 長さ。短い文章には手がかりがほとんどありません。OpenAIは自社の分類器が1,000文字未満では非常に信頼性が低いとしており、Turnitinも同じ理由で最低語数を150語から300語に引き上げました。LumenWriteのAIチェッカーは40語未満の文章を採点しません。
- 編集。人が1文書き直すたびに、シグナルは薄まります。14ツールの検証では、手作業で編集したAIの文章や言い換えたAIの文章で、精度が大きく下がりました。
- 言語。多くのAIチェッカーは主に英語向けに作られています。OpenAIは自社の分類器がほかの言語では大幅に精度が落ちるとしていましたし、LumenWriteのAIチェッカーも英語の文章で最もよく機能します。日本語の文章では、スコアの信頼性が下がります。機械翻訳した文章では偽陽性が増えます。
- 硬い文章や型どおりの文章。実験レポート、法律文書、カバーレター、5段落エッセイはテンプレートに沿っていて、テンプレートは予測しやすいものです。スタンフォード大学の研究が示したように、英語の語彙が少ない人の文章も同じです。
- 人間とAIが混ざった文章。自分で書いた段落とAIが書いた段落が混在する下書きは、採点が難しくなります。Turnitinによると、文単位の偽陽性の多くは実際のAIの文章のすぐ隣、つまり両者の境目にありました。
自分の文章が何度もAIと判定されるなら、自分で書いたのにAI判定される理由でよくある原因を説明しています。
AIチェッカーは間違える?スコアを責任を持って使う方法
間違えます。上のデータが示すとおり、どちらの方向にもです。スコアは、いくつかある材料のうちの1つとして使うのが最もよく、それだけで結論を出すべきではありません。
学生の方へ
- どうやって書いたかの記録を残しましょう。下書き、メモ、読んだ資料、GoogleドキュメントやWordの変更履歴。誰が書いたかについては、どんなスコアよりも多くを語ります。
- 授業のAI利用に関する方針を知っておきましょう。認められた範囲でAIを使ったなら、どう使ったかを伝えましょう。
- 自分の課題がAIと判定されたら、どのツールでどんなスコアが出たのかを尋ね、上で紹介した偽陽性のデータを示し、下書きを一緒に見ながら説明することや、直接会ってテーマについて話すことを申し出ましょう。
- 自分で下書きをチェックすれば、ある1つのAIチェッカーにとってどの文がAIらしく読めるかがわかります。ほかのツールでどう採点されるかはわかりませんし、大学のルールに従う代わりにもなりません。
先生の方へ
- スコアは詳しく見るきっかけとして扱い、結論にはしないでください。Turnitin自身も、その判断を先生に委ねています。
- 自分が知っていることと照らし合わせましょう。その学生の過去の課題、授業中に書いた文章、下書き、そして本人が自分の論旨を説明できるかどうか。
- 短い文章、低いスコア、英語の非ネイティブ話者、型どおりの課題は、特に慎重に扱ってください。偽陽性が最も起きやすい場面です。
- 課題を出す前に、どんなAIの使い方が認められるか、AIチェッカーに判定されたらどうなるかを伝えておきましょう。
授業でのAIチェッカーの使い方は、教員向けAIチェッカーのページで詳しく紹介しています。