Seberapa akurat detektor AI? Jawaban singkatnya
Apakah AI detector akurat? Cukup akurat untuk menjadi petunjuk yang berguna, tetapi tidak cukup akurat untuk dijadikan bukti. Detektor AI paling bagus pada draf AI yang panjang dan belum diedit. Hasilnya lebih buruk pada teks pendek, draf yang sudah diedit, tulisan yang mencampur bagian manusia dan AI, serta bahasa Inggris yang formal atau ditulis oleh orang yang bahasa ibunya bukan bahasa Inggris. Kadang tulisan yang sepenuhnya dikerjakan sendiri oleh seseorang pun ikut ditandai. Seberapa jauh sebuah skor bisa dipercaya tergantung pada teks dan alatnya.
Begitu pula cara kami menggambarkan detektor AI gratis kami sendiri: panduan, bukan vonis. Kami belum memublikasikan benchmark akurasi kami sendiri, jadi halaman ini tidak mengutipnya. Semua isi di bawah berasal dari penelitian yang dipublikasikan dan dari pernyataan para pembuat detektor tentang alat mereka sendiri. Untuk memahami mekanisme di balik skor, mulailah dari cara kerja AI detector.
False positive vs false negative: contoh hitungan
Detektor bisa salah ke dua arah. False positive adalah tulisan manusia yang ditandai sebagai AI. False negative adalah tulisan AI yang lolos sebagai tulisan manusia. Keduanya saling tarik: setel alat agar menangkap lebih banyak AI, maka lebih banyak manusia ikut ditandai; setel agar melindungi manusia, maka lebih banyak AI yang lolos.
Satu angka persentase menyembunyikan dampaknya bagi orang sungguhan, jadi coba kita hitung. Angka-angka ini dibuat untuk ilustrasi dan tidak menggambarkan alat mana pun. Misalkan sebuah sekolah memeriksa 1.000 esai. Sebanyak 100 ditulis dengan AI dan 900 tidak. Detektornya menangkap 90% esai AI dan keliru menandai 1% esai manusia.
- Detektor menandai 90 dari 100 esai AI dan melewatkan 10. Sepuluh esai itu adalah false negative.
- Detektor juga menandai 9 dari 900 esai manusia. Sembilan esai itu adalah false positive.
- Dari 99 esai yang ditandai, 9 milik siswa yang tidak berbuat salah apa pun: kira-kira satu dari setiap sebelas tanda.
Sekarang misalkan hanya 20 dari 1.000 esai yang memakai AI. Alat yang sama menandai 18 di antaranya, ditambah sekitar 10 dari 980 esai manusia. Lebih dari sepertiga tanda kini salah, padahal detektornya sama sekali tidak berubah. Yang berubah hanya komposisi esainya. Jadi “false positive 1%” tidak pernah berarti “sebuah tanda 99% pasti benar”.
Apakah AI detector akurat? Yang ditunjukkan penelitian
OpenAI menarik AI Text Classifier miliknya sendiri
OpenAI merilis AI Text Classifier pada Januari 2023. Pada set uji milik OpenAI sendiri, alat itu dengan benar memberi label “kemungkinan ditulis AI” pada 26% teks tulisan AI, dan melabeli tulisan manusia sebagai AI pada 9% kasus. Pada 20 Juli 2023, OpenAI menonaktifkannya dengan alasan tingkat akurasinya rendah. Perusahaan pembuat ChatGPT sendiri tidak berhasil membuat detektor teks yang menurut mereka layak terus dijalankan.
Stanford: penulis non-native bahasa Inggris jauh lebih sering ditandai
Tim Stanford yang dipimpin Weixin Liang dan James Zou menguji tujuh detektor yang banyak dipakai pada 91 esai TOEFL karya penulis yang bahasa ibunya bukan bahasa Inggris dan 88 esai karya siswa kelas 8 di Amerika Serikat. Pada esai siswa kelas 8, detektor nyaris sempurna, tetapi rata-rata 61% esai TOEFL dilabeli sebagai AI. Dari 91 esai itu, 89 ditandai oleh setidaknya satu detektor.
Penyebab yang paling mungkin adalah pilihan kata: penulis dengan kosakata bahasa Inggris yang lebih terbatas memilih kata-kata yang lebih mudah ditebak, dan justru itulah yang dibaca detektor sebagai AI. Ketika para peneliti meminta ChatGPT memperkaya kosakata esai-esai yang sama, rata-rata tingkat false positive turun dari 61% menjadi 12%. Detektor bereaksi terhadap gaya, bukan terhadap siapa yang menulis.
Uji 14 alat: “tidak akurat dan tidak andal”
Tim internasional yang dipimpin Debora Weber-Wulff menguji 14 alat deteksi, yaitu 12 alat yang tersedia untuk umum ditambah Turnitin dan PlagiarismCheck, pada teks tulisan manusia, buatan AI, yang sudah diedit, yang diparafrasekan, dan yang diterjemahkan mesin. Tidak ada yang mencapai akurasi 80%, dan hanya lima yang melewati 70%. Alat-alat itu cenderung menyebut teks sebagai tulisan manusia, sehingga lebih sering melewatkan AI daripada menuduh orang. Tulisan manusia yang diterjemahkan mesin tetap memicu false positive, dan pengeditan atau parafrase teks AI membuat deteksi jauh lebih buruk. Para penulisnya menyimpulkan bahwa alat-alat itu “tidak akurat dan tidak andal”.
Kata Turnitin tentang tingkat false positive-nya sendiri
Turnitin memublikasikan angkanya sendiri. Dalam pembaruan Mei 2023, chief product officer Turnitin menyatakan bahwa tingkat false positive per dokumen di bawah 1% untuk dokumen yang terdeteksi mengandung lebih dari 20% tulisan AI. Sekitar 4% kalimat yang disorotnya mungkin ditulis manusia, dan sebagian besar letaknya dekat dengan teks AI sungguhan. Turnitin juga menemukan lebih banyak false positive ketika AI yang terdeteksi kurang dari 20%, sehingga skor seperti itu mulai diberi tanda bintang.
Turnitin mengingatkan para pengajar bahwa karena tingkat false positive-nya tidak nol, mereka perlu memakai penilaian sendiri, pengetahuan mereka tentang siswa yang bersangkutan, dan konteks tugasnya.
Universitas yang mematikan deteksi AI
Pada Agustus 2023, Vanderbilt University menonaktifkan detektor AI Turnitin. Alasannya hitungan sederhana: Vanderbilt mengirim 75.000 makalah ke Turnitin pada 2022, jadi tingkat false positive 1% bisa berarti sekitar 750 makalah salah dilabeli. Kampus itu juga menyebut bias terhadap penulis non-native bahasa Inggris dan minimnya penjelasan Turnitin tentang cara kerja alatnya.
Curtin University di Australia mematikan fitur yang sama mulai 1 Januari 2026, tetapi tetap memakai pemeriksaan kemiripan teks Turnitin yang biasa.
Apa yang memengaruhi akurasi detektor AI
Hasil-hasil yang dipublikasikan sejalan dengan cara kerja detektor. Kurangi kepercayaan Anda pada sebuah skor jika salah satu hal ini berlaku:
- Panjang teks. Teks pendek membawa sedikit sinyal. OpenAI menyebut classifier-nya sangat tidak andal untuk teks di bawah 1.000 karakter, dan Turnitin menaikkan batas minimumnya dari 150 menjadi 300 kata karena alasan yang sama. Detektor kami tidak menilai teks di bawah 40 kata.
- Pengeditan. Setiap kalimat yang ditulis ulang manusia mengencerkan sinyalnya. Dalam uji 14 alat tadi, akurasi turun tajam pada teks AI yang diedit manual dan yang diparafrasekan.
- Bahasa. Banyak detektor dibuat terutama untuk bahasa Inggris. OpenAI menyebut classifier-nya jauh lebih buruk untuk bahasa lain, dan detektor kami juga bekerja paling baik untuk bahasa Inggris, jadi skor untuk teks bahasa Indonesia kurang andal. Teks hasil terjemahan mesin menambah false positive.
- Tulisan formal atau berpola baku. Laporan praktikum, teks hukum, surat lamaran kerja, dan esai lima paragraf mengikuti template, dan template itu mudah ditebak. Begitu juga tulisan orang yang kosakata bahasa Inggrisnya terbatas, seperti yang ditunjukkan studi Stanford.
- Campuran teks manusia dan AI. Draf yang sebagian paragrafnya Anda tulis dan sebagian lagi ditulis AI sulit dinilai. Turnitin menemukan bahwa sebagian besar false positive tingkat kalimatnya berada tepat di sebelah tulisan AI sungguhan, di sambungan antara keduanya.
Kalau tulisan Anda sendiri terus-terusan ditandai, kenapa tulisan Anda terdeteksi AI menjelaskan penyebab yang biasa terjadi.
Bisakah detektor AI salah? Cara memakai skor secara bertanggung jawab
Bisa, ke dua arah, seperti yang ditunjukkan bukti di atas. Skor paling berguna sebagai satu bukti di antara beberapa bukti lain, tidak pernah sebagai keseluruhan kasus.
Kalau Anda pelajar atau mahasiswa
- Simpan catatan proses menulis Anda: draf, catatan, sumber yang Anda baca, dan riwayat versi di Google Docs atau Word. Semua itu lebih banyak bicara soal siapa penulisnya daripada skor mana pun.
- Pahami aturan AI di mata kuliah Anda. Kalau Anda memakai AI dengan cara yang diizinkan, jelaskan bagaimana Anda memakainya.
- Kalau karya Anda sendiri ditandai, tanyakan alat dan skor apa yang dipakai, tunjukkan angka false positive yang sudah dipublikasikan di atas, dan tawarkan untuk memperlihatkan draf Anda atau membahas topiknya secara langsung.
- Memeriksa draf sendiri menunjukkan kalimat mana yang terbaca seperti AI menurut satu detektor. Itu tidak bisa memberi tahu bagaimana alat lain akan menilainya, dan tidak pernah menggantikan kewajiban mengikuti aturan institusi Anda.
Kalau Anda guru atau dosen
- Anggap skor sebagai alasan untuk melihat lebih teliti, bukan sebagai kesimpulan. Turnitin sendiri menyerahkan keputusan itu kepada Anda.
- Bandingkan dengan yang Anda ketahui: karya siswa sebelumnya, tulisan di kelas, draf, dan apakah ia bisa menjelaskan argumennya.
- Berhati-hatilah pada teks pendek, skor rendah, penulis non-native bahasa Inggris, dan tugas yang berpola baku, karena di situlah false positive paling mungkin terjadi.
- Tetapkan aturan sebelum tugas diberikan: penggunaan AI seperti apa yang diizinkan, dan apa yang terjadi kalau detektor menandai sesuatu.
Halaman kami tentang AI checker untuk guru membahas lebih lanjut cara memakai alat cek AI di kelas.