AI detector digunakan untuk memperkirakan apakah suatu tulisan kemungkinan dibuat atau dimodifikasi menggunakan AI. Namun, hasil yang diberikan bukan penentu mutlak karena sistem deteksi masih dapat salah mengenali tulisan manusia maupun tulisan yang dihasilkan AI.
Lalu, seberapa akurat AI detector dalam mendeteksi tulisan AI? Untuk memahaminya, penting melihat cara membaca hasil deteksi, kemungkinan false positive dan false negative, serta mengapa skor AI sebaiknya tidak digunakan sendirian untuk menilai keaslian sebuah tulisan.
Apakah AI Detector Selalu Akurat?
Tidak. AI detector dapat memberikan hasil yang keliru sehingga skor yang muncul sebaiknya dipahami sebagai indikasi, bukan bukti pasti bahwa sebuah tulisan dibuat menggunakan AI.
Turnitin sendiri menyatakan bahwa model AI Writing Detection mereka mungkin tidak selalu akurat dan dapat salah mengidentifikasi tulisan manusia, tulisan yang dihasilkan AI, maupun tulisan yang telah dimodifikasi menggunakan AI. Karena itu, hasil deteksi tidak seharusnya menjadi satu-satunya dasar untuk mengambil tindakan terhadap mahasiswa.
Penelitian terbaru yang membandingkan Turnitin dan Originality juga menemukan bahwa performa kedua sistem berbeda menurut jenis teks dan kategori kepengarangan. Dalam penelitian tersebut, keduanya menunjukkan keterbatasan terutama ketika menghadapi tulisan dengan campuran kontribusi manusia dan AI.
Mengapa Hasil AI Detector Bisa Salah?
Salah satu masalah dalam AI detection ialah kemungkinan munculnya false positive, yaitu tulisan manusia yang justru ditandai sebagai kemungkinan tulisan AI. Sebaliknya, false negative terjadi ketika tulisan yang sebenarnya dibuat AI tidak teridentifikasi dengan tepat.
Turnitin secara khusus menyebut adanya kemungkinan false positive pada model AI-nya. Bahkan, sistem tersebut tidak lagi menampilkan skor numerik 1–19% pada laporan terbaru karena pengujian menunjukkan tingkat false positive yang lebih tinggi pada rentang tersebut.
Hasil penelitian juga menunjukkan bahwa performa detector dapat berubah berdasarkan panjang dan jenis tulisan. Dalam penelitian terhadap Turnitin dan Originality, akurasi berbeda antara tulisan bidang humaniora dan sains, sementara teks dengan kepengarangan campuran menjadi salah satu jenis yang paling sulit diklasifikasikan.
Artinya, skor AI tidak hanya perlu dilihat dari angkanya. Karakteristik teks dan konteks penggunaannya juga dapat memengaruhi bagaimana sistem mengklasifikasikan tulisan.
Bagaimana Cara Membaca Hasil AI Detector?
Hasil AI detector sebaiknya dibaca sebagai perkiraan terhadap bagian teks yang dianggap memiliki karakteristik tertentu, bukan sebagai persentase pasti mengenai berapa banyak tulisan yang benar-benar dibuat oleh AI.
Pada Turnitin, misalnya, persentase AI menunjukkan jumlah qualifying text yang dinilai oleh model kemungkinan berasal dari AI. Qualifying text tersebut berupa kalimat prosa dalam tulisan panjang, sehingga tidak semua jenis teks dalam sebuah dokumen otomatis diperlakukan dengan cara yang sama.
Turnitin juga menetapkan persyaratan tertentu agar dokumen dapat menghasilkan AI Writing Report, termasuk minimal 300 kata prosa, maksimal 30.000 kata, serta penggunaan bahasa yang didukung oleh sistem. Saat ini bahasa yang tercantum untuk AI Writing Report Turnitin ialah Inggris, Spanyol, Jepang, dan Arab.
Karena itu, angka pada laporan tidak sebaiknya diterjemahkan secara sederhana menjadi “sekian persen tulisan pasti dibuat AI.” Angka tersebut merupakan hasil klasifikasi model terhadap teks yang memenuhi kriteria deteksi.
Mengapa Hasil AI Detector Perlu Ditinjau Kembali?
Dalam konteks akademik, hasil AI detector sebaiknya dipertimbangkan bersama bukti dan konteks lain. Misalnya, proses pengerjaan, draf sebelumnya, kemampuan mahasiswa menjelaskan isi tulisan, serta kebijakan akademik yang berlaku dapat membantu memberikan gambaran yang lebih lengkap.
Turnitin sendiri menyarankan agar AI Writing Report digunakan sebagai satu data point, bukan sebagai jawaban definitif. Keputusan tetap membutuhkan penilaian manusia yang mempertimbangkan pengetahuan terhadap pekerjaan mahasiswa dan kebijakan institusi.
Pendekatan ini juga sejalan dengan temuan bahwa performa AI detector dapat berubah berdasarkan panjang, genre, dan karakteristik tulisan. Karena itu, mendapatkan skor AI tinggi tidak dengan sendirinya membuktikan bahwa seseorang menggunakan AI, sama seperti skor rendah tidak menjamin bahwa sebuah tulisan sepenuhnya dibuat manusia.
Kesimpulan
AI detector tidak selalu akurat dalam mendeteksi tulisan AI. Sistem ini dapat menghasilkan false positive maupun false negative, sehingga hasil deteksi lebih tepat dipahami sebagai indikasi yang perlu ditinjau daripada bukti mutlak.
Jika digunakan dalam konteks akademik, skor AI sebaiknya dibaca bersama proses pengerjaan, isi tulisan, dan kebijakan institusi. Dengan begitu, hasil detector tidak disalahartikan sebagai kepastian mengenai siapa yang menulis sebuah teks.
FAQ
Apakah tulisan manusia bisa terdeteksi sebagai tulisan AI?
Bisa. Kondisi tersebut disebut false positive, yaitu ketika tulisan yang sebenarnya dibuat manusia justru diklasifikasikan sebagai kemungkinan tulisan AI.
Apakah skor AI tinggi berarti tulisan pasti dibuat AI?
Tidak. Skor AI merupakan hasil perkiraan model terhadap teks yang dianalisis, bukan bukti mutlak mengenai asal tulisan.
Apakah AI detector bisa salah mendeteksi tulisan AI?
Bisa. AI detector dapat mengalami kesalahan dalam mengidentifikasi tulisan AI maupun tulisan manusia, sehingga hasilnya perlu dipertimbangkan bersama konteks dan penilaian manusia.