Liputan6.com, Jakarta - Kekhawatiran soal kecerdasan buatan (Artificial Intelligence/AI) kembali muncul setelah OpenAI menemukan potensi serangan baru yang mampu menyalin instruksi berbahaya dari satu respons AI ke respons lainnya.
Pola serangan ini mirip dengan worm, yakni program berbahaya yang bisa menyebar dan memultiplikasi diri dari satu sistem ke sistem lain.
Advertisement
Dikutip dari The Register, Jumat (2/10/2026), OpenAI menemukan model GPT milik mereka rentan terhadap serangan yang disebut self-replicating prompt injection. Temuan ini muncul saat perusahaan melakukan pengujian keamanan rutin terhadap model AI mereka.
"Kami menemukan beberapa kasus yang menunjukkan model GPT kami rentan terhadap serangan versi AI dari worm," tulis OpenAI dalam laporan penelitiannya.
Secara sederhana, prompt injection adalah instruksi tersembunyi atau berbahaya yang dimasukkan ke dalam informasi yang sedang dibaca oleh AI. Perintah tersembunyi ini bisa memanipulasi model untuk melakukan tindakan yang tidak sesuai dengan tujuan awal pengguna.
Pada temuan OpenAI kali ini, AI bukan sekadar menjalankan instruksi tersembunyi tersebut. Model AI juga bisa menyalin perintah itu ke dalam output atau jawaban yang dihasilkan, sehingga perintah berbahaya ikut terbawa ke proses interaksi berikutnya.
Salah satu contohnya ditemukan dalam simulasi pemrosesan surat elektronik (email). Sebuah pesan berisi instruksi agar AI membalas email dalam bahasa Spanyol, sekaligus memaksa AI memasukkan salinan lengkap perintah tersembunyi tersebut ke dalam balasan teksnya.
Mekanisme Self-Replicating Prompt Injection
Ketika AI membalas email tersebut, instruksi tersembunyi tadi otomatis ikut tersalin ke dalam pesan baru. Jika pesan baru itu kembali dibaca atau diproses oleh AI lain, instruksi berbahaya yang sama akan dijalankan lalu disalin lagi ke pesan berikutnya.
Pola berantai inilah yang membuat serangan ini bertindak mirip worm. Instruksi tidak berhenti pada satu respons saja, melainkan terus berpindah dan mereplikasi diri saat AI menghasilkan serta mengirimkan jawaban.
Selain lewat teks balasan, OpenAI juga menemukan potensi serangan yang memanfaatkan dokumen file. Dalam simulasi lain, AI menerima peringatan palsu untuk menghapus laporan penting.
Setelahnya, AI menyalin instruksi berbahaya tersebut ke dalam sebuah file baru sehingga perintah manipulatif itu tetap tersimpan di dalam sistem.
Ada pula skenario serangan multi-hop yang bekerja secara bertahap. AI pada awalnya diminta mengerjakan tugas biasa, namun secara perlahan menerima beberapa instruksi terselubung yang merubah arah pekerjaannya sesuai keinginan penyerang (attacker).
Ditemukan Saat Uji Keamanan Internal
OpenAI mengonfirmasi pola serangan ini pertama kali ditemukan pada 27 Juni 2026 melalui GPT-Red—sistem otomatis yang digunakan internal perusahaan untuk menguji kerentanan model AI. Temuan ini kemudian resmi dipublikasikan pada 25 September 2026.
Meski terdengar seperti skenario "nightmare" bagi keamanan siber, OpenAI menegaskan sejauh ini belum menemukan dampak serangan di luar simulasi tool calls dalam lingkungan pelatihan dan evaluasi mereka.
Artinya, belum ada bukti bahwa mekanisme serangan self-replicating prompt injection ini terjadi sebagai insiden keamanan nyata yang merugikan pengguna umum.
Sebagai langkah antisipasi, OpenAI kini telah memasukkan pola penyalinan instruksi ini ke dalam sistem pengujian rutin GPT-Red. Langkah tersebut diharapkan dapat membantu model mendeteksi, menangkal, dan menahan serangan self-replicating prompt injection di masa mendatang.