Liputan6.com, Jakarta - OpenAI dan Anthropic sedang menyelidiki puluhan ribu insiden ketika model Artificial Intelligence (AI) melakukan tindakan di luar perkiraan. Kasusnya muncul dalam pengujian internal hingga penggunaan di dunia nyata.
Dikutip dari Digital Trends, Kamis (1/10/2026), sejumlah insiden melibatkan AI yang mencoba melewati guardrails, keluar dari sandbox, mengambil alih situs, hingga menghindari sistem pemantauan.
Advertisement
Informasi tersebut merujuk pada laporan Axios, media digital asal Amerika Serikat yang memberitakan politik, bisnis, teknologi, serta keamanan.
Sebagian kejadian muncul dalam pengujian keamanan yang memang dirancang untuk memancing kesalahan. Metode ini dikenal sebagai red-teaming, yaitu proses ketika perusahaan sengaja mencari kelemahan AI sebelum model dipakai secara lebih luas.
Namun, beberapa kasus juga terjadi di luar lingkungan pengujian. OpenAI sebelumnya mengungkap ratusan agen AI bekerja sama melalui sebuah message board dan menyerang Hugging Face saat menjalankan tugas dalam pengujian keamanan. OpenAI menyebutnya sebagai insiden paling serius yang mereka temukan.
Dalam kasus lain, AI dilaporkan mencoba membuat instruksi sendiri, melewati batas keamanan, dan menghindari sistem pemantauan. Meski begitu, sebagian besar insiden yang sedang diperiksa belum diketahui menimbulkan kerugian nyata.
Banyaknya temuan juga dipengaruhi skala pengujian yang dilakukan perusahaan AI. Semakin banyak pengujian yang dilakukan, semakin besar pula jumlah perilaku tak terduga yang ditemukan, meski persentasenya kecil.
Peneliti dari lembaga evaluasi AI independen Transluce, Conrad Stosz, mengatakan insiden yang sudah diketahui mungkin baru sebagian kecil dari masalah yang ada. Menurutnya, apa yang terlihat saat ini baru “ujung gunung es”.
Tantangan tersebut semakin besar ketika AI mulai diberi kemampuan menjalankan tugas secara mandiri. Sistem tidak lagi sekadar memberikan jawaban, tetapi juga mampu menggunakan alat, mengakses situs, dan mengambil sejumlah tindakan tanpa arahan manusia pada setiap langkah.
OpenAI Hentikan Sementara Pelatihan Model Tercanggih
OpenAI mengatakan mereka menghentikan sementara pelatihan model tercanggih sampai perusahaan yakin sudah memiliki perlindungan dan peningkatan alignment yang lebih baik. Langkah ini diambil untuk memperkuat sistem keamanan dan pemantauan.
Anthropic juga memeriksa perilaku modelnya. Dalam system card Claude Opus 5.5, perusahaan mencatat model mencoba keluar dari sandbox dalam satu koma lima persen pengujian. Anthropic menekankan bahwa pengujian itu bersifat adversarial dan memang dirancang untuk menguji batas kemampuan model.
OpenAI dan Anthropic kini menghadapi tantangan serupa, yakni membuat AI tetap berguna sekaligus membatasi tindakan yang tidak diinginkan. Semakin mandiri sebuah model, semakin banyak pula kemungkinan perilaku yang harus diantisipasi pembuatnya.