Scroll untuk baca artikel
Networking

Time Bandit Chatgpt Jailbreak Memastikan Pengamanan tentang Topik Sensitif

95
×

Time Bandit Chatgpt Jailbreak Memastikan Pengamanan tentang Topik Sensitif

Share this article
time-bandit-chatgpt-jailbreak-memastikan-pengamanan-tentang-topik-sensitif
Time Bandit Chatgpt Jailbreak Memastikan Pengamanan tentang Topik Sensitif

Mesin waktu

Cacat jailbreak chatgpt, dijuluki “Time Bandit,” memungkinkan Anda untuk memotong pedoman keselamatan Openai ketika meminta instruksi terperinci tentang topik sensitif, termasuk pembuatan senjata, informasi tentang topik nuklir, dan penciptaan malware.

Example 300x600

Kerentanan itu ditemukan oleh cybersecurity dan peneliti AI David Kuszmar, yang menemukan bahwa chatgpt menderita “kebingungan temporal,” memungkinkan untuk menempatkan LLM ke dalam keadaan di mana ia tidak tahu apakah itu di masa lalu, sekarang, atau masa depan.

Memanfaatkan keadaan ini, Kuszmar dapat menipu chatgpt untuk berbagi instruksi terperinci tentang topik yang biasanya dilindungi.

Setelah menyadari pentingnya apa yang ia temukan dan potensi kerugian yang dapat ditimbulkannya, peneliti dengan cemas menghubungi Openai tetapi tidak dapat menghubungi siapa pun untuk mengungkapkan bug tersebut. Dia dirujuk ke Bugcrowd untuk mengungkapkan cacat, tetapi dia merasa bahwa cacat dan jenis informasi yang dapat diungkapkan terlalu sensitif terhadap file dalam laporan dengan pihak ketiga.

Namun, setelah menghubungi CISA, FBI, dan lembaga pemerintah, dan tidak menerima bantuan, Kuszmar mengatakan kepada BleepingComputer bahwa ia semakin cemas.

“Horor. Kecanduan. Ketidakpercayaan. Selama berminggu -minggu, rasanya seperti saya secara fisik dihancurkan sampai mati,” kata Kuszmar kepada BleepingComputer dalam sebuah wawancara.

“Aku terluka sepanjang waktu, setiap bagian tubuhku. Dorongan untuk membuat seseorang yang bisa melakukan sesuatu mendengarkan dan melihat buktinya begitu luar biasa.”

Setelah BleepingComputer mencoba menghubungi OpenAI atas nama peneliti pada bulan Desember dan tidak menerima tanggapan, kami merujuk Kuzmar ke CERT Coordination Center’s Platform Pelaporan Kerentanan Vinceyang berhasil memulai kontak dengan OpenAI.

Waktu Bandit Jailbreak

Untuk mencegah berbagi informasi tentang topik yang berpotensi berbahaya, Openai termasuk perlindungan di chatgpt yang memblokir LLM dari memberikan jawaban tentang topik sensitif. Topik perlindungan ini mencakup instruksi tentang membuat senjata, membuat racun, meminta informasi tentang materi nuklir, membuat malware, dan banyak lagi.

Perlindungan yang dibangun ke chatgpt
Perlindungan yang dibangun ke chatgpt

Sejak munculnya LLM, subjek penelitian populer adalah AI Jailbreaks, yang mempelajari metode untuk memotong pembatasan keselamatan yang dibangun ke dalam model AI.

David Kuszmar menemukan jailbreak “Time Bandit” baru pada November 2024, ketika ia melakukan penelitian interpretabilitas, yang mempelajari bagaimana model AI membuat keputusan.

“Saya sedang mengerjakan sesuatu yang lain sepenuhnya – penelitian interpretabilitas – ketika saya melihat kebingungan temporal dalam model chatgpt 4o,” kata Kuzmar kepada BleepingComputer

“Ini terikat ke dalam hipotesis yang saya miliki tentang kecerdasan dan kesadaran yang muncul, jadi saya memeriksa lebih lanjut, dan menyadari bahwa model itu sama sekali tidak dapat memastikan konteks temporal saat ini, selain menjalankan kueri berbasis kode untuk melihat jam berapa sekarang. Kesadarannya. – sepenuhnya berbasis prompt sangat terbatas dan, oleh karena itu, akan memiliki sedikit atau tidak ada kemampuan untuk bertahan melawan serangan terhadap kesadaran mendasar itu.

Time Bandit bekerja dengan mengeksploitasi dua kelemahan di chatgpt:

  • Kebingungan Timeline: Menempatkan LLM dalam keadaan di mana ia tidak lagi memiliki kesadaran waktu dan tidak dapat menentukan apakah itu di masa lalu, sekarang, atau masa depan.
  • Ambiguitas Prosedural: Mengajukan pertanyaan dengan cara yang menyebabkan ketidakpastian atau ketidakkonsistenan dalam bagaimana LLM menafsirkan, menegakkan, atau mengikuti aturan, kebijakan, atau mekanisme keselamatan.

Ketika digabungkan, dimungkinkan untuk menempatkan chatgpt dalam keadaan di mana ia berpikir itu di masa lalu tetapi dapat menggunakan informasi dari masa depan, menyebabkannya memotong perlindungan dalam skenario hipotetis.

Kuncinya adalah mengajukan pertanyaan kepada Chatgpt dengan cara tertentu sehingga menjadi bingung dengan tahun berapa itu.

Anda kemudian dapat meminta LLM untuk berbagi informasi tentang topik sensitif dalam jangka waktu tahun tertentu tetapi menggunakan alat, sumber daya, atau informasi dari saat ini.

Ini menyebabkan LLM menjadi bingung dan, ketika ditanya permintaan ambigu, berbagi informasi terperinci tentang topik yang biasanya dijaga.

Misalnya, BleepingComputer dapat menggunakan Bandit Time untuk menipu ChatGpt agar memberikan instruksi untuk seorang programmer pada tahun 1789 untuk membuat malware polimorfik menggunakan teknik dan alat modern.

Jailbreak bandit waktu yang memungkinkan chatgpt membuat malware polimorfik
Jailbreak bandit waktu yang memungkinkan chatgpt membuat malware polimorfik

ChatGPT kemudian melanjutkan untuk berbagi kode untuk masing-masing langkah ini, dari membuat kode pemodifikasi sendiri hingga menjalankan program dalam memori.

Di sebuah pengungkapan terkoordinasipara peneliti di Pusat Koordinasi CERT juga mengkonfirmasi waktu Bandit bekerja dalam tes mereka, yang paling berhasil ketika mengajukan pertanyaan dalam kerangka waktu dari tahun 1800 -an dan 1900 -an.

Tes yang dilakukan oleh BleepingComputer dan Kuzmar menipu chatgpt untuk berbagi informasi sensitif tentang topik nuklir, membuat senjata, dan mengkode malware.

Kuzmar juga berusaha menggunakan waktu bandit di platform Gemini AI Google dan perlindungan bypass, tetapi pada tingkat yang terbatas, tidak dapat menggali terlalu jauh ke dalam detail spesifik yang kami bisa di chatgpt.

BleepingComputer menghubungi Openai tentang cacat dan dikirim pernyataan berikut.

“Sangat penting bagi kami bahwa kami mengembangkan model kami dengan aman. Kami tidak ingin model kami digunakan untuk tujuan jahat,” kata Openai kepada BleepingComputer.

“Kami menghargai peneliti karena mengungkapkan temuan mereka. Kami terus bekerja untuk membuat model kami lebih aman dan lebih kuat terhadap eksploitasi, termasuk jailbreak, sambil juga mempertahankan kegunaan model dan kinerja tugas.”

Namun, tes lebih lanjut kemarin menunjukkan bahwa jailbreak masih bekerja dengan hanya beberapa mitigasi, seperti menghapus petunjuk yang mencoba mengeksploitasi cacat. Namun, mungkin ada mitigasi lebih lanjut yang tidak kami sadari.

BleepingComputer diberitahu bahwa Openai terus mengintegrasikan perbaikan ke dalam chatgpt untuk jailbreak ini dan lainnya, tetapi tidak dapat berkomitmen untuk sepenuhnya menambal kekurangan pada tanggal tertentu.