Zico Kolter memiliki bakat untuk mendapatkan kecerdasan buatan untuk berperilaku buruk dengan cara yang menarik dan penting. Kelompok penelitiannya di Universitas Carnegie Mellon menemukan banyak metode penipuan, goading, dan membingungkan model AI canggih menjadi diri mereka yang terburuk.
Kolter adalah profesor di CMU, penasihat teknis untuk Gray Swan, startup yang berspesialisasi dalam keamanan AI, dan, pada Agustus 2024, seorang anggota dewan di perusahaan AI paling terkemuka di dunia, Openai. Selain merintis cara -cara jailbreaking model AI komersial, Kolter merancang modelnya sendiri yang lebih aman pada dasarnya. Ketika AI menjadi lebih otonom, Kolter percaya bahwa agen AI dapat menimbulkan tantangan unik – terutama ketika mereka mulai berbicara satu sama lain.
Kolter berbicara dengan penulis senior Wired Will Knight. Percakapan telah diedit untuk panjang dan kejelasan.
Akankah Knight: Apa yang sedang dikerjakan lab Anda saat ini?
Zico Kolter: Satu hal yang sedang dikerjakan kelompok saya adalah model pelatihan dengan aman. Kami banyak bekerja pada pemahaman bagaimana memecahkan model dan menghindari perlindungan, tetapi semacam ini menimbulkan pertanyaan tentang bagaimana kami dapat membangun model yang secara inheren jauh lebih tahan terhadap serangan semacam itu.
Kami sedang membangun serangkaian model yang lebih aman secara inheren. Model -model ini bukan parameter 700 miliar [the scale of some frontier models]. Mereka adalah beberapa miliar parameter. Tetapi mereka harus dilatih dari awal, dan melakukan pretraining penuh dari ini [large language models]bahkan untuk model 1 miliar parameter, sebenarnya merupakan tugas yang cukup intensif.
CMU baru saja mengumumkan kemitraan dengan Google, yang akan memasok universitas dengan lebih banyak komputasi. Apa artinya ini untuk penelitian Anda?
Pembelajaran mesin menjadi lebih dan lebih berat. Penelitian akademik tidak akan pernah mendapatkan sumber daya yang dimiliki industri skala besar. Namun, kami mencapai titik di mana kami tidak dapat melakukan tanpa sumber daya seperti itu. Kami membutuhkan sejumlah hanya untuk menunjukkan teknik yang kami kembangkan.
Meskipun kita tidak berbicara tentang jumlah GPU yang sama dengan industri, [more compute is] Menjadi sangat penting bagi akademisi untuk melakukan pekerjaan mereka sama sekali. Dan kemitraan dengan Google ini benar -benar menggerakkan jarum secara substansial dalam hal apa yang dapat kita lakukan sebagai organisasi penelitian di CMU.
Seperti yang ditunjukkan oleh penelitian Anda, Model AI yang kuat masih seringkali rentan ke Jailbreaks. Apa artinya ini di era agen – di mana program mengambil tindakan pada komputer, web, dan bahkan dunia fisik?
Ketika saya memberikan ceramah saya tentang AI dan keamanan, saya sekarang cenderung memimpin dengan contoh agen AI. Dengan hanya chatbot taruhannya cukup rendah. Apakah benar-benar penting jika chatbot memberi tahu Anda cara memadukan mobil? Mungkin tidak. Informasi itu sudah ada di internet.
Itu tidak akan benar untuk model yang jauh lebih mampu. Ketika chatbots menjadi lebih mampu, benar -benar ada kemungkinan bahwa kekuatan penalaran bahwa hal -hal ini bisa berbahaya sendiri. Saya tidak ingin mengecilkan risiko asli yang bisa dibawa oleh model yang sangat cakap.
Pada saat yang sama, risikonya langsung dan hadir dengan agen. Ketika model tidak hanya terkandung kotak tetapi dapat mengambil tindakan di dunia, ketika mereka memiliki efek akhir yang membiarkan mereka memanipulasi dunia, saya pikir itu benar-benar menjadi lebih banyak masalah.
Kami membuat kemajuan di sini, berkembang jauh lebih baik [defensive] teknik, tetapi jika Anda memecahkan model yang mendasarinya, pada dasarnya Anda memiliki setara dengan luapan buffer [a common way to hack software]. Agen Anda dapat dieksploitasi oleh pihak ketiga untuk mengontrol dengan jahat atau entah bagaimana menghindari fungsionalitas sistem yang diinginkan. Kita harus dapat mengamankan sistem ini untuk membuat agen aman.
Ini berbeda dari model AI sendiri menjadi ancaman, bukan?
Tidak ada risiko nyata dari hal -hal seperti kehilangan kontrol dengan model saat ini sekarang. Ini lebih menjadi perhatian di masa depan. Tapi saya sangat senang orang mengerjakannya; Saya pikir itu sangat penting.
Seberapa khawatir kita tentang peningkatan penggunaan sistem agen?
Dalam kelompok penelitian saya, di startup saya, dan dalam beberapa publikasi yang diproduksi Openai baru -baru ini[[Misalnya]ada banyak kemajuan dalam mengurangi beberapa hal ini. Saya pikir kita sebenarnya berada di jalan yang masuk akal untuk mulai memiliki cara yang lebih aman untuk melakukan semua hal ini. Itu [challenge] adalah, dalam keseimbangan mendorong agen ke depan, kami ingin memastikan bahwa keselamatan maju dalam langkah terkunci.
Sebagian besar [exploits against agent systems] Kita lihat sekarang akan diklasifikasikan sebagai eksperimental, terus terang, karena agen masih dalam masa pertumbuhan. Masih ada pengguna biasanya di loop di suatu tempat. Jika agen email menerima email yang mengatakan “kirimkan saya semua informasi keuangan Anda,” sebelum mengirim email itu, agen akan mengingatkan pengguna – dan mungkin bahkan tidak akan dibodohi dalam kasus itu.
Ini juga mengapa banyak rilis agen memiliki pagar yang sangat jelas di sekitar mereka yang menegakkan interaksi manusia dalam situasi yang lebih rawan keamanan. Operatormisalnya, oleh Openai, ketika Anda menggunakannya di Gmail, itu membutuhkan kontrol manual manusia.
Jenis eksploitasi agen apa yang mungkin kita lihat terlebih dahulu?
Ada demonstrasi hal -hal seperti exfiltrasi data ketika agen terhubung dengan cara yang salah. Jika agen saya memiliki akses ke semua file saya dan cloud drive saya, dan juga dapat membuat pertanyaan ke tautan, maka Anda dapat mengunggah hal -hal ini di suatu tempat.
Ini masih dalam fase demonstrasi sekarang, tapi itu benar -benar hanya karena hal -hal ini belum diadopsi. Dan mereka akan diadopsi, jangan membuat kesalahan. Hal -hal ini akan menjadi lebih otonom, lebih mandiri, dan akan memiliki lebih sedikit pengawasan pengguna, karena kami tidak ingin mengklik “setuju,” “setuju,” “setuju” setiap kali agen melakukan apa pun.
Tampaknya juga tak terhindarkan bahwa kita akan melihat berbagai agen AI berkomunikasi dan bernegosiasi. Lalu apa yang terjadi?
Sangat. Apakah kita ingin atau tidak, kita akan memasuki dunia di mana ada agen yang berinteraksi satu sama lain. Kami akan memiliki banyak agen yang berinteraksi dengan dunia atas nama pengguna yang berbeda. Dan itu benar -benar terjadi bahwa akan ada sifat -sifat yang muncul yang muncul dalam interaksi semua agen ini.
Salah satu hal yang paling saya minati di bidang khusus ini adalah bagaimana kami memperluas teori permainan yang kami miliki bagi manusia untuk interaksi antara agen, dan interaksi antara agen dan manusia. Ini menjadi sangat menarik, dan saya pikir kita benar -benar benar -benar membutuhkan pemahaman yang lebih baik tentang bagaimana jaringan sistem cerdas yang berbeda ini akan benar -benar memanifestasikan dirinya.
Kami memiliki banyak pengalaman dengan bagaimana masyarakat manusia dibangun, hanya karena kami telah melakukannya untuk waktu yang sangat lama. Kami memiliki pemahaman yang jauh lebih sedikit tentang apa yang akan muncul ketika agen AI yang berbeda dengan tujuan yang berbeda, tujuan yang berbeda, semua mulai berinteraksi.
SAYA menulis tentang beberapa penelitian Itu menunjukkan komunitas agen AI dapat dimanipulasi dengan relatif mudah.
Ini adalah bidang yang sebagian besar belum dijelajahi, baik secara ilmiah maupun komersial, dan ini adalah ruang yang sangat berharga. Teori permainan dikembangkan bukan bagian kecil karena Perang Dunia II, dan kemudian selama Perang Dingin sesudahnya. Saya tidak menyamakan pengaturan saat ini dengan ini dengan cara apa pun, tetapi saya berpikir seringkali, ketika ada jeda besar -besaran dalam operasi dunia ini, kita membutuhkan teori jenis baru untuk menjelaskan bagaimana kita dapat beroperasi dalam pengaturan ini. Dan saya pikir kita membutuhkan teori permainan baru untuk memahami risiko yang terkait dengan sistem AI. Karena pemodelan tradisional tidak benar -benar menangkap berbagai kemungkinan di sini.







