Golden Finance melaporkan bahwa OpenAI merilis penelitian terbaru, menggunakan pemantauan CoT (chain of thought), dapat mencegah perilaku jahat seperti model besar berbicara omong kosong dan menyembunyikan niat sebenarnya, dan juga merupakan salah satu alat yang efektif untuk mengawasi model super. OpenAI menggunakan model mutakhir o3-mini yang baru dirilis sebagai objek yang dipantau, dan model GPT-4o yang lebih lemah sebagai monitor. Lingkungan pengujian adalah tugas pengkodean yang mengharuskan AI untuk mengimplementasikan fungsionalitas dalam basis kode untuk lulus pengujian unit. Hasil penelitian menunjukkan bahwa monitor CoT berkinerja baik dalam mendeteksi perilaku "reward hacking" yang sistematis, dengan tingkat recall hingga 95%, jauh melebihi 60% perilaku yang hanya dipantau.
Halaman ini mungkin berisi konten pihak ketiga, yang disediakan untuk tujuan informasi saja (bukan pernyataan/jaminan) dan tidak boleh dianggap sebagai dukungan terhadap pandangannya oleh Gate, atau sebagai nasihat keuangan atau profesional. Lihat Penafian untuk detailnya.
OpenAI Merilis Pemantauan CoT untuk Menghentikan Perilaku Berbahaya Model Besar
Golden Finance melaporkan bahwa OpenAI merilis penelitian terbaru, menggunakan pemantauan CoT (chain of thought), dapat mencegah perilaku jahat seperti model besar berbicara omong kosong dan menyembunyikan niat sebenarnya, dan juga merupakan salah satu alat yang efektif untuk mengawasi model super. OpenAI menggunakan model mutakhir o3-mini yang baru dirilis sebagai objek yang dipantau, dan model GPT-4o yang lebih lemah sebagai monitor. Lingkungan pengujian adalah tugas pengkodean yang mengharuskan AI untuk mengimplementasikan fungsionalitas dalam basis kode untuk lulus pengujian unit. Hasil penelitian menunjukkan bahwa monitor CoT berkinerja baik dalam mendeteksi perilaku "reward hacking" yang sistematis, dengan tingkat recall hingga 95%, jauh melebihi 60% perilaku yang hanya dipantau.