← Kembali ke wawasan

Applied AI

Human Oversight dalam Alur Kerja Berbasis AI

LinkedIn X

Human oversight mudah dijanjikan dan mudah diimplementasikan dengan buruk. Mode kegagalan yang paling umum bukan ketiadaan manusia di dalam alur — melainkan manusia di dalam alur yang tidak diberi sesuatu yang bermakna untuk dikerjakan. Reviewer yang mengklik setuju karena antarmuka tidak memberi dasar nyata untuk tidak setuju bukanlah oversight; itu adalah checkbox yang mengenakan pakaian oversight, dan cenderung menghasilkan hasil terburuk dari semuanya: rasa percaya diri palsu bahwa sebuah pengaman ada.

Saya pernah menghabiskan waktu memikirkan ini secara konkret, bukan abstrak, setelah bekerja pada platform compliance tempat sebuah fitur AI menyusun sebagian judgment yang pada akhirnya tetap menjadi tanggung jawab manusia. Satu guardrail dari pekerjaan itu terus membekas bagi saya sebagai contoh paling jelas yang saya tahu tentang apa yang benar-benar dibutuhkan oversight yang sesungguhnya: sebuah status yang bisa diberikan pada requirement — Not Applicable, artinya requirement itu memang tidak berlaku sama sekali bagi organisasi — hanya boleh ditetapkan oleh manusia. AI tidak diizinkan mencapai kesimpulan itu sendiri, karena itu persis kesimpulan yang mengeluarkan sebuah kontrol dari pertimbangan sama sekali, dan salah secara diam-diam jauh lebih berbahaya daripada salah pada penilaian rutin.

Tulisan ini membahas apa yang membedakan oversight semacam itu dari versi checkbox-nya, dan bagaimana merancang yang pertama secara sengaja.

Bersikap spesifik tentang apa yang sebenarnya sedang dinilai manusia

Oversight yang samar meminta reviewer untuk "memeriksa" output AI tanpa menjelaskan apa arti lolos atau gagal yang sebenarnya. Oversight yang bermakna menyebut judgment-nya secara presisi: apakah sitasi ini akurat, apakah rekomendasi ini sesuai konteks kami, apakah klasifikasi ini yang benar mengingat bukti yang mungkin tidak ditimbang model dengan tepat. Reviewer yang tahu persis pertanyaan apa yang sedang dijawabnya bisa tidak setuju dengan alasan yang spesifik dan bisa dipertahankan. Reviewer yang hanya diminta menyetujui atau menolak secara umum tidak punya dasar nyata untuk melakukan keduanya, dan akan default menyetujui karena itu jalan dengan resistensi paling kecil.

Sisakan sebagian kesimpulan hanya untuk manusia, secara sengaja dirancang

Beberapa kesimpulan yang diusulkan AI bersifat biasa dan bisa dibalik, dan manusia menangkap sesekali kesalahan adalah biaya yang bisa diterima dari memakai tool tersebut sama sekali. Yang lain tidak — itu adalah kesimpulan yang salahnya mahal justru karena tidak ada yang memeriksa ulang kesimpulan yang mengeluarkan sesuatu dari pertimbangan. Guardrail Not Applicable adalah versi paling jelas dari ini yang pernah saya implementasikan: AI boleh menyusun draf justification, mengusulkan status maturity, dan mensitasi bukti yang ditemukannya, tetapi ia tidak bisa menyatakan sebuah requirement di luar cakupan. Keputusan itu tetap di tangan manusia, setiap kali, secara sengaja dirancang, bukan sekadar konvensi — perbedaan antara aturan yang dipaksakan sebuah alur kerja dan norma yang hanya diharapkan diikuti seseorang.

Beri reviewer konteks yang cukup untuk tidak setuju, bukan hanya untuk setuju

Antarmuka yang hanya menampilkan kesimpulan model membuat persetujuan terasa mudah dan ketidaksetujuan terasa mahal — reviewer harus mencari sendiri bukti yang mendasarinya sebelum bisa membantah. Oversight yang sesungguhnya menampilkan alasan berdampingan dengan kesimpulannya: sumber yang mendasari sebuah rekomendasi, tingkat keyakinan atau ambiguitas di balik sebuah klasifikasi, bagian input mana yang paling membentuk output. Ketika tidak setuju membutuhkan usaha yang sama seperti setuju, oversight mulai menangkap kesalahan yang sungguhan alih-alih sekadar mengesahkan yang nyaman.

Buat meng-override sistem semudah menerimanya

Friksi tidak netral — ia selalu berpihak pada aksi mana pun yang membutuhkan lebih sedikit usaha, dan jika menyetujui hanya butuh satu klik sementara menolak membutuhkan justification tertulis dan tiga langkah tambahan, antarmuka itu sudah menentukan hasil yang disukainya terlepas dari apa yang diyakini reviewer. Meng-override hasil yang dihasilkan AI seharusnya setidaknya semudah menerimanya, dan tidak seharusnya menuntut reviewer membenarkan diri lebih banyak daripada yang dituntut dari AI-nya.

Beri tahu pengguna secara jujur keputusan mana milik siapa

Bagian terakhir dari oversight sama sekali bukan internal — melainkan apa yang diberitahukan kepada pengguna akhir. Hasil yang di-review seseorang dan hasil yang diproduksi model yang tidak pernah dilihat lagi siapa pun adalah dua klaim keandalan yang berbeda, dan menyajikan keduanya secara identik menyesatkan siapa pun yang mengandalkan output berikutnya. Membedakan "diusulkan model" dari "diputuskan manusia" hampir tidak berbiaya apa pun di sebuah antarmuka dan mengubah seberapa besar kepercayaan yang wajar diberikan pengguna pada apa yang mereka lihat.

Semua ini bukan tentang mencurigai model. Ini tentang bersikap jujur bahwa manusia yang duduk di dalam sebuah alur kerja tidak otomatis menjadi oversight — ia baru menjadi oversight ketika alur kerja itu memberi orang tersebut sesuatu yang spesifik untuk dinilai, konteks untuk menilainya dengan baik, cara yang mudah untuk tidak setuju, dan, untuk kesimpulan yang paling penting, otoritas eksklusif untuk mencapainya. Dirancang seperti itu, human oversight bukan pajak atas kecepatan sebuah fitur AI. Ia adalah alasan mengapa fitur itu cukup bisa dipercaya untuk dijalankan sama sekali.

Terbuka untuk diskusi seputar pengembangan produk yang aman, applied AI, dan compliance engineering.