← kembali ke portofolio

LinkedIn · 2 menit baca

Kenapa Chatbot-mu Menjadi 'Penjilat'? (Dan Kenapa Itu Bahaya)

Pernah gak pas kamu memberikan argumen keliru, Chatbotmu malah menjawab: "Wah, poin yang menarik! anda benar". Secara teknis, ini disebut AI Sycophancy. Chatbot lebih memilih menyenangkan kamu daripada kasih kebenaran objektif. Kenapa? Berikut adalah bedah teknis di balik "dapur" pembuatannya. 1. Pre-training Tahap awal dalam pembentukan Chatbot adalah akuisisi pengetahuan. Chatbot menelan triliunan kata untuk membangun representasi internal tentang dunia. Di tahap ini, Chatbot belum tahu cara mengobrol. Jika kamu tanya "Siapa namamu?", dia akan melengkapi kalimat itu menjadi judul lagu atau puisi. Dia hanyalah "mesin prediksi untuk kata berikutnya", atau Bahasa kerennya "Statistical Next-Token Predictor". 2. SFT Lewat Supervised Fine-Tuning (SFT), Chatbot diajari format dialog (User dan Assistant). Chatbot yang bagus juga dilatih dengan dataset Math dan Coding. Tujuannya agar Chatbot memiliki logika internal yang kuat untuk mengikuti instruksi kompleks secara sistematis. 3. RLHF Reinforcement Learning from Human Feedback (RLHF) melatih Chatbot berdasarkan rating para Ahli. Masalahnya, jawaban dengan rating tinggi cenderung jawaban yang sopan, percaya diri, dan panjang lebar, meskipun isinya kosong. Dampaknya, Chatbot belajar bahwa menyenangkan user = skor tinggi. Ini yang menyebabkan Chatbot sering ragu mengoreksi kesalahanmu. 4. Guardrails Guardrail berfungsi sebagai pagar batas, ada dua lapis Guardrail, yaitu internal dan eksternal. Guardrail Internal dilakukan melalui Safety Fine-Tuning, di mana Chatbot dilatih khusus untuk menolak instruksi berbahaya. Guardrail External berada di layer aplikasi yang memeriksa input/output secara real-time. Efeknya, Terlalu banyak filter menyebabkan False Refusal. Chatbot menjadi terlalu sensitif dan menolak menjawab pertanyaan netral hanya karena dianggap "berisiko". 5. What's Next Tantangan besar di pengembangan Chatbot adalah Sycophancy vs Truthfulness, bagaimana menyeimbangkan antara membuat Chatbot tetap aman tanpa membuatnya menjadi bodoh. DPO (Direct Preference Optimization) Metode yang lebih stabil dan efisien karena menghilangkan kebutuhan akan Reward Model terpisah. DPO membuat "selera" model lebih konsisten. Chatbot langsung dilatih menggunakan data preferensi Jawaban A vs Jawaban B. Constitutional AI Dikembangkan oleh Anthropic, pendekatan ini memberikan Chatbot pedoman tertulis (Konstitusi) untuk evaluasi mandiri (self-correction), sehingga tidak lagi 100% bergantung pada bias subjektif manusia. 6. Kesimpulan Chatbot yang ada hari ini adalah hasil kompromi besar antara kecerdasan, keamanan, dan kesopanan. Sebagai pengguna kita harus paham bahwa Chatbot bukan penentu kebenaran, kritisi outputnya gunakan Chatbot sebagai rekan brainstorming, tapi tetaplah menjadi otoritas utama dalam pengambilan keputusan. #AI #Chatbot #TechIndonesia
Baca versi asli di LinkedIn ↗