← kembali ke portofolio

LinkedIn · 2 menit baca

4 Pertanyaan Kunci Menuju Ai Lokal

Sejak munculnya chatGPT, AI terutama chatbot berbasis LLM telah dipake di banyak bidang. Gak sedikit yang mulai self-hosted atau pake Chatbotnya di komputer mereka. Banyak pilihan model di internet, kebanjiran informasi hanya membuatmu pusing memilih model. Daripada bingung, coba jawab dulu empat pertanyaan ini: 1. Data Apa yang Kamu Kirim? Ini adalah gerbang pertama, jika datamu gak rahasia atau sensitif, pakai aja API public, praktis dan murah, saya sarankan via openrouter dan pilih menu compare model. Jika kamu menangani data sensitif perusahaan atau dokumen privat, self-hosted adalah jawabannya. 2. Siapa yang Pakai? Setelah itu, maka tentukan siapa penggunanya. Jika hanya untuk penggunaan personal, Ollama adalah pilihan terbaik karena kemudahan setup, anda bisa langsung download model dan sudah disediakan GUI mirip ChatGPT. Jika penggunanya adalah tim (concurrent requests) Ollama akan kewalahan, pakailah Inference Engine seperti vLLM + openwebui sebagai GUI, karena openwebui sudah dilengkapi dengan user management yang baik. 3. Berapa VRAM GPU-mu? VRAM pada GPU akan sangat berpengaruh pada pilihan model yang bisa kamu pakai, lalu bagaimana dengan multi GPU? mungkin masalah VRAM bisa teratasi, tapi anda perlu setting lagi pada tingkat Inference Engine-nya (Ollama vs vLLM). Ollama baru support multi GPU untuk beberapa model. 4. Mau Buat untuk Apa? Pertanyaan ini penting, jangan cari model yang kuat secara general, cari model spesialis, karena spesialisasi adalah kunci efisiensi di ekosistem lokal. Ada model yang kuat untuk code (coder), ada yang kuat untuk pengolahan dokumen (instruct), ada yang bisa terima input gambar. Selain itu, gunakan model buatan dari developer resmi sebelum masuk ke model-model fine tuning buatan komunitas. Reminder Ada dua hal penting yang perlu diingat, yaitu Quantization dan Context Length. Model mentah biasanya berformat FP16 (Floating Point 16-bit) yang ukurannya bisa puluh sampe ratusan GB. Padahal, kita bisa pakai versi Quantized Q4 (4-bit). Konsumsi VRAM bisa dipangkas seperempatnya, tapi kualitas model hanya turun sekitar 2-5%. Untuk ekosistem self-hosted, Q4 adalah sweet spot yang paling masuk akal. VRAM GPU gak cuma dipake untuk load model, tapi juga harus menampung riwayat chat atau teks yang kita masukkan. Di Ollama parameternya disebut "num_ctx", kalau di vLLM namanya "max-model-len" set pada 4096 atau 8192 sudah cukup. Inilah beberapa hal yang perlu dipertimbangkan agar riset kita terarah dan tidak habis untuk "coba-coba", kita harus "coba-coba" secara terarah. #LLM #ArtificialIntelligence #LocalAI #SovereignAI #DataScience #TechIndonesia
Baca versi asli di LinkedIn ↗