"Bolehkah VPS tanpa GPU menjalankan model bahasa?" ialah antara soalan paling kerap ditanya dalam dua tahun kebelakangan. Menjelang pertengahan 2026 jawapannya jelas: boleh, jika anda memilih model, kuantisasi dan beban kerja yang betul. Model kecil berpemberat terbuka berkembang pantas tahun ini, dan memperoleh kualiti yang berguna daripada beberapa gigabait RAM bukan lagi perkara luar biasa.
Model yang wajar dipertimbangkan pada perkakasan tanpa GPU
- Gemma 4 E4B: model kecil berpemberat terbuka Google yang lebih baharu dengan sokongan multimod, berjalan serendah kira-kira 3GB pada hujung bawah — pilihan paling menarik untuk persediaan tanpa GPU ketika ini.
- Qwen3.5 4B: seimbang merentas tugas dan kukuh dalam bahasa Cina, kerap dianggap pilihan lalai serba guna yang selamat.
- Phi-4-mini-instruct: barisan berjejak kecil Microsoft, disasarkan secara jelas kepada perkakasan sederhana dan tugas analitik.
- SmolLM3 3B: sangat kecil, untuk instance yang paling terhad.
- Llama 3.2 3B: ekosistem matang dan dokumentasi berlimpah — titik permulaan yang baik.
Sebagai panduan memori kasar: model kelas 4B pada kuantisasi Q8 memerlukan kira-kira 4.5GB memori tersedia, dan Q4 mengurangkannya kepada kira-kira separuh. Jadi instance 8GB ialah titik permulaan yang selesa, 4GB ialah paras minimum dan memerlukan kuantisasi bit rendah, manakala instance permulaan 1GB tidak realistik untuk inferens tempatan.
Alat yang menjadikannya berfungsi
Inferens CPU dibina atas llama.cpp, yang dioptimumkan untuk laluan arahan termasuk AVX, AVX2, AVX512, AMX dan ARM NEON. Ollama berada di atasnya dan menambah pengurusan model yang mudah serta API HTTP, iaitu lapisan paling ringkas untuk penempatan VPS: pasang, tarik model dengan satu arahan, dan halakan aplikasi anda ke titik akhir tempatan.
Tiga perkara yang perlu diputuskan dahulu
- Inferens CPU perlahan — padankan dengan tugas: token sesaat pada CPU jauh di bawah GPU. Ini sesuai untuk kerja berkeserentakan rendah dan tak segerak — peringkasan, pengelasan dan pelabelan, penyederhanaan kandungan, pemprosesan kelompok — bukan sembang langsung berkeserentakan tinggi.
- Memori ialah kekangan ketat, bukan cadangan: jika model tidak muat, ia sekadar gagal dimuatkan. Menambah swap pada instance kecil secara teknikalnya boleh menghidupkannya, tetapi pemprosesan jatuh sehingga tidak boleh digunakan. Tentukan saiz berdasarkan memori yang benar-benar tersedia.
- Buat kiraan sebelum komited: sama ada VPS 8GB yang sentiasa hidup mengalahkan API bayar setiap token bergantung pada jumlah panggilan anda. Nilai sebenar hos sendiri biasanya ialah data tidak pernah meninggalkan pelayan anda, serta kos yang boleh diramal.
Gabungan yang munasabah
Kebanyakan orang akhirnya memilih campuran: tugas berfrekuensi tinggi, berkesukaran rendah dan sensitif privasi dijalankan pada model kecil di VPS sendiri, manakala kerja berfrekuensi rendah yang memerlukan penaakulan kuat dihantar ke API awan. Ini mengekalkan sempadan data tanpa berpura-pura CPU boleh melakukan segalanya.
SharkCloud menawarkan peringkat memori daripada tahap permulaan ke atas dengan nod di Hong Kong, Jepun, AS dan lain-lain, jadi anda boleh mencuba model dan mengukur pemprosesan pada pelan kecil dahulu, kemudian menskala setelah anda tahu ia berkesan — dan bukannya membayar untuk pengkomputeran yang belum anda sahkan.