「沒有顯示卡的 VPS 能不能跑大模型」是過去兩年被問得最多的問題之一。2026 年中的答案已經很清楚:能跑,但要挑對模型、挑對量化、挑對任務。開源小模型這一年進步很快,幾 GB 記憶體就能跑出可用品質的模型不再稀奇。
純 CPU 環境下值得優先考慮的模型
- Gemma 4 E4B:Google 的新一代開源小模型,支援多模態,低配下可低至約 3GB 顯示記憶體/記憶體佔用,是目前 CPU-only 情境裡最值得關注的一個。
- Qwen3.5 4B:綜合能力均衡,中文表現好,常被當作通用預設選擇。
- Phi-4-mini-instruct:微軟的小體積路線,明確面向小硬體與分析類任務。
- SmolLM3 3B:極小體積,適合資源最緊的執行個體。
- Llama 3.2 3B:生態成熟、文件多,適合作為入門起點。
粗略的記憶體對應關係可以這樣估:4B 級模型在 Q8 量化下大約需要 4.5GB 可用記憶體,Q4 量化能壓到一半左右。所以 8GB 記憶體的執行個體是舒適起點,4GB 是下限且必須用低位元量化,1GB 的入門執行個體基本不用考慮本機推論。
把它跑起來的工具
CPU 推論主要靠 llama.cpp,它針對 AVX、AVX2、AVX512、AMX、ARM NEON 等指令集做了最佳化;Ollama 在其上提供了更簡單的模型管理與 API,是 VPS 部署最省事的一層。裝好後用一條指令拉模型、起一個本機 HTTP 介面,就能接到你自己的應用裡。
先想清楚這三件事
- CPU 推論慢,要匹配任務:純 CPU 每秒產生的 token 數遠低於 GPU。適合低並行、可非同步的活兒——文章摘要、分類打標、內容審核、後台批次處理;不適合高並行即時對話。
- 記憶體是硬約束,不是建議值:模型載入不進記憶體就直接失敗。小執行個體先加 swap 能勉強跑起來,但速度會掉到不可用,評估時按真實可用記憶體來算。
- 算總帳再決定:一台常開的 8GB VPS 與按量計費的模型 API,哪個便宜取決於你的呼叫量。自建的真正價值往往在資料不出自己的伺服器、以及成本可預測。
一個務實的組合
很多人最終採用的是混合方案:把高頻、低難度、涉及敏感資料的任務放在自己 VPS 上的小模型;把低頻但需要強推論的任務交給雲端大模型 API。這樣既守住了資料邊界,也沒在算力上硬撐。
SharkCloud 提供從入門到高配的多檔記憶體規格與香港、日本、美國等地區節點,你可以先用小規格試跑模型和吞吐,確認可行後再按需升級配置——不必一上來就為算力付一大筆預算。