「没有显卡的 VPS 能不能跑大模型」是过去两年被问得最多的问题之一。2026 年中的答案已经很清楚:能跑,但要挑对模型、挑对量化、挑对任务。开源小模型这一年进步很快,几 GB 内存就能跑出可用质量的模型不再稀奇。
纯 CPU 环境下值得优先考虑的模型
- Gemma 4 E4B:Google 的新一代开源小模型,支持多模态,低配下可低至约 3GB 显存/内存占用,是当前 CPU-only 场景里最值得关注的一个。
- Qwen3.5 4B:综合能力均衡,中文表现好,常被当作通用默认选择。
- Phi-4-mini-instruct:微软的小体积路线,明确面向小硬件与分析类任务。
- SmolLM3 3B:极小体积,适合资源最紧的实例。
- Llama 3.2 3B:生态成熟、文档多,适合作为入门起点。
粗略的内存对应关系可以这样估:4B 级模型在 Q8 量化下大约需要 4.5GB 可用内存,Q4 量化能压到一半左右。所以 8GB 内存的实例是舒适起点,4GB 是下限且必须用低比特量化,1GB 的入门实例基本不用考虑本地推理。
把它跑起来的工具
CPU 推理主要靠 llama.cpp,它针对 AVX、AVX2、AVX512、AMX、ARM NEON 等指令集做了优化;Ollama 在其上提供了更简单的模型管理与 API,是 VPS 部署最省事的一层。装好后用一条命令拉模型、起一个本地 HTTP 接口,就能接到你自己的应用里。
先想清楚这三件事
- CPU 推理慢,要匹配任务:纯 CPU 每秒生成的 token 数远低于 GPU。适合低并发、可异步的活儿——文章摘要、分类打标、内容审核、后台批处理;不适合高并发实时对话。
- 内存是硬约束,不是建议值:模型加载不进内存就直接失败。小实例先加 swap 能勉强跑起来,但速度会掉到不可用,评估时按真实可用内存来算。
- 算总账再决定:一台常开的 8GB VPS 与按量计费的模型 API,哪个便宜取决于你的调用量。自建的真正价值往往在数据不出自己的服务器、以及成本可预测。
一个务实的组合
很多人最终采用的是混合方案:把高频、低难度、涉及敏感数据的任务放在自己 VPS 上的小模型;把低频但需要强推理的任务交给云端大模型 API。这样既守住了数据边界,也没在算力上硬撑。
SharkCloud 提供从入门到高配的多档内存规格与香港、日本、美国等地区节点,你可以先用小规格试跑模型和吞吐,确认可行后再按需升级配置——不必一上来就为算力付一大笔预算。