安装VLLM

 

前言

马斯克点赞的小模型:Qwen3.5 私有化部署全攻略(0.8B/2B/4B/9B)3月2日阿里通义千问团队在 X 平台正 - 掘金

ollama 显存持续占用 - OrcHome

vLLM = 0.17.0rc1.dev...(开发版)vllm 使用 Qwen3-8B ,vllm

VLLM_USE_MODELSCOPE=true vllm serve /mnt/sdb1/liuhu/models/Qwen3-8B --host 0.0.0.0 --port 9000 --served-model-name Qwen3-8B --max-model-len 32768


--enable-reasoning
 --reasoning-parser deepseek_r1

  • vLLM 的 OpenAI API 并不认“本地路径”作为 model 名

    你在 client 里写的是:

    model="/mnt/sdb1/liuhu/models/Qwen3-8B/"
    

    👉 但 vLLM 的 OpenAI API 并不认“本地路径”作为 model 名

    它只认:

    --served-model-name