VLLM命令

一把老骨头 发布于 阅读:63 经验技巧

(myenv) yblgt@yblgt-ThinkStation-P710:~$ nohup vllm serve /data/models/awq3.8-standard \

--served-model-name qwen38-awq \
--host 0.0.0.0 \
--port 8002 \
--dtype float16 \
--attention-backend TRITON_ATTN \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.98 \
--max-num-batched-tokens 512 \
--max-num-seqs 2 \
--max-model-len 4096 \
--limit-mm-per-prompt '{"image": 1, "video": 0}' \
--mm-processor-kwargs '{"max_pixels": 262144}' \
--compilation-config '{"cudagraph_mode": "PIECEWISE"}' \
--trust-remote-code > ~/vllm.log 2>&1 &