cd ~/llama-dflash
./build/bin/llama-server \
-m /data/models/unsloth-qwen3.8-27b/Qwen3.8-27B-Q4_K_M.gguf \
-md /data/models/Qwen3.8-27B-DFlash2/Q4_K_M.gguf \
--port 8001 --host 0.0.0.0 \
-t 12 --threads-batch 12 --n-gpu-layers 99 \
-c 32768 \
--flash-attn on \
--spec-type draft-dflash --spec-draft-n-max 5 \
--cache-type-k q4_0 --cache-type-v q4_0 \
--cache-ram 8192 \
--parallel 1 --temp 0.7 --top-p 0.8 --top-k 20 --presence-penalty 1.0
拉取分支命令:
cd ~/llama.cpp
拉取 PR #27342 到本地分支(不动当前分支)
git fetch origin pull/27342/head:pr-27342
独立工作树,编译产物隔离
git worktree add ~/llama-dflash pr-27342
cd ~/llama-dflash
export PATH=/usr/local/cuda/bin:$PATH
cmake -B build \
-DGGML_CUDA=ON \
-DGGML_CUDA_ARCHITECTURES="75" \
-DCMAKE_CUDA_COMPILER=/usr/local/cuda/bin/nvcc \
-DCMAKE_BUILD_TYPE=Release
cmake --build build -j $(nproc)