diff --git a/ansible/roles/llm-inference-multimodel/templates/llama-server-qwen.service.j2 b/ansible/roles/llm-inference-multimodel/templates/llama-server-qwen.service.j2 index 8f23346..76a11ae 100644 --- a/ansible/roles/llm-inference-multimodel/templates/llama-server-qwen.service.j2 +++ b/ansible/roles/llm-inference-multimodel/templates/llama-server-qwen.service.j2 @@ -14,7 +14,7 @@ ExecStart={{ llm_binary_path }} \ --port {{ llm_qwen_port }} \ --n-gpu-layers {{ llm_qwen_gpu_layers }} \ --ctx-size {{ llm_qwen_ctx_size }} \ - --flash-attn \ + --flash-attn on \ --cache-type-k q8_0 --cache-type-v q8_0 \ --batch-size {{ llm_qwen_batch_size }} --ubatch-size {{ llm_qwen_ubatch_size }} \ --jinja \