From d4ff2681acd315cb88d18b3e0d7178385dccfb8a Mon Sep 17 00:00:00 2001 From: Hermes Agent service account Date: Thu, 6 Aug 2026 09:24:42 -0500 Subject: [PATCH] llm-inference-multimodel: fix qwen unit -- llama.cpp requires --flash-attn , not bare flag --- .../templates/llama-server-qwen.service.j2 | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/ansible/roles/llm-inference-multimodel/templates/llama-server-qwen.service.j2 b/ansible/roles/llm-inference-multimodel/templates/llama-server-qwen.service.j2 index 8f23346..76a11ae 100644 --- a/ansible/roles/llm-inference-multimodel/templates/llama-server-qwen.service.j2 +++ b/ansible/roles/llm-inference-multimodel/templates/llama-server-qwen.service.j2 @@ -14,7 +14,7 @@ ExecStart={{ llm_binary_path }} \ --port {{ llm_qwen_port }} \ --n-gpu-layers {{ llm_qwen_gpu_layers }} \ --ctx-size {{ llm_qwen_ctx_size }} \ - --flash-attn \ + --flash-attn on \ --cache-type-k q8_0 --cache-type-v q8_0 \ --batch-size {{ llm_qwen_batch_size }} --ubatch-size {{ llm_qwen_ubatch_size }} \ --jinja \