From 75cb93f25c3e18971e561b1d8538a3845dfe6f00 Mon Sep 17 00:00:00 2001 From: Hermes Agent service account Date: Thu, 6 Aug 2026 09:10:06 -0500 Subject: [PATCH] llm-inference-multimodel: enable Qwen2.5-14B shadow instance (port 8002) for shadow-test window Mistral (llama-server-toolcall, 8001) stopped temporarily on astro-orbiter to free ~6.2GB VRAM headroom for this test window per Ryan/JARVIS approval. Not a permanent decommission of Mistral. --- ansible/roles/llm-inference-multimodel/defaults/main.yml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/ansible/roles/llm-inference-multimodel/defaults/main.yml b/ansible/roles/llm-inference-multimodel/defaults/main.yml index 377659c..74ef9e8 100644 --- a/ansible/roles/llm-inference-multimodel/defaults/main.yml +++ b/ansible/roles/llm-inference-multimodel/defaults/main.yml @@ -71,7 +71,7 @@ llm_toolcall_model_id: mistral-small-24b-instruct-2501 # (either free VRAM by stopping llama-server-toolcall for the shadow window, # or reduce ctx-size). llm_qwen_service_enabled defaults to false so a normal # playbook run will template the unit but NOT start it. -llm_qwen_service_enabled: false +llm_qwen_service_enabled: true llm_qwen_port: 8002 llm_qwen_model_path: "{{ llm_models_dir }}/Qwen2.5-14B-Instruct-Q5_K_M.gguf" llm_qwen_model_url: "https://huggingface.co/bartowski/Qwen2.5-14B-Instruct-GGUF/resolve/main/Qwen2.5-14B-Instruct-Q5_K_M.gguf"