From b4bdb63e4a33917766c0297c41c65c54dffe6e2f Mon Sep 17 00:00:00 2001 From: Hermes Agent service account Date: Thu, 6 Aug 2026 10:40:13 -0500 Subject: [PATCH] llm-inference-multimodel: correct stale VRAM estimate for qwen-1m shadow slot --- ansible/roles/llm-inference-multimodel/defaults/main.yml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/ansible/roles/llm-inference-multimodel/defaults/main.yml b/ansible/roles/llm-inference-multimodel/defaults/main.yml index 0d1908a..8c1ba03 100644 --- a/ansible/roles/llm-inference-multimodel/defaults/main.yml +++ b/ansible/roles/llm-inference-multimodel/defaults/main.yml @@ -93,7 +93,7 @@ llm_qwen_batch_size: 2048 llm_qwen_ubatch_size: 512 llm_qwen_service_name: llama-server-qwen llm_qwen_model_id: qwen2.5-14b-instruct-1m -llm_qwen_expected_vram_gb: 16.5 +llm_qwen_expected_vram_gb: 11 # updated 2026-08-06 for -1M checkpoint per report math (~10-12GB); prior 16.5 was stale base-Qwen estimate # --- Existing Gemma baseline (rollback target — never modified by this role) - # Populated by Phase 0 discovery (tasks/discover.yml) if not already known.