llm-inference-multimodel: repoint qwen shadow slot to Qwen2.5-14B-Instruct-1M (base Qwen disqualified, n_ctx_train=32768)

This commit is contained in:
Hermes Agent service account
2026-08-06 10:39:45 -05:00
parent a3c1342837
commit b741f9b20b
2 changed files with 23 additions and 13 deletions

View File

@@ -1,5 +1,5 @@
[Unit]
Description=llama-server (shadow) — Qwen2.5-14B-Instruct Q5_K_M (OpenAI-compatible inference, 64K ctx)
Description=llama-server (shadow) — Qwen2.5-14B-Instruct-1M Q5_K_M (OpenAI-compatible inference, 64K ctx)
After=network.target nvidia-persistenced.service
Wants=nvidia-persistenced.service