261f6be7db
Fix readiness probe to use /health endpoint (no auth needed)
Hermes Agent service account
2026-08-31 22:51:05 -05:00
8ea19dbf70
Fix ExternalSecret API format and deployment env vars
Hermes Agent service account
2026-08-31 22:47:34 -05:00
e6cb187f8e
Deploy Body Wars Observability WebUI (Open WebUI → astro-orbiter vLLM)
Hermes Agent service account
2026-08-31 22:46:06 -05:00
56f19af578
feat(hindsight): cut over LLM model to Gemma-4-26B-A4B-it-AWQ (t_gemma4_swap)
Hermes Agent service account
2026-08-31 21:54:04 -05:00
a3c92f70bf
feat(deploy-vllm): swap DeepSeek-R1-Distill-Qwen-32B for Gemma 4 26B A4B AWQ (t_gemma4_swap)
Hermes Agent service account
2026-08-31 21:28:48 -05:00
f907acde95
feat(hindsight): cut over LLM model to DeepSeek-R1-Distill-Qwen-32B-AWQ (t_r1d32b_swap)
Hermes Agent service account
2026-08-31 20:23:38 -05:00
53a55e7317
feat(deploy-vllm): swap Qwen2.5-32B for DeepSeek-R1-Distill-Qwen-32B-AWQ (t_r1d32b_swap)
Hermes Agent service account
2026-08-31 20:21:27 -05:00
2c0db1c7a1
docs: record t_5508360a resolution in deploy-vllm README
Hermes Agent service account
2026-08-31 19:10:53 -05:00
39c5fdca69
hindsight: cut over LLM endpoint to vLLM (t_5508360a)
Hermes Agent service account
2026-08-31 19:06:11 -05:00
6bfcc76845
vllm: cutover to permanent residency, retire llama-swap (t_5508360a)
Hermes Agent service account
2026-08-31 19:03:54 -05:00
1af645d272
REVERT: vLLM cannot be continuously resident alongside llama-swap (t_e6facb19)
Hermes Agent service account
2026-08-31 18:36:04 -05:00
f3a5687adf
hindsight: cap RETAIN_MAX_COMPLETION_TOKENS for vLLM's 8192 ctx
Hermes Agent service account
2026-08-31 18:29:22 -05:00
9d6869ad9d
hindsight: revert embeddings cutover after dimension-mismatch crash
Hermes Agent service account
2026-08-31 18:17:25 -05:00
2cc9370f3d
deploy-vllm: add embedding-mode support, cut over Hindsight to vLLM (t_e6facb19)
Hermes Agent service account
2026-08-31 18:15:22 -05:00
60220e18b6
feat(astro-orbiter): add deploy-vllm Ansible role (t_ca1af9fb)
Hermes Agent service account
2026-08-31 17:37:37 -05:00
b3b925ff77
hindsight: cap LLM concurrency to 1 + raise client/ingress timeout to 600s (fix 502s on serial astro-orbiter)
Hermes Agent service account
2026-08-29 16:56:52 -05:00
3d8eb1bf1c
hindsight: restore LLM to local astro-orbiter Qwen3.8-27B (Nous retain broken) (t_e0e6f7ca)
Hermes Agent service account
2026-08-29 12:44:01 -05:00
7b44a41da3
feat(llm): swap astro-orbiter primary model Qwen3.6 -> Qwen3.8-27B-Q4_K_M
Hermes Agent service account
2026-08-16 20:40:31 -05:00
efaff340a4
openviking: fix VLM model alias and lower max_input_tokens to 1024
Hermes Agent service account
2026-08-15 00:12:40 -05:00
48536f2615
fix(openviking): cap embedding max_input_tokens at 1536 to stay under llama.cpp nomic-bert 2048 ctx limit
Hermes Agent service account
2026-08-14 23:22:12 -05:00
170a31d090
feat(openviking): deploy maelstrom-ui Web Studio frontend
Hermes Agent service account
2026-08-14 12:49:00 -05:00
aa2730efd5
fix: OpenViking ingress TLS issuer from letsencrypt-internal to letsencrypt-prod
Peter Parker
2026-08-14 00:16:06 -05:00
d9e41118f8
feat(openviking): pilot deployment to fastpass (wave 8)
Hermes Agent service account
2026-08-13 23:33:36 -05:00
ad70b3439c
feat(llm): add nomic-embed-text-v1.5-Q4_K_M to astro-orbiter router
Hermes Agent service account
2026-08-13 23:18:08 -05:00
a04435ee9b
fix(monitoring): drop Qwen3.6 scrape job — causes CUDA OOM on each scrape (t_02c15dae)
Hermes Agent service account
2026-08-13 18:46:54 -05:00
a2ddb65425
fix(monitoring): reduce llama-server scrape_interval 15s -> 90s to allow GPU P8 idle
Hermes Agent service account
2026-08-13 15:43:43 -05:00
a87da82ebd
fix: correct astro-orbiter llama-server scrape target for router cutover
Hermes Agent service account
2026-08-13 09:08:01 -05:00
7aea88724f
Add Qwen2.5-Coder-14B-Instruct-4bit to astro-orbiter router (t_55c164f5)
Hermes Agent service account
2026-08-13 09:07:02 -05:00
d1f97ad5ac
Phase 2 revised: consolidate astro-orbiter to single Qwen2.5-14B-1M model (port 8002)
Hermes Agent service account
2026-08-06 11:42:34 -05:00
b4bdb63e4a
llm-inference-multimodel: correct stale VRAM estimate for qwen-1m shadow slot
Hermes Agent service account
2026-08-06 10:40:13 -05:00
b741f9b20b
llm-inference-multimodel: repoint qwen shadow slot to Qwen2.5-14B-Instruct-1M (base Qwen disqualified, n_ctx_train=32768)
Hermes Agent service account
2026-08-06 10:39:45 -05:00
a3c1342837
llm-inference-multimodel: reset qwen shadow unit to disabled by default -- model disqualified (n_ctx_train=32768, not 64K+), leaving enabled would crash-loop on next playbook run
Hermes Agent service account
2026-08-06 09:38:32 -05:00
d4ff2681ac
llm-inference-multimodel: fix qwen unit -- llama.cpp requires --flash-attn <on|off|auto>, not bare flag
Hermes Agent service account
2026-08-06 09:24:42 -05:00
75cb93f25c
llm-inference-multimodel: enable Qwen2.5-14B shadow instance (port 8002) for shadow-test window
Hermes Agent service account
2026-08-06 09:10:06 -05:00
d10255297c
llm-inference-multimodel: add Qwen2.5-14B shadow instance (port 8002, gated off — VRAM co-residency not yet confirmed)
Hermes Agent service account
2026-08-06 09:08:33 -05:00
79edb8f4e1
llm-inference-multimodel: log Run 2 validation PASS (tool-calling + hallucination), preserve procedure doc
Hermes Agent service account
2026-08-05 17:25:24 -05:00
5dc76a8348
llm-inference-multimodel: fix tool-calling support (jinja template + gpu-layers=20 for VRAM fit)
Hermes Agent service account
2026-08-05 17:13:32 -05:00
a76ad3195c
llm-inference-multimodel: fix verify.yml losing Gemma-stop gate when run with --tags verify
Hermes Agent service account
2026-08-05 16:34:13 -05:00
73ef806dd6
llm-inference-multimodel: stop pre-existing Gemma service before Phase 4 starts new instances
Hermes Agent service account
2026-08-05 16:28:34 -05:00
628dae06a8
llm-inference-multimodel: fix Phase 2 unexpectedly restarting both services
Hermes Agent service account
2026-08-05 16:21:50 -05:00
c3755aa29e
llm-inference-multimodel: role + day1 playbook (phase 0 discover approved)
master
Hermes Agent service account
2026-08-05 15:53:31 -05:00
782cbe33d1
llm-inference: size ctx-size/parallel for aux task offload
Hermes Agent service account
2026-08-05 12:14:11 -05:00
aff792a061
feat(llm-inference): move astro-orbiter monitoring to GitOps (values.yaml + dashboards.yaml)
Hermes Agent service account
2026-08-05 09:43:54 -05:00
aa8e229e64
fix(llm-inference): switch serve phase from vLLM+bitsandbytes to llama.cpp+GGUF
Hermes Agent service account
2026-08-03 12:37:03 -05:00
22a020e4c7
fix(llm-inference): bitsandbytes int4 OOM — pending switch to llama.cpp+GGUF
Hermes Agent service account
2026-08-03 12:35:46 -05:00
e879cf73d3
fix(llm-inference): gpu_exporter version 1.2.2 → 1.13.1 (correct release tag)
Hermes Agent service account
2026-08-03 11:57:42 -05:00