Port 8000 (gemma-2-27b-it-GGUF) is dead after the day2 router cutover on 2026-08-12. Production inference now runs through llama-server-router on port 8002. The router exposes per-model Prometheus metrics via /metrics?model=<id>. Since a single /metrics request without ?model returns HTTP 400, replaced the single stale job with three per-model jobs — one per model registered in the router per /v1/models: - Qwen3.6-35B-A3B-UD-Q4_K_S (currently unloaded but registered) - Meta-Llama-3.1-8B-Instruct-Q4_K_M (loaded) - Phi-3.5-mini-instruct-Q8_0 (loaded) Static 'model' label carries the canonical llama.cpp model id (not alias). Added 'endpoint: astro-orbiter-router' to identify the scrape origin. Removed dead :8000 target entirely.
13 KiB
13 KiB