- Phase 7 task file: monitoring.yml
- node_exporter (port 9100) via apt, systemd managed
- nvidia_gpu_exporter v1.2.2 (port 9835) — GPU util, VRAM, temp, power
- Patches kube-prometheus additionalScrapeConfigs secret with 3 new jobs:
node-astro-orbiter, gpu-astro-orbiter, vllm-astro-orbiter
- Deploys Grafana dashboard ConfigMap via kubectl apply
- Grafana dashboard (11 panels):
- Row 1: GPU util %, VRAM used, GPU temp gauge
- Row 2: GPU power draw, vLLM token throughput, request queue depth
- Row 3: vLLM e2e latency p50/p95/p99, KV cache utilization %
- Row 4: System CPU %, memory, root disk gauge
- defaults/main.yml: llm_gpu_exporter_version, llm_gpu_exporter_port
- handlers/main.yml: restart nvidia-gpu-exporter
29 lines
842 B
YAML
29 lines
842 B
YAML
---
|
|
# ------------------------------------------------------------------------------
|
|
# FILE: roles/llm-inference/defaults/main.yml
|
|
# DESCRIPTION: Overridable defaults for the llm-inference role.
|
|
# Deploy target: astro-orbiter (Dell OptiPlex 7050 SFF, RTX 3090
|
|
# via OCuLink, Ubuntu 24.04.4 LTS).
|
|
# ------------------------------------------------------------------------------
|
|
|
|
# NVIDIA driver
|
|
llm_nvidia_driver_package: nvidia-driver-595-open
|
|
|
|
# Python venv
|
|
llm_venv_path: /home/jarvis/vllm-env
|
|
llm_venv_owner: jarvis
|
|
|
|
# HuggingFace
|
|
llm_hf_cache_dir: /home/jarvis/.cache/huggingface
|
|
llm_hf_model: google/gemma-2-27b-it
|
|
|
|
# vLLM serve
|
|
llm_serve_port: 8000
|
|
llm_serve_host: "0.0.0.0"
|
|
llm_gpu_memory_utilization: "0.90"
|
|
llm_max_model_len: 8192
|
|
|
|
# Monitoring
|
|
llm_gpu_exporter_version: "1.2.2"
|
|
llm_gpu_exporter_port: 9835
|