--- # ------------------------------------------------------------------------------ # FILE: roles/llm-inference/defaults/main.yml # DESCRIPTION: Overridable defaults for the llm-inference role. # Deploy target: astro-orbiter (Dell OptiPlex 7050 SFF, RTX 3090 # via OCuLink, Ubuntu 24.04.4 LTS). # ------------------------------------------------------------------------------ # NVIDIA driver llm_nvidia_driver_package: nvidia-driver-595-open # Python venv llm_venv_path: /home/jarvis/vllm-env llm_venv_owner: jarvis # HuggingFace llm_hf_cache_dir: /home/jarvis/.cache/huggingface llm_hf_model: google/gemma-2-27b-it # vLLM serve llm_serve_port: 8000 llm_serve_host: "0.0.0.0" llm_gpu_memory_utilization: "0.90" llm_max_model_len: 8192