- Added a new configuration option `UP_STOP_ON_FAIL` to control whether the GPU should be stopped automatically if the `up` command fails, enhancing user control over resource management. - Updated the CLI to include a `--keep-on-fail` flag, allowing users to prevent GPU shutdown during installation errors. - Enhanced the installation scripts and documentation to reflect these changes, providing clearer guidance on the new behavior and configuration options. - Improved error handling in the CLI to ensure proper cleanup of resources in case of failure, preventing unexpected billing for unused GPU resources.
90 lines
3.4 KiB
Plaintext
90 lines
3.4 KiB
Plaintext
# gpu-rent.vars — локальные параметры запуска (не секреты).
|
|
# Скопируй в gpu-rent.vars и правь. Файл в .gitignore.
|
|
# Читают: gpu-rent.ps1 / .bat / .sh и python -m gpu_rent (после .env).
|
|
# Секреты (OS_PASSWORD, CIVITAI_*, HF_TOKEN) — только в .env.
|
|
|
|
# Если запуск без аргументов (двойной клик / .\gpu-rent.ps1):
|
|
# GPU_RENT_DEFAULT_ARGS=up --yes
|
|
|
|
# Доп. флаги ко ВСЕМ вызовам (после твоих аргументов):
|
|
# GPU_RENT_EXTRA_ARGS=
|
|
|
|
# ---------------------------------------------------------------------------
|
|
# Базовые (несекретные дефолты; те же имена, что в env.example)
|
|
# ---------------------------------------------------------------------------
|
|
# UPDATE_GIT=true
|
|
# DEFAULT_SPOT=true
|
|
# SCAN_POOLS=ru-6,ru-7
|
|
# FLAVOR_PREFERENCE=4090-24,4090-48,a5000,a100-40
|
|
# SWARMUI_LOCAL_PORT=17801
|
|
# DATA_VOLUME_SIZE_GB=100
|
|
# ENABLE_SWARMUI=true
|
|
# IDLE_MINUTES=60
|
|
# IDLE_GRACE_MINUTES=90
|
|
# NOTIFY_READY=true
|
|
# UP_STOP_ON_FAIL=true # при падении up гасить GPU (default); false / --keep-on-fail
|
|
# Prefer auto /32 (leave unset). Spike/WARP only:
|
|
# GPU_RENT_SSH_CIDR=0.0.0.0/0
|
|
|
|
# ---------------------------------------------------------------------------
|
|
# LLM — кейсы тонкой настройки (раскомментируй один блок)
|
|
# Подробнее: docs/llm.md
|
|
# ---------------------------------------------------------------------------
|
|
|
|
# --- A) Default: SwarmUI + llama.cpp (auto: CUDA если nvcc на VM, иначе Vulkan) ---
|
|
# LLM_RUNTIME=llamacpp
|
|
# ENABLE_SWARMUI=true
|
|
# LLAMACPP_TAG=b10545
|
|
# LLAMACPP_BACKEND=auto
|
|
|
|
# --- B) Только LLM, без SwarmUI ---
|
|
# WORKLOAD=llm
|
|
# LLM_RUNTIME=llamacpp
|
|
# LLAMACPP_TAG=b10545
|
|
|
|
# --- C) Явно CUDA (и снести старый Vulkan-бинарь) ---
|
|
# LLM_RUNTIME=llamacpp
|
|
# LLAMACPP_TAG=b10545
|
|
# LLAMACPP_BACKEND=cuda
|
|
# LLAMACPP_FORCE_REINSTALL=1
|
|
|
|
# --- C2) Явно быстрый Vulkan, без compile ---
|
|
# LLM_RUNTIME=llamacpp
|
|
# LLAMACPP_BACKEND=vulkan
|
|
# LLAMACPP_BUILD_CUDA=0
|
|
|
|
# --- D) Свой бинарь / pin URL (supply-chain) ---
|
|
# LLM_RUNTIME=llamacpp
|
|
# LLAMACPP_ASSET_URL=https://github.com/ggml-org/llama.cpp/releases/download/b10545/llama-b10545-bin-ubuntu-vulkan-x64.tar.gz
|
|
# LLAMACPP_SHA256=<sha256 архива>
|
|
# LLAMACPP_FORCE_REINSTALL=1
|
|
|
|
# --- E) Делим 4090 со SwarmUI: меньше слоёв / короче контекст ---
|
|
# LLM_RUNTIME=llamacpp
|
|
# LLAMACPP_NGL=40
|
|
# LLAMACPP_CTX=4096
|
|
# LLAMACPP_EXTRA_ARGS=--flash-attn on
|
|
|
|
# --- F) Длинный контекст / почти весь VRAM под LLM (llm-only) ---
|
|
# WORKLOAD=llm
|
|
# LLM_RUNTIME=llamacpp
|
|
# LLAMACPP_NGL=99
|
|
# LLAMACPP_CTX=32768
|
|
# LLAMACPP_EXTRA_ARGS=--parallel 1
|
|
|
|
# --- G) Ollama вместо llama.cpp + pin версии ---
|
|
# LLM_RUNTIME=ollama
|
|
# OLLAMA_VERSION=0.6.5
|
|
# OLLAMA_SHA256=<sha256 of ollama-linux-amd64.tgz>
|
|
# OLLAMA_LOCAL_PORT=17811
|
|
|
|
# --- H) Выключить LLM (гасит unit’ы на следующем up) ---
|
|
# LLM_RUNTIME=none
|
|
|
|
# Порты туннеля (localhost):
|
|
# OLLAMA_LOCAL_PORT=17811
|
|
# LLAMACPP_LOCAL_PORT=17812
|
|
# Свой путь к манифесту GGUF/pull:
|
|
# LLAMACPP_MODELS_MANIFEST=
|
|
# OLLAMA_MODELS_MANIFEST=
|