Enhance LLM configuration and installation scripts for improved flexibility
- Added new environment variables in `env.example` and `gpu-rent.vars.example` for fine-tuning LLM settings, including CUDA build options and model version pinning. - Updated `llm.md` documentation to include detailed descriptions of new configuration options and usage cases for LLM setups. - Enhanced the `provision.py` script to forward new environment variables during remote installations, improving the installation process for LLM components. - Modified the `install_llamacpp.sh` script to support conditional CUDA builds and asset URL overrides, ensuring better compatibility with various environments. - Improved logging in the installation scripts to provide clearer feedback during the setup process.
This commit is contained in:
+62
-10
@@ -1,7 +1,7 @@
|
||||
# gpu-rent.vars — локальные параметры запуска (не секреты).
|
||||
# Скопируй в gpu-rent.vars и правь. Файл в .gitignore.
|
||||
# Читают: gpu-rent.ps1 / .bat / .sh и python -m gpu_rent (после .env).
|
||||
# Секреты (OS_PASSWORD, CIVITAI_*) — только в .env.
|
||||
# Секреты (OS_PASSWORD, CIVITAI_*, HF_TOKEN) — только в .env.
|
||||
|
||||
# Если запуск без аргументов (двойной клик / .\gpu-rent.ps1):
|
||||
# GPU_RENT_DEFAULT_ARGS=up --yes
|
||||
@@ -9,24 +9,76 @@
|
||||
# Доп. флаги ко ВСЕМ вызовам (после твоих аргументов):
|
||||
# GPU_RENT_EXTRA_ARGS=
|
||||
|
||||
# Те же имена, что в .env / env.example (несекретные дефолты):
|
||||
# ---------------------------------------------------------------------------
|
||||
# Базовые (несекретные дефолты; те же имена, что в env.example)
|
||||
# ---------------------------------------------------------------------------
|
||||
# UPDATE_GIT=true
|
||||
# DEFAULT_SPOT=true
|
||||
# SCAN_POOLS=ru-6,ru-7
|
||||
# FLAVOR_PREFERENCE=4090-24,4090-48,a5000,a100-40
|
||||
# SWARMUI_LOCAL_PORT=17801
|
||||
# DATA_VOLUME_SIZE_GB=100
|
||||
# DEFAULT_FLAVOR_ID=
|
||||
# DEFAULT_SPOT=true
|
||||
# ENABLE_SWARMUI=true
|
||||
# WORKLOAD=llm # то же что ENABLE_SWARMUI=false (только LLM)
|
||||
# LLM_RUNTIME=none
|
||||
# OLLAMA_LOCAL_PORT=17811
|
||||
# LLAMACPP_LOCAL_PORT=17812
|
||||
# IDLE_MINUTES=60
|
||||
# IDLE_GRACE_MINUTES=90
|
||||
# LOCAL_WATCHDOG_GRACE_MINUTES=10
|
||||
# NOTIFY_READY=true
|
||||
# PULL_OUTPUT=false
|
||||
# Prefer auto /32 (leave unset). Spike/WARP only:
|
||||
# GPU_RENT_SSH_CIDR=0.0.0.0/0
|
||||
|
||||
# ---------------------------------------------------------------------------
|
||||
# LLM — кейсы тонкой настройки (раскомментируй один блок)
|
||||
# Подробнее: docs/llm.md
|
||||
# ---------------------------------------------------------------------------
|
||||
|
||||
# --- A) Быстрый default: SwarmUI + llama.cpp, Ubuntu Vulkan prebuilt ---
|
||||
# LLM_RUNTIME=llamacpp
|
||||
# ENABLE_SWARMUI=true
|
||||
# LLAMACPP_TAG=b10545
|
||||
# (GGUF — llamacpp-models.yaml; бинарь без compile)
|
||||
|
||||
# --- B) Только LLM, без SwarmUI (дешевле по времени bootstrap / VRAM) ---
|
||||
# WORKLOAD=llm
|
||||
# LLM_RUNTIME=llamacpp
|
||||
# LLAMACPP_TAG=b10545
|
||||
|
||||
# --- C) Максимальная скорость инференса: CUDA-сборка (5–15 мин первый раз) ---
|
||||
# LLM_RUNTIME=llamacpp
|
||||
# LLAMACPP_TAG=b10545
|
||||
# LLAMACPP_BUILD_CUDA=1
|
||||
# LLAMACPP_FORCE_REINSTALL=1
|
||||
# (FORCE — снести старый Vulkan/битый бинарь и переустановить)
|
||||
|
||||
# --- D) Свой бинарь / pin URL (supply-chain) ---
|
||||
# LLM_RUNTIME=llamacpp
|
||||
# LLAMACPP_ASSET_URL=https://github.com/ggml-org/llama.cpp/releases/download/b10545/llama-b10545-bin-ubuntu-vulkan-x64.tar.gz
|
||||
# LLAMACPP_SHA256=<sha256 архива>
|
||||
# LLAMACPP_FORCE_REINSTALL=1
|
||||
|
||||
# --- E) Делим 4090 со SwarmUI: меньше слоёв / короче контекст ---
|
||||
# LLM_RUNTIME=llamacpp
|
||||
# LLAMACPP_NGL=40
|
||||
# LLAMACPP_CTX=4096
|
||||
# LLAMACPP_EXTRA_ARGS=--flash-attn on
|
||||
|
||||
# --- F) Длинный контекст / почти весь VRAM под LLM (llm-only) ---
|
||||
# WORKLOAD=llm
|
||||
# LLM_RUNTIME=llamacpp
|
||||
# LLAMACPP_NGL=99
|
||||
# LLAMACPP_CTX=32768
|
||||
# LLAMACPP_EXTRA_ARGS=--parallel 1
|
||||
|
||||
# --- G) Ollama вместо llama.cpp + pin версии ---
|
||||
# LLM_RUNTIME=ollama
|
||||
# OLLAMA_VERSION=0.6.5
|
||||
# OLLAMA_SHA256=<sha256 of ollama-linux-amd64.tgz>
|
||||
# OLLAMA_LOCAL_PORT=17811
|
||||
|
||||
# --- H) Выключить LLM (гасит unit’ы на следующем up) ---
|
||||
# LLM_RUNTIME=none
|
||||
|
||||
# Порты туннеля (localhost):
|
||||
# OLLAMA_LOCAL_PORT=17811
|
||||
# LLAMACPP_LOCAL_PORT=17812
|
||||
# Свой путь к манифесту GGUF/pull:
|
||||
# LLAMACPP_MODELS_MANIFEST=
|
||||
# OLLAMA_MODELS_MANIFEST=
|
||||
|
||||
Reference in New Issue
Block a user