# gpu-rent.vars — локальные параметры запуска (не секреты). # Скопируй в gpu-rent.vars и правь. Файл в .gitignore. # Читают: gpu-rent.ps1 / .bat / .sh и python -m gpu_rent (после .env). # Секреты (OS_PASSWORD, CIVITAI_*, HF_TOKEN) — только в .env. # Если запуск без аргументов (двойной клик / .\gpu-rent.ps1): # GPU_RENT_DEFAULT_ARGS=up --yes # Доп. флаги ко ВСЕМ вызовам (после твоих аргументов): # GPU_RENT_EXTRA_ARGS= # --------------------------------------------------------------------------- # Базовые (несекретные дефолты; те же имена, что в env.example) # --------------------------------------------------------------------------- # UPDATE_GIT=true # DEFAULT_SPOT=true # SCAN_POOLS=ru-6,ru-7 # FLAVOR_PREFERENCE=4090-24,4090-48,a5000,a100-40 # SWARMUI_LOCAL_PORT=17801 # DATA_VOLUME_SIZE_GB=100 # ENABLE_SWARMUI=true # IDLE_MINUTES=60 # IDLE_GRACE_MINUTES=90 # NOTIFY_READY=true # Prefer auto /32 (leave unset). Spike/WARP only: # GPU_RENT_SSH_CIDR=0.0.0.0/0 # --------------------------------------------------------------------------- # LLM — кейсы тонкой настройки (раскомментируй один блок) # Подробнее: docs/llm.md # --------------------------------------------------------------------------- # --- A) Быстрый default: SwarmUI + llama.cpp, Ubuntu Vulkan prebuilt --- # LLM_RUNTIME=llamacpp # ENABLE_SWARMUI=true # LLAMACPP_TAG=b10545 # (GGUF — llamacpp-models.yaml; бинарь без compile) # --- B) Только LLM, без SwarmUI (дешевле по времени bootstrap / VRAM) --- # WORKLOAD=llm # LLM_RUNTIME=llamacpp # LLAMACPP_TAG=b10545 # --- C) Максимальная скорость инференса: CUDA-сборка (5–15 мин первый раз) --- # LLM_RUNTIME=llamacpp # LLAMACPP_TAG=b10545 # LLAMACPP_BUILD_CUDA=1 # LLAMACPP_FORCE_REINSTALL=1 # (FORCE — снести старый Vulkan/битый бинарь и переустановить) # --- D) Свой бинарь / pin URL (supply-chain) --- # LLM_RUNTIME=llamacpp # LLAMACPP_ASSET_URL=https://github.com/ggml-org/llama.cpp/releases/download/b10545/llama-b10545-bin-ubuntu-vulkan-x64.tar.gz # LLAMACPP_SHA256= # LLAMACPP_FORCE_REINSTALL=1 # --- E) Делим 4090 со SwarmUI: меньше слоёв / короче контекст --- # LLM_RUNTIME=llamacpp # LLAMACPP_NGL=40 # LLAMACPP_CTX=4096 # LLAMACPP_EXTRA_ARGS=--flash-attn on # --- F) Длинный контекст / почти весь VRAM под LLM (llm-only) --- # WORKLOAD=llm # LLM_RUNTIME=llamacpp # LLAMACPP_NGL=99 # LLAMACPP_CTX=32768 # LLAMACPP_EXTRA_ARGS=--parallel 1 # --- G) Ollama вместо llama.cpp + pin версии --- # LLM_RUNTIME=ollama # OLLAMA_VERSION=0.6.5 # OLLAMA_SHA256= # OLLAMA_LOCAL_PORT=17811 # --- H) Выключить LLM (гасит unit’ы на следующем up) --- # LLM_RUNTIME=none # Порты туннеля (localhost): # OLLAMA_LOCAL_PORT=17811 # LLAMACPP_LOCAL_PORT=17812 # Свой путь к манифесту GGUF/pull: # LLAMACPP_MODELS_MANIFEST= # OLLAMA_MODELS_MANIFEST=