Refactor LLM configuration to remove llamacpp support
- Removed references to llamacpp from configuration files, scripts, and documentation, streamlining the LLM setup process to focus solely on Ollama. - Updated environment variables and paths to eliminate llamacpp-related entries, ensuring clarity in the configuration. - Adjusted CLI commands and help messages to reflect the removal of llamacpp, enhancing user experience and reducing confusion. - Revised documentation to provide clear guidance on using Ollama exclusively, including updates to setup instructions and runtime options.
This commit is contained in:
+1
-1
@@ -20,7 +20,7 @@ CLI поднимает прерываемый GPU в Selectel, держит Swar
|
||||
| Git-расширения SwarmUI/Comfy | [extensions.md](extensions.md) |
|
||||
| Word-list промптов | [autocomplete.md](autocomplete.md) |
|
||||
| Push/pull папок | [local-folders.md](local-folders.md) |
|
||||
| Ollama / llama.cpp | [llm.md](llm.md) |
|
||||
| Ollama | [llm.md](llm.md) |
|
||||
| Capture ссылок с VM | [cli.md](cli.md) (`capture`) + [models.md](models.md) |
|
||||
| Как устроены диски и killer | [architecture.md](architecture.md) |
|
||||
| Контракт Selectel | [selectel.md](selectel.md) |
|
||||
|
||||
@@ -19,7 +19,7 @@
|
||||
│ SwarmUI : 127.0.0.1:7801 │
|
||||
│ idle-killer: очередь / hold / LLM busy → delete this server │
|
||||
│ app cred: DELETE/GET только этот server_id (fail closed) │
|
||||
│ optional: Ollama :11434 / llama.cpp :8080 (туннель 17811/12)│
|
||||
│ optional: Ollama :11434 (туннель 17811) │
|
||||
│ │
|
||||
│ boot volume (network) ОС + NVIDIA + SwarmUI нативно + snapshot │
|
||||
│ data volume (network) Models, Output, Data, workflows │
|
||||
@@ -49,7 +49,7 @@
|
||||
| `notify` | Toast/звук при backend Idle |
|
||||
| `tunnel` | sshtunnel + Nova EXPIRED watchdog |
|
||||
| `local_watchdog` | Опциональный локальный тик → stop при unclean exit |
|
||||
| `llm_runtime` / `setup_wizard` | Opt-in Ollama/llama.cpp + `ollama-models.yaml` / `llamacpp-models.yaml` |
|
||||
| `llm_runtime` / `setup_wizard` | Opt-in Ollama + `ollama-models.yaml` |
|
||||
| `idle_killer` / `hold` | systemd на VM + hold-файл |
|
||||
| `ready` / `snapshot` | Idle backend + boot snapshot |
|
||||
| `access_card` | URL / MCP panel после ready |
|
||||
|
||||
+6
-7
@@ -51,7 +51,7 @@ gpu-rent up --yes --ollama
|
||||
|
||||
| Команда | Поведение |
|
||||
| --- | --- |
|
||||
| `gpu-rent setup` | Wizard: манифесты (в т.ч. ollama/llamacpp-models), `LLM_RUNTIME` (нумерованное меню), пресет, опционально local-watchdog |
|
||||
| `gpu-rent setup` | Wizard: манифесты (в т.ч. ollama-models), `LLM_RUNTIME` (нумерованное меню), пресет, опционально local-watchdog |
|
||||
| `gpu-rent doctor` | Preflight **без** create. Exit ≠ 0 → сессию начинать нельзя |
|
||||
| `gpu-rent flavors` | Скан `SCAN_POOLS` × `FLAVOR_PREFERENCE`, список в текущем регионе |
|
||||
| `gpu-rent dry-run` | План без mutating-вызовов |
|
||||
@@ -59,8 +59,8 @@ gpu-rent up --yes --ollama
|
||||
| `gpu-rent up --yes` | Без вопросов; flavor из `FLAVOR_PREFERENCE` / `DEFAULT_FLAVOR_ID` |
|
||||
| `up --keep-on-fail` | Не гасить GPU при ошибке install (по умолчанию `UP_STOP_ON_FAIL=true` → `stop`) |
|
||||
| `gpu-rent up -v` / `--verbose` | Полная таблица doctor на `up` (по умолчанию кратко) |
|
||||
| `gpu-rent up --ollama` / `--llamacpp` / `--llm …` | LLM рядом со SwarmUI |
|
||||
| `gpu-rent up --no-swarm` / `--llm-only` | Только LLM (нужен `--ollama`/`--llamacpp`); без clone SwarmUI |
|
||||
| `gpu-rent up --ollama` / `--llm ollama` | Ollama рядом со SwarmUI |
|
||||
| `gpu-rent up --no-swarm` / `--llm-only` | Только Ollama (нужен `--ollama` / `LLM_RUNTIME=ollama`); без clone SwarmUI |
|
||||
| `gpu-rent up --no-update` | Без `git pull` SwarmUI/extensions (только недостающие clone) |
|
||||
| `gpu-rent up --no-tunnel` | Только облако |
|
||||
| `gpu-rent up --no-spot` | Не preemptible |
|
||||
@@ -138,7 +138,7 @@ Exit 0 → можно `up`. Exit 1 → причина в таблице / кра
|
||||
| --- | --- |
|
||||
| `.env` | Секреты и OpenStack (`OS_*`, токены). Не в git |
|
||||
| `gpu-rent.vars` | Несекретные дефолты; читают лаунчеры и CLI. Пример: `gpu-rent.vars.example` |
|
||||
| `models.yaml` / `extensions.yaml` / `ollama-models.yaml` / `llamacpp-models.yaml` | Манифесты (gitignore; из `*.example.yaml`) |
|
||||
| `models.yaml` / `extensions.yaml` / `ollama-models.yaml` | Манифесты (gitignore; из `*.example.yaml`) |
|
||||
|
||||
### Лаунчер (`gpu-rent.vars`)
|
||||
|
||||
@@ -192,7 +192,6 @@ AUTOCOMPLETE_ENABLED=true
|
||||
SWARMUI_LOCAL_PORT=17801
|
||||
LLM_RUNTIME=none
|
||||
OLLAMA_LOCAL_PORT=17811
|
||||
LLAMACPP_LOCAL_PORT=17812
|
||||
UPDATE_GIT=true
|
||||
|
||||
DEFAULT_FLAVOR_ID=
|
||||
@@ -233,12 +232,12 @@ Application credential для idle-killer CLI создаёт на `up` (узко
|
||||
1. Nova `ACTIVE`
|
||||
2. TCP 22 / SSH
|
||||
3. Backend Idle (если SwarmUI) → toast (если `NOTIFY_READY`)
|
||||
4. На VM: HTTP сервисов стека (SwarmUI `:7801` / Ollama `:11434` / llama.cpp `:8080`) — `verify_stack_on_vm`
|
||||
4. На VM: HTTP сервисов стека (SwarmUI `:7801` / Ollama `:11434`) — `verify_stack_on_vm`
|
||||
5. На VM: **nvidia-smi / CUDA** (fail-fast) + **torch+cuda** в Comfy venv при SwarmUI (ждём) — `verify_gpu_env`
|
||||
6. В логе: строка **`тайминг up:`** (SSH / bootstrap / Idle / verify / …)
|
||||
7. Туннель + проверка **localhost** тех же сервисов → access-card (красная рамка, если killer failed)
|
||||
|
||||
`gpu-rent logs --unit swarm|ollama|llamacpp|killer` — фильтр journalctl.
|
||||
`gpu-rent logs --unit swarm|ollama|killer` — фильтр journalctl.
|
||||
`gpu-rent status` — killer/hold, последний стек/GPU-env, тайминг up.
|
||||
|
||||
Локальный порт UI: **17801** (на VM по-прежнему 7801 на loopback).
|
||||
|
||||
+1
-1
@@ -24,7 +24,7 @@ GPU в облаке дорогой. Веса для генерации карт
|
||||
- Первый clone git-реп расширений SwarmUI и ComfyUI nodes из `extensions.yaml`.
|
||||
- Autocomplete: word-list в `Data/Autocompletions` до старта UI, на каждом `up` проверка новой версии.
|
||||
- `doctor` до create; фоллбек flavor; интерактивный выбор flavor/диска; `hold`; toast Idle; `open` на 17801.
|
||||
- Opt-in LLM (Ollama / llama.cpp) через `setup` / флаги / `LLM_RUNTIME`; `capture` ссылок с VM.
|
||||
- Opt-in LLM (Ollama) через `setup` / флаги / `LLM_RUNTIME`; `capture` ссылок с VM.
|
||||
- `status`: диск, окно preempt 24 ч, killer / LLM.
|
||||
- Snapshot boot после первого удачного bootstrap.
|
||||
|
||||
|
||||
+2
-2
@@ -10,7 +10,7 @@
|
||||
| Civitai хост | Дефолт API `civitai.red` (полный каталог). `.com` — SFW-витрина, NSFW с неё часто 404. Ссылки `.com`/`.red`/`.green` в манифесте принимаем. 404 → один retry на второй хост. Один токен на оба домена |
|
||||
| Пул GPU | Перед `up`/`flavors` сканируем `SCAN_POOLS` (дефолт `ru-6,ru-7`). `ru-6` — мультизональный: ходим на `https://ru-6.cloud.api.selcloud.ru/compute/` тем же токеном (SDK-каталог часто знает только RC-пул). Собираем типы GPU из extra_specs и совпадения с `FLAVOR_PREFERENCE`. Автоматом `.env` не пишем — печатаем рекомендацию `OS_REGION_NAME` / `GPU_RENT_AZ` |
|
||||
| Манифест моделей | `<repo>/models.yaml`, типы: checkpoint / lora / vae / embedding / controlnet / upscaler. В git только `models.example.yaml` |
|
||||
| Расширения | `<repo>/extensions.yaml`: git-репы `swarmui` → `src/Extensions`, `comfy` → DLNodes. Поле `requires: none\|ollama\|llamacpp\|any-llm` фильтрует по `LLM_RUNTIME`. Пример: swarm-assistent с `requires: ollama` |
|
||||
| Расширения | `<repo>/extensions.yaml`: git-репы `swarmui` → `src/Extensions`, `comfy` → DLNodes. Поле `requires: none\|ollama\|any-llm` фильтрует по `LLM_RUNTIME`. Пример: swarm-assistent с `requires: ollama` |
|
||||
| Autocomplete | До первого старта: скачать word-list в `Data/Autocompletions`, прописать `DefaultUser.AutoComplete.Source`. На каждом `up` сверить GitHub blob sha и обновить файл, если изменился. Дефолт: `tags/danbooru.csv` из a1111-sd-webui-tagcomplete (как в доке SwarmUI) |
|
||||
| Доступ | Браузер на туннеле; MCP переключается на облако, пока оно живо; HTTP API SwarmUI через тот же туннель |
|
||||
| Preemptible | По умолчанию всегда. Обычный сервер — только `--no-spot` |
|
||||
@@ -22,7 +22,7 @@
|
||||
| `up` / `tunnel` | `up` по умолчанию после ready открывает туннель `:17801`, печатает URL и ждёт. `--no-tunnel` — только облако. Ctrl+C на туннеле GPU не гасит (`stop` отдельно). Команда `tunnel` остаётся для повторного входа |
|
||||
| Interactive `up` | Без `--yes`: нумерованные меню (LLM, пресет, flavor #, data GB, preemptible) → confirm. Изменения можно сохранить в `gpu-rent.vars` |
|
||||
| Git update | На каждом `up` по умолчанию: `git pull` SwarmUI + репы из `extensions.yaml` + уже установленные на data (`Extensions`/`DLNodes`). `--no-update` или `UPDATE_GIT=false` — не тянуть |
|
||||
| LLM (opt-in) | `none` по умолчанию. Флаги / `LLM_RUNTIME` / меню. Манифесты: `ollama-models.yaml`, `llamacpp-models.yaml`. Порты 17811 / 17812. Prompt-help, не замена SwarmUI |
|
||||
| LLM (opt-in) | `none` по умолчанию. Флаги / `LLM_RUNTIME` / меню. Манифест: `ollama-models.yaml`. Порт 17811. Prompt-help, не замена SwarmUI |
|
||||
| llm-only | `ENABLE_SWARMUI=false` / `WORKLOAD=llm` / `--no-swarm`/`--llm-only`: GPU + LLM без SwarmUI (bootstrap только data disk) |
|
||||
| Capture | `gpu-rent capture` — инвентарь VM → merge **ссылок** в локальные yaml (веса не качать) |
|
||||
| Perf auto-tune | На `up`: probe GPU → tier. Swarm/Comfy: sageattention ExtraArgs на Ampere+ ≥16 GiB. Ollama: flash/KV/keep-alive + `GPU_OVERHEAD` чтобы оставить VRAM под Krea |
|
||||
|
||||
+2
-3
@@ -38,7 +38,7 @@ swarmui:
|
||||
- url: https://gitea.hsrv.site/mrleo1nid/swarm-assistent.git
|
||||
ref: main
|
||||
dir: swarm-assistent
|
||||
requires: ollama # none | ollama | llamacpp | any-llm; default none = always
|
||||
requires: ollama # none | ollama | any-llm; default none = always
|
||||
- url: https://github.com/example/SwarmUI-SomeExt.git
|
||||
ref: main
|
||||
dir: SomeExt
|
||||
@@ -51,8 +51,7 @@ comfy:
|
||||
| --- | --- |
|
||||
| `none` (или поле отсутствует) | всегда |
|
||||
| `ollama` | только при `LLM_RUNTIME=ollama` |
|
||||
| `llamacpp` | только при `LLM_RUNTIME=llamacpp` |
|
||||
| `any-llm` | при `ollama` или `llamacpp` |
|
||||
| `any-llm` | при `LLM_RUNTIME=ollama` |
|
||||
|
||||
Строки с несовпавшим `requires` пропускаются (лог), остальные ставятся как обычно. В `extensions.example.yaml` по умолчанию — **swarm-assistent** с `requires: ollama` (чат/vision под Krea 2).
|
||||
|
||||
|
||||
+10
-63
@@ -1,6 +1,6 @@
|
||||
# LLM рядом со SwarmUI (opt-in)
|
||||
|
||||
По умолчанию поднимается **только SwarmUI**. Ollama или llama.cpp — отдельно (помощь с промптами и т.п.).
|
||||
По умолчанию поднимается **только SwarmUI**. Ollama — отдельно (помощь с промптами и т.п.).
|
||||
|
||||
Интерактивные вопросы — **нумерованные меню** (Enter = вариант со ←). Ключ словом (`recommended`, `keep`) тоже принимается.
|
||||
|
||||
@@ -9,10 +9,10 @@
|
||||
| # | стек | смысл |
|
||||
| --- | --- | --- |
|
||||
| 1 | SwarmUI | только генерация картинок |
|
||||
| 2 | SwarmUI + LLM | UI + Ollama/llama.cpp на той же карте |
|
||||
| 3 | только LLM | **без** SwarmUI — Ollama или llama.cpp |
|
||||
| 2 | SwarmUI + LLM | UI + Ollama на той же карте |
|
||||
| 3 | только LLM | **без** SwarmUI — только Ollama |
|
||||
|
||||
Флаги: `up --yes --llm-only --llamacpp` / `--no-swarm --ollama`. Vars: `ENABLE_SWARMUI=false` или `WORKLOAD=llm`.
|
||||
Флаги: `up --yes --llm-only --ollama` / `--no-swarm --ollama`. Vars: `ENABLE_SWARMUI=false` или `WORKLOAD=llm`.
|
||||
|
||||
---
|
||||
|
||||
@@ -30,8 +30,8 @@ gpu-rent setup
|
||||
|
||||
```text
|
||||
gpu-rent up --yes --ollama
|
||||
gpu-rent up --yes --llm llamacpp
|
||||
gpu-rent up --yes --llm-only --llamacpp # без SwarmUI
|
||||
gpu-rent up --yes --llm ollama
|
||||
gpu-rent up --yes --llm-only --ollama # без SwarmUI
|
||||
```
|
||||
|
||||
С `--yes` пресеты не спрашивает (берёт существующий yaml / example).
|
||||
@@ -44,7 +44,7 @@ LLM_RUNTIME=ollama
|
||||
|
||||
Потом `gpu-rent up --yes`.
|
||||
|
||||
Выключить: `LLM_RUNTIME=none` (на `up` старые unit’ы `gpu-rent-ollama` / `gpu-rent-llamacpp` останавливаются).
|
||||
Выключить: `LLM_RUNTIME=none` (на `up` старые LLM unit’ы на VM останавливаются).
|
||||
|
||||
Голый `gpu-rent` без args — **help**. Двойной клик: `GPU_RENT_DEFAULT_ARGS=up --yes`. Полный doctor на up: `up -v`.
|
||||
|
||||
@@ -56,7 +56,6 @@ LLM_RUNTIME=ollama
|
||||
| --- | --- | --- |
|
||||
| SwarmUI | 7801 | **17801** |
|
||||
| Ollama | 11434 | **17811** |
|
||||
| llama.cpp | 8080 | **17812** |
|
||||
|
||||
```text
|
||||
gpu-rent tunnel
|
||||
@@ -111,61 +110,12 @@ Unit `gpu-rent-ollama` читает `/mnt/swarm_data/.gpu-rent-gpu.json`:
|
||||
|
||||
---
|
||||
|
||||
## llama.cpp
|
||||
|
||||
| Файл | Роль |
|
||||
| --- | --- |
|
||||
| `llamacpp-models.example.yaml` | шаблон |
|
||||
| `llamacpp-models.yaml` | HTTPS URL на `.gguf` (gitignore) |
|
||||
|
||||
На `up`: скачать GGUF → `/mnt/swarm_data/llamacpp/models` → `llama-server` + systemd. Уже скачанные крупные файлы не трогает.
|
||||
|
||||
**Бинарник:** в GitHub Releases **нет** Linux CUDA — только Windows CUDA + Ubuntu CPU/Vulkan. Драйвер/CUDA runtime на VM ≠ готовый `llama-server` с CUDA: его нужно **собрать** (`nvcc`) или взять Vulkan prebuilt.
|
||||
|
||||
Порядок по умолчанию (`LLAMACPP_BACKEND=auto`):
|
||||
|
||||
1. Если на VM уже есть `nvcc` (часто после прошлого `up`) → **CUDA-сборка** (тихо + heartbeat 5–15 мин).
|
||||
2. Иначе → Ubuntu **Vulkan** prebuilt (~30 MB).
|
||||
3. Fallback на другой путь при ошибке.
|
||||
|
||||
Был только Vulkan-stamp, а `nvcc` появился — следующий `up` сам пересоберёт CUDA.
|
||||
|
||||
| Var | Зачем |
|
||||
| --- | --- |
|
||||
| `LLAMACPP_BACKEND=auto\|cuda\|vulkan` | выбор пути (default auto) |
|
||||
| `LLAMACPP_TAG` | pin release (`b10545`) |
|
||||
| `LLAMACPP_ASSET_URL` + `LLAMACPP_SHA256` | свой архив |
|
||||
| `LLAMACPP_BUILD_CUDA=1` | форс CUDA; `=0` — никогда не собирать |
|
||||
| `LLAMACPP_FORCE_REINSTALL=1` | снести бинарь и поставить заново |
|
||||
| `LLAMACPP_NGL` / `LLAMACPP_CTX` | override GPU layers / context |
|
||||
| `LLAMACPP_HOST` / `LLAMACPP_PORT` | bind (default `127.0.0.1:8080`) |
|
||||
| `LLAMACPP_EXTRA_ARGS` | доп. флаги `llama-server` |
|
||||
| `OLLAMA_VERSION` / `OLLAMA_SHA256` | pin Ollama |
|
||||
|
||||
Готовые кейсы A–H — в `gpu-rent.vars.example`.
|
||||
|
||||
### Пресеты (меню)
|
||||
|
||||
| # | ключ | что |
|
||||
| --- | --- | --- |
|
||||
| 1 | **recommended** | Qwen2.5-VL 7B abliterate + mmproj (~4.7+0.8 GB, картинки+RU) |
|
||||
| 2 | light | Qwen2.5 3B Instruct text Q4_K_M |
|
||||
| 3 | text | Qwen2.5 7B abliterate text-only |
|
||||
| 4 | stock | официальный 7B Instruct Q4_K_M |
|
||||
| 5 | empty | только runtime |
|
||||
| — | keep | не трогать yaml |
|
||||
|
||||
`-ngl` / `-c` — по GPU probe. Для recommended abliterate GGUF нужен **`HF_TOKEN`** в `.env` (иначе 401). Вручную: положи GGUF в models и `systemctl restart gpu-rent-llamacpp`.
|
||||
|
||||
---
|
||||
|
||||
## Idle-killer и LLM
|
||||
|
||||
Busy (не гасить GPU):
|
||||
|
||||
- `ollama pull` (маркер младше ~45 мин; старше сбрасывается);
|
||||
- загруженная модель в Ollama;
|
||||
- llama.cpp: слоты заняты.
|
||||
- загруженная модель в Ollama.
|
||||
|
||||
Ошибка установки LLM на `up` — **fail** (не тихий лог).
|
||||
|
||||
@@ -178,9 +128,6 @@ Busy (не гасить GPU):
|
||||
```bash
|
||||
OLLAMA_VERSION=0.6.5
|
||||
OLLAMA_SHA256=<sha256 of ollama-linux-amd64.tgz>
|
||||
LLAMACPP_TAG=b10545
|
||||
# или LLAMACPP_ASSET_URL=... + LLAMACPP_SHA256=...
|
||||
# CUDA из исходников (медленно): LLAMACPP_BUILD_CUDA=1
|
||||
# Переустановка бинаря: LLAMACPP_FORCE_REINSTALL=1
|
||||
# VRAM: LLAMACPP_NGL=40 LLAMACPP_CTX=4096 LLAMACPP_EXTRA_ARGS=--flash-attn on
|
||||
```
|
||||
|
||||
Готовые кейсы — в `gpu-rent.vars.example`.
|
||||
|
||||
+1
-1
@@ -196,7 +196,7 @@ LOCAL_MODELS_DIR= # пусто = <корень приложения>/Models
|
||||
|
||||
## Hugging Face (резерв)
|
||||
|
||||
- **Скачивание:** `HF_TOKEN` в `.env` → GGUF (llama.cpp) и строки `models.yaml` с `huggingface.co/…/resolve/…`.
|
||||
- **Скачивание:** `HF_TOKEN` в `.env` → строки `models.yaml` с `huggingface.co/…/resolve/…`.
|
||||
- **Capture:** если Civitai by-hash не нашёл файл → поиск на Hub по имени + LFS sha256 → URL в манифест.
|
||||
- **SwarmUI:** тот же токен прокидывается как `huggingface_api` (Model Downloader).
|
||||
- Abliterated / gated репозитории без токена почти всегда дают **401**.
|
||||
|
||||
+2
-2
@@ -49,7 +49,7 @@ chmod +x gpu-rent.sh
|
||||
- `env.example` → `.env`
|
||||
- `models.example.yaml` → `models.yaml`
|
||||
- `extensions.example.yaml` → `extensions.yaml`
|
||||
- `ollama-models.example.yaml` / `llamacpp-models.example.yaml` → соответствующие yaml (лаунчер / setup)
|
||||
- `ollama-models.example.yaml` → `ollama-models.yaml` (лаунчер / setup)
|
||||
- `gpu-rent.vars.example` → `gpu-rent.vars`
|
||||
|
||||
Секреты только в `<repo>/.env` и runtime в `<repo>/.gpu-rent/` (оба в `.gitignore`).
|
||||
@@ -243,7 +243,7 @@ copy models.example.yaml models.yaml
|
||||
| --- | --- |
|
||||
| `--no-tunnel` | только облако; UI потом: `tunnel --open` |
|
||||
| `--no-update` | не `git pull` SwarmUI/extensions |
|
||||
| `--ollama` / `--llamacpp` | LLM рядом ([llm.md](llm.md)) |
|
||||
| `--ollama` / `--llm ollama` | LLM рядом ([llm.md](llm.md)) |
|
||||
| `--no-swarm` / `--llm-only` | только LLM, без SwarmUI (нужен runtime) |
|
||||
| `--no-spot` | обычный (не preemptible) тариф |
|
||||
| `--flavor ID` | явный flavor (пропускает меню flavor) |
|
||||
|
||||
+1
-1
@@ -108,7 +108,7 @@
|
||||
|
||||
| Шаг | OK? |
|
||||
| --- | --- |
|
||||
| Ollama :17811 или llama.cpp :17812 через туннель | |
|
||||
| Ollama :17811 через туннель | |
|
||||
| pull / GGUF из манифеста | |
|
||||
| `LLM_RUNTIME=none` гасит unit на следующем up | |
|
||||
|
||||
|
||||
+1
-1
@@ -20,7 +20,7 @@
|
||||
6. Если есть Civitai-токен и манифест моделей: seed весов **до** первого старта SwarmUI; иначе — дефолтная модель установщика.
|
||||
7. Push непустых `Models/` / `Wildcards/` / `CustomWorkflows/`.
|
||||
8. systemd unit `swarmui`: `./launch-linux.sh --launch_mode none --host 127.0.0.1 --port 7801`.
|
||||
9. **GPU probe** → `/mnt/swarm_data/.gpu-rent-gpu.json` (VRAM / compute cap / tier) — до старта UI; Ollama/llama.cpp читают его при install.
|
||||
9. **GPU probe** → `/mnt/swarm_data/.gpu-rent-gpu.json` (VRAM / compute cap / tier) — до старта UI; Ollama читает его при install.
|
||||
10. Старт SwarmUI → seed LLM → idle-killer → **wait backend Idle**.
|
||||
11. **Perf tune после Idle** — `triton`+`sageattention` в Comfy venv и `--use-sage-attention` в `Data/Backends.fds` (маркер `.gpu-rent-perf-tuned`; повтор при смене GPU).
|
||||
12. Авторизация SwarmUI включена, токен в `Data` на диске.
|
||||
|
||||
Reference in New Issue
Block a user