Refactor LLM configuration to remove llamacpp support
- Removed references to llamacpp from configuration files, scripts, and documentation, streamlining the LLM setup process to focus solely on Ollama. - Updated environment variables and paths to eliminate llamacpp-related entries, ensuring clarity in the configuration. - Adjusted CLI commands and help messages to reflect the removal of llamacpp, enhancing user experience and reducing confusion. - Revised documentation to provide clear guidance on using Ollama exclusively, including updates to setup instructions and runtime options.
This commit is contained in:
+10
-63
@@ -1,6 +1,6 @@
|
||||
# LLM рядом со SwarmUI (opt-in)
|
||||
|
||||
По умолчанию поднимается **только SwarmUI**. Ollama или llama.cpp — отдельно (помощь с промптами и т.п.).
|
||||
По умолчанию поднимается **только SwarmUI**. Ollama — отдельно (помощь с промптами и т.п.).
|
||||
|
||||
Интерактивные вопросы — **нумерованные меню** (Enter = вариант со ←). Ключ словом (`recommended`, `keep`) тоже принимается.
|
||||
|
||||
@@ -9,10 +9,10 @@
|
||||
| # | стек | смысл |
|
||||
| --- | --- | --- |
|
||||
| 1 | SwarmUI | только генерация картинок |
|
||||
| 2 | SwarmUI + LLM | UI + Ollama/llama.cpp на той же карте |
|
||||
| 3 | только LLM | **без** SwarmUI — Ollama или llama.cpp |
|
||||
| 2 | SwarmUI + LLM | UI + Ollama на той же карте |
|
||||
| 3 | только LLM | **без** SwarmUI — только Ollama |
|
||||
|
||||
Флаги: `up --yes --llm-only --llamacpp` / `--no-swarm --ollama`. Vars: `ENABLE_SWARMUI=false` или `WORKLOAD=llm`.
|
||||
Флаги: `up --yes --llm-only --ollama` / `--no-swarm --ollama`. Vars: `ENABLE_SWARMUI=false` или `WORKLOAD=llm`.
|
||||
|
||||
---
|
||||
|
||||
@@ -30,8 +30,8 @@ gpu-rent setup
|
||||
|
||||
```text
|
||||
gpu-rent up --yes --ollama
|
||||
gpu-rent up --yes --llm llamacpp
|
||||
gpu-rent up --yes --llm-only --llamacpp # без SwarmUI
|
||||
gpu-rent up --yes --llm ollama
|
||||
gpu-rent up --yes --llm-only --ollama # без SwarmUI
|
||||
```
|
||||
|
||||
С `--yes` пресеты не спрашивает (берёт существующий yaml / example).
|
||||
@@ -44,7 +44,7 @@ LLM_RUNTIME=ollama
|
||||
|
||||
Потом `gpu-rent up --yes`.
|
||||
|
||||
Выключить: `LLM_RUNTIME=none` (на `up` старые unit’ы `gpu-rent-ollama` / `gpu-rent-llamacpp` останавливаются).
|
||||
Выключить: `LLM_RUNTIME=none` (на `up` старые LLM unit’ы на VM останавливаются).
|
||||
|
||||
Голый `gpu-rent` без args — **help**. Двойной клик: `GPU_RENT_DEFAULT_ARGS=up --yes`. Полный doctor на up: `up -v`.
|
||||
|
||||
@@ -56,7 +56,6 @@ LLM_RUNTIME=ollama
|
||||
| --- | --- | --- |
|
||||
| SwarmUI | 7801 | **17801** |
|
||||
| Ollama | 11434 | **17811** |
|
||||
| llama.cpp | 8080 | **17812** |
|
||||
|
||||
```text
|
||||
gpu-rent tunnel
|
||||
@@ -111,61 +110,12 @@ Unit `gpu-rent-ollama` читает `/mnt/swarm_data/.gpu-rent-gpu.json`:
|
||||
|
||||
---
|
||||
|
||||
## llama.cpp
|
||||
|
||||
| Файл | Роль |
|
||||
| --- | --- |
|
||||
| `llamacpp-models.example.yaml` | шаблон |
|
||||
| `llamacpp-models.yaml` | HTTPS URL на `.gguf` (gitignore) |
|
||||
|
||||
На `up`: скачать GGUF → `/mnt/swarm_data/llamacpp/models` → `llama-server` + systemd. Уже скачанные крупные файлы не трогает.
|
||||
|
||||
**Бинарник:** в GitHub Releases **нет** Linux CUDA — только Windows CUDA + Ubuntu CPU/Vulkan. Драйвер/CUDA runtime на VM ≠ готовый `llama-server` с CUDA: его нужно **собрать** (`nvcc`) или взять Vulkan prebuilt.
|
||||
|
||||
Порядок по умолчанию (`LLAMACPP_BACKEND=auto`):
|
||||
|
||||
1. Если на VM уже есть `nvcc` (часто после прошлого `up`) → **CUDA-сборка** (тихо + heartbeat 5–15 мин).
|
||||
2. Иначе → Ubuntu **Vulkan** prebuilt (~30 MB).
|
||||
3. Fallback на другой путь при ошибке.
|
||||
|
||||
Был только Vulkan-stamp, а `nvcc` появился — следующий `up` сам пересоберёт CUDA.
|
||||
|
||||
| Var | Зачем |
|
||||
| --- | --- |
|
||||
| `LLAMACPP_BACKEND=auto\|cuda\|vulkan` | выбор пути (default auto) |
|
||||
| `LLAMACPP_TAG` | pin release (`b10545`) |
|
||||
| `LLAMACPP_ASSET_URL` + `LLAMACPP_SHA256` | свой архив |
|
||||
| `LLAMACPP_BUILD_CUDA=1` | форс CUDA; `=0` — никогда не собирать |
|
||||
| `LLAMACPP_FORCE_REINSTALL=1` | снести бинарь и поставить заново |
|
||||
| `LLAMACPP_NGL` / `LLAMACPP_CTX` | override GPU layers / context |
|
||||
| `LLAMACPP_HOST` / `LLAMACPP_PORT` | bind (default `127.0.0.1:8080`) |
|
||||
| `LLAMACPP_EXTRA_ARGS` | доп. флаги `llama-server` |
|
||||
| `OLLAMA_VERSION` / `OLLAMA_SHA256` | pin Ollama |
|
||||
|
||||
Готовые кейсы A–H — в `gpu-rent.vars.example`.
|
||||
|
||||
### Пресеты (меню)
|
||||
|
||||
| # | ключ | что |
|
||||
| --- | --- | --- |
|
||||
| 1 | **recommended** | Qwen2.5-VL 7B abliterate + mmproj (~4.7+0.8 GB, картинки+RU) |
|
||||
| 2 | light | Qwen2.5 3B Instruct text Q4_K_M |
|
||||
| 3 | text | Qwen2.5 7B abliterate text-only |
|
||||
| 4 | stock | официальный 7B Instruct Q4_K_M |
|
||||
| 5 | empty | только runtime |
|
||||
| — | keep | не трогать yaml |
|
||||
|
||||
`-ngl` / `-c` — по GPU probe. Для recommended abliterate GGUF нужен **`HF_TOKEN`** в `.env` (иначе 401). Вручную: положи GGUF в models и `systemctl restart gpu-rent-llamacpp`.
|
||||
|
||||
---
|
||||
|
||||
## Idle-killer и LLM
|
||||
|
||||
Busy (не гасить GPU):
|
||||
|
||||
- `ollama pull` (маркер младше ~45 мин; старше сбрасывается);
|
||||
- загруженная модель в Ollama;
|
||||
- llama.cpp: слоты заняты.
|
||||
- загруженная модель в Ollama.
|
||||
|
||||
Ошибка установки LLM на `up` — **fail** (не тихий лог).
|
||||
|
||||
@@ -178,9 +128,6 @@ Busy (не гасить GPU):
|
||||
```bash
|
||||
OLLAMA_VERSION=0.6.5
|
||||
OLLAMA_SHA256=<sha256 of ollama-linux-amd64.tgz>
|
||||
LLAMACPP_TAG=b10545
|
||||
# или LLAMACPP_ASSET_URL=... + LLAMACPP_SHA256=...
|
||||
# CUDA из исходников (медленно): LLAMACPP_BUILD_CUDA=1
|
||||
# Переустановка бинаря: LLAMACPP_FORCE_REINSTALL=1
|
||||
# VRAM: LLAMACPP_NGL=40 LLAMACPP_CTX=4096 LLAMACPP_EXTRA_ARGS=--flash-attn on
|
||||
```
|
||||
|
||||
Готовые кейсы — в `gpu-rent.vars.example`.
|
||||
|
||||
Reference in New Issue
Block a user