Warm Ollama into VRAM on up and tunnel so Assistent chat is not cold.
A 1-token /api/chat after tags (and again if /api/ps is empty) loads VL weights before the first message. Mid KEEP_ALIVE is 15m so a short image-gen burst does not unload the model. Co-authored-by: Cursor <cursoragent@cursor.com>
This commit is contained in:
+3
-1
@@ -79,6 +79,8 @@ $env:OLLAMA_HOST = "http://127.0.0.1:17811"
|
||||
|
||||
На `up` — `ollama pull` по списку, сверка с **`/api/tags`**. Слой 100% без `status=success` не считается успехом (кэш ≠ модель в Assistent). Если тега всё ещё нет — warning, **GPU не гасим**. Лишнее на диске не удаляет.
|
||||
|
||||
После успешного тега — **warmup**: 1-token `POST /api/chat`, чтобы веса (~6 GB VL) легли в VRAM до первого сообщения в Assistent. То же при `gpu-rent tunnel`, если `/api/ps` пуст. Промах warmup — warning, GPU не гасим.
|
||||
|
||||
### Пресеты (меню)
|
||||
|
||||
| # | ключ | tag / смысл |
|
||||
@@ -103,7 +105,7 @@ Unit `gpu-rent-ollama` читает `/mnt/swarm_data/.gpu-rent-gpu.json`:
|
||||
| Tier (VRAM) | Flash Attn | KEEP_ALIVE | KV cache | GPU_OVERHEAD | CONTEXT |
|
||||
| --- | --- | --- | --- | --- | --- |
|
||||
| low (<16 GiB) | off | 2m | q4_0 | 6 GiB | 8k |
|
||||
| mid (16–23) | on* | 5m | q8_0 | 10 GiB | 16k |
|
||||
| mid (16–23) | on* | 15m | q8_0 | 10 GiB | 16k |
|
||||
| high (24–47) | on* | 15m | q8_0 | 14 GiB | 16k |
|
||||
| ultra (≥48) | on* | 30m | q8_0 | 20 GiB | 32k |
|
||||
|
||||
|
||||
Reference in New Issue
Block a user