Update LLM support for llama.cpp and enhance configuration management
- Added support for `llamacpp-models.yaml` in `.gitignore` and implemented logic to copy it in `gpu-rent.ps1` and `gpu-rent.sh`. - Enhanced CLI to prompt for llama.cpp model presets during setup and execution, improving user experience. - Updated configuration handling to include `llamacpp_models_manifest` and related functions for managing llama.cpp models. - Improved documentation in `cli.md` and `llm.md` to reflect changes in llama.cpp integration and model management. - Refactored provisioning logic to handle llama.cpp model downloads and configurations effectively.
This commit is contained in:
+18
-7
@@ -12,7 +12,7 @@
|
||||
gpu-rent setup
|
||||
```
|
||||
|
||||
Выбери `ollama` или `llamacpp`, при Ollama — пресет моделей. Значение пишется в `gpu-rent.vars` (`LLM_RUNTIME=…`).
|
||||
Выбери `ollama` или `llamacpp`. Для **обоих** спросит пресет моделей. Значение пишется в `gpu-rent.vars` (`LLM_RUNTIME=…`).
|
||||
|
||||
### Вариант B — флаг на `up`
|
||||
|
||||
@@ -103,14 +103,25 @@ Community abliterate-модели без гарантий безопасност
|
||||
|
||||
## llama.cpp
|
||||
|
||||
1. `LLM_RUNTIME=llamacpp` или `up --llamacpp`
|
||||
2. CLI ставит `llama-server` + systemd `gpu-rent-llamacpp`
|
||||
3. Положи GGUF в `/mnt/swarm_data/llamacpp/models` (SFTP / `gpu-rent ssh`)
|
||||
4. `systemctl restart gpu-rent-llamacpp` на VM
|
||||
Манифест GGUF:
|
||||
|
||||
Без GGUF unit может стартовать, но API бесполезен — смотри `gpu-rent logs` / `journalctl -u gpu-rent-llamacpp`.
|
||||
| Файл | Роль |
|
||||
| --- | --- |
|
||||
| `llamacpp-models.example.yaml` | шаблон в git |
|
||||
| `llamacpp-models.yaml` | URL на `.gguf` (gitignore) |
|
||||
|
||||
Параметры `-ngl` / `-c` ставятся по тому же GPU probe (full offload на mid+, меньше слоёв и ctx на low).
|
||||
На interactive `up` / `setup` после выбора `llamacpp` спрашивается пресет (как у Ollama). На `up` CLI скачивает GGUF в `/mnt/swarm_data/llamacpp/models`, затем ставит `llama-server` + systemd.
|
||||
|
||||
### Пресеты
|
||||
|
||||
| preset | что |
|
||||
| --- | --- |
|
||||
| **recommended** | Qwen2.5 7B abliterate Q4_K_M (~4.7 GB) |
|
||||
| light | Qwen2.5 3B Instruct Q4_K_M |
|
||||
| stock | официальный Qwen2.5 7B Instruct Q4_K_M |
|
||||
| empty | только runtime |
|
||||
|
||||
Параметры `-ngl` / `-c` — по GPU probe. Опционально `HF_TOKEN` для gated HF. Вручную: положи GGUF в каталог models и `systemctl restart gpu-rent-llamacpp`.
|
||||
|
||||
---
|
||||
|
||||
|
||||
Reference in New Issue
Block a user