Files
gpu-rent/docs/spike-notes.md
T
Leonid Pershin 2ab32a8ab5 Refactor LLM configuration to remove llamacpp support
- Removed references to llamacpp from configuration files, scripts, and documentation, streamlining the LLM setup process to focus solely on Ollama.
- Updated environment variables and paths to eliminate llamacpp-related entries, ensuring clarity in the configuration.
- Adjusted CLI commands and help messages to reflect the removal of llamacpp, enhancing user experience and reducing confusion.
- Revised documentation to provide clear guidance on using Ollama exclusively, including updates to setup instructions and runtime options.
2026-08-21 08:51:36 +03:00

3.6 KiB
Raw Blame History

Spike notes — первый живой прогон

Заполняй руками после зелёного doctor. Без секретов и без личных имён чекпоинтов.

Подготовка ключей: setup.md. Цель — один раз пройти панель + CLI на реальном GPU и зафиксировать факты (времена, цены, имя образа).


0. Перед прогоном

Шаг Дата Результат
Квота GPU в панели (лимит) 0 / N
Тикет в поддержку (номер), если был
Сервисный пользователь member + .env да / нет
gpu-rent doctor exit 0

Текст тикета: setup.md §2.3.


1. Preflight

.\gpu-rent.ps1 doctor
.\gpu-rent.ps1 flavors
.\gpu-rent.ps1 dry-run
Проверка OK? Заметка
Keystone token
GPU quota > 0
Flavor из FLAVOR_PREFERENCE id / имя
Image Driver 580 (без Docker) имя образа
Volume type в AZ
Civitai .red + token (если используешь)

2. Первый up

.\gpu-rent.ps1 up --yes

Первый bootstrap долгий (ориентир 20–40 мин). Не рви терминал посередине.

Метрика Значение
Flavor фактически
Spot / preemptible
ACTIVE через (мин)
SSH через (мин)
Backend Idle через (мин)
Seed Civitai (мин / GB)
Boot snapshot gpu-rent-boot-ok да / нет / ошибка
₽/час GPU (панель)
₽/мес data disk (панель)
Access-card / URL :17801 да / нет

3. Туннель и API

Если закрыл туннель (Ctrl+C):

.\gpu-rent.ps1 tunnel --open
Шаг OK?
UI http://127.0.0.1:17801
/API/GetNewSession
MCP /mcp (если нужно)
nvidia-smi через gpu-rent ssh

4. Idle-killer / hold

Шаг OK? Заметка
systemctl status gpu-rent-idle-killer.timer (по SSH)
gpu-rent hold пишет hold-until
Качалка модели в UI hold, если killer не видит busy

5. Preempt / диски / stop

Шаг OK?
EXPIRED → tunnel unshelve или up
stop — диски живы
Второй up — те же модели на data
Boot из snapshot gpu-rent-boot-ok

6. (Опц.) LLM

.\gpu-rent.ps1 up --yes --ollama
# или интерактивно: up → меню runtime/пресет
Шаг OK?
Ollama :17811 через туннель
pull / GGUF из манифеста
LLM_RUNTIME=none гасит unit на следующем up

См. llm.md.


Выводы для кода / конфига

  • Имя GPU-образа в пуле:
  • Реальные flavor id (не в git):
  • Хватает ли IDLE_GRACE_MINUTES=90:
  • Application credential с узкими access_rules: ок / ошибка (fail closed):
  • Прочее:

Когда spike закрыт — отметь пункты в roadmap.md §0.