Files
nimmersky/guides-stack/llama-beta.service

33 lines
900 B
Desktop File

[Unit]
Description=llama.cpp server - beta (meta/combat/action_eval on Ada #1)
After=network-online.target
[Service]
Type=simple
User=nyx-organs
Group=nimmerverse-agents
Environment="CUDA_VISIBLE_DEVICES=1"
Environment="PATH=/usr/local/cuda/bin:/data/venvs/llama/bin:/usr/local/bin:/usr/bin:/usr/sbin:/bin"
ExecStart=/data/llama.cpp/build/bin/llama-server \
--model /data/models/prod/beta/Gemma4-31B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf \
--model-draft /data/models/prod/beta/mtp-gemma-4-31B-it.gguf \
--spec-type draft-mtp \
-fa on \
--alias beta \
--host 0.0.0.0 \
--port 31002 \
--n-gpu-layers 40 \
--ctx-size 65536 \
--cache-type-k q4_0 \
--cache-type-v q4_0 \
--batch-size 2048 \
--ubatch-size 512 \
--threads 8 \
--cont-batching \
--reasoning off
RestartSec=5
WorkingDirectory=/data
[Install]
WantedBy=multi-user.target