Files
nimmersky/guides-stack/llama-gamma.service

32 lines
879 B
Desktop File

[Unit]
Description=llama.cpp server - gamma (memory/profile/vision/translator on RTX 3090)
After=network-online.target
[Service]
Type=simple
User=nyx-organs
Group=nimmerverse-agents
Environment="PATH=/usr/local/cuda/bin:/data/venvs/llama/bin:/usr/local/bin:/usr/bin:/usr/sbin:/bin"
ExecStart=/data/llama.cpp/build/bin/llama-server \
--model /data/models/prod/gamma/Gemma4-31B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf \
--model-draft /data/models/prod/gamma/mtp-gemma-4-31B-it.gguf \
--spec-type draft-mtp \
-fa on \
--alias gamma \
--host 0.0.0.0 \
--port 31003 \
--n-gpu-layers 40 \
--ctx-size 262144 \
--cache-type-k q4_0 \
--cache-type-v q4_0 \
--batch-size 2048 \
--ubatch-size 512 \
--threads 8 \
--cont-batching \
--reasoning off
RestartSec=5
WorkingDirectory=/data
[Install]
WantedBy=multi-user.target