[Unit] Description=llama.cpp server - beta (meta/combat/action_eval on Ada #1) After=network-online.target [Service] Type=simple User=nyx-organs Group=nimmerverse-agents Environment="CUDA_VISIBLE_DEVICES=1" Environment="PATH=/usr/local/cuda/bin:/data/venvs/llama/bin:/usr/local/bin:/usr/bin:/usr/sbin:/bin" ExecStart=/data/llama.cpp/build/bin/llama-server \ --model /data/models/prod/beta/Gemma4-31B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf \ --model-draft /data/models/prod/beta/mtp-gemma-4-31B-it.gguf \ --spec-type draft-mtp \ -fa on \ --alias beta \ --host 0.0.0.0 \ --port 31002 \ --n-gpu-layers 40 \ --ctx-size 65536 \ --cache-type-k q4_0 \ --cache-type-v q4_0 \ --batch-size 2048 \ --ubatch-size 512 \ --threads 8 \ --cont-batching \ --reasoning off RestartSec=5 WorkingDirectory=/data [Install] WantedBy=multi-user.target