diff --git a/manifests/llama/main.yaml b/manifests/llama/main.yaml index 0d7126a..03a6a14 100644 --- a/manifests/llama/main.yaml +++ b/manifests/llama/main.yaml @@ -27,9 +27,9 @@ spec: - name: HF_HOME value: /models/.hf - name: MODEL_REPO - value: "byteshape/Qwen3.8-27B-GGUF" + value: "byteshape/Qwen3.5-9B-GGUF" - name: MODEL_FILE - value: "Qwen3.8-27B-IQ3_S-3.44bpw.gguf" + value: "Qwen3.5-9B-Q5_K_S-5.10bpw.gguf" # optional, only if you need gated/private models # - name: HUGGING_FACE_HUB_TOKEN # valueFrom: @@ -82,7 +82,7 @@ spec: image: ghcr.io/ggml-org/llama.cpp:server-vulkan args: - "--model" - - "/models/Qwen3.8-27B-IQ3_S-3.44bpw.gguf" + - "/models/Qwen3.5-9B-Q5_K_S-5.10bpw.gguf" - "--host" - "0.0.0.0" - "--port"