replicaCount: 1 image: repository: vllm/vllm-openai tag: latest pullPolicy: Always resources: limits: nvidia.com/gpu: 1 requests: cpu: "2" memory: "8Gi" runtimeClassName: nvidia env: - name: HF_TOKEN valueFrom: secretKeyRef: name: vllm-secrets key: HF_TOKEN args: - "serve" - "numind/NuExtract3" - "--served-model-name" - "numind/NuExtract3" - "--host" - "0.0.0.0" - "--port" - "8000" - "--gpu-memory-utilization" - "0.45" - "--max-model-len" - "8192" - "--max-num-seqs" - "8" service: type: ClusterIP port: 8000 nodeSelector: kubernetes.io/hostname: gremlin-1