feat: vLLM serving numind/NuExtract3 on full GPU, ollama disabled

- Ollama scaled to 0 — vLLM gets entire 16GB GPU
- NuExtract3 (9B) running at 80% GPU utilization
- Both OLLAMA_BASE_URL and VLLM_BASE_URL point to vLLM service
- Fixed gremlin-1 missing default route (no internet access)
- Removed GPU resource limit (time-slicing handles allocation)
- Removed init container (direct download works with internet fix)
This commit is contained in:
Celes Renata
2026-07-03 17:57:19 +00:00
parent ecade0dd52
commit a322e00659
6 changed files with 14 additions and 13 deletions
+3 -3
View File
@@ -39,9 +39,9 @@ config:
MINIO_SECURE: "false" MINIO_SECURE: "false"
BROKER_MODE: "paper" BROKER_MODE: "paper"
BROKER_PROVIDER: "alpaca" BROKER_PROVIDER: "alpaca"
OLLAMA_BASE_URL: "http://10.1.1.12:2701" OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
OLLAMA_MODEL: "qwen3.5:4b-fast" OLLAMA_MODEL: "numind/NuExtract3"
VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
VLLM_MODEL: "numind/NuExtract3" VLLM_MODEL: "numind/NuExtract3"
VLLM_TIMEOUT: "120" VLLM_TIMEOUT: "120"
VLLM_MAX_RETRIES: "2" VLLM_MAX_RETRIES: "2"
+3 -3
View File
@@ -16,9 +16,9 @@ config:
REDIS_DB: "2" REDIS_DB: "2"
DEPLOY_STAGE: "paper" DEPLOY_STAGE: "paper"
POSTGRES_USER: "stonks_paper" POSTGRES_USER: "stonks_paper"
OLLAMA_BASE_URL: "http://10.1.1.12:2701" OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
OLLAMA_MODEL: "qwen3.5:4b-fast" OLLAMA_MODEL: "numind/NuExtract3"
VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
VLLM_MODEL: "numind/NuExtract3" VLLM_MODEL: "numind/NuExtract3"
MARKET_DATA_BASE_URL: "https://api.polygon.io" MARKET_DATA_BASE_URL: "https://api.polygon.io"
+3 -3
View File
@@ -185,14 +185,14 @@ config:
REDIS_DB: "0" REDIS_DB: "0"
MINIO_ENDPOINT: "minio.minio-service.svc.cluster.local:80" MINIO_ENDPOINT: "minio.minio-service.svc.cluster.local:80"
MINIO_SECURE: "false" MINIO_SECURE: "false"
OLLAMA_BASE_URL: "http://10.1.1.12:2701" OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
OLLAMA_MODEL: "qwen3.5:4b-fast" OLLAMA_MODEL: "numind/NuExtract3"
OLLAMA_TIMEOUT: "240" OLLAMA_TIMEOUT: "240"
OLLAMA_MAX_RETRIES: "2" OLLAMA_MAX_RETRIES: "2"
OLLAMA_RETRY_BASE_DELAY: "1.0" OLLAMA_RETRY_BASE_DELAY: "1.0"
OLLAMA_RETRY_MAX_DELAY: "10.0" OLLAMA_RETRY_MAX_DELAY: "10.0"
OLLAMA_RETRY_BACKOFF_MULTIPLIER: "2.0" OLLAMA_RETRY_BACKOFF_MULTIPLIER: "2.0"
VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
VLLM_MODEL: "numind/NuExtract3" VLLM_MODEL: "numind/NuExtract3"
VLLM_TIMEOUT: "120" VLLM_TIMEOUT: "120"
VLLM_MAX_RETRIES: "2" VLLM_MAX_RETRIES: "2"
+2 -1
View File
@@ -16,6 +16,7 @@ spec:
app: vllm app: vllm
spec: spec:
runtimeClassName: nvidia runtimeClassName: nvidia
enableServiceLinks: false
nodeSelector: nodeSelector:
kubernetes.io/hostname: gremlin-1 kubernetes.io/hostname: gremlin-1
containers: containers:
@@ -32,7 +33,7 @@ spec:
- "--port" - "--port"
- "8000" - "8000"
- "--gpu-memory-utilization" - "--gpu-memory-utilization"
- "0.45" - "0.80"
- "--max-model-len" - "--max-model-len"
- "8192" - "8192"
- "--max-num-seqs" - "--max-num-seqs"
+2 -2
View File
@@ -1,7 +1,7 @@
apiVersion: v1 apiVersion: v1
kind: Service kind: Service
metadata: metadata:
name: vllm name: nuextract
namespace: vllm-service namespace: vllm-service
spec: spec:
ports: ports:
@@ -16,7 +16,7 @@ spec:
apiVersion: v1 apiVersion: v1
kind: Service kind: Service
metadata: metadata:
name: vllm-external name: nuextract-external
namespace: vllm-service namespace: vllm-service
spec: spec:
ports: ports:
+1 -1
View File
@@ -37,7 +37,7 @@ metadata:
data: data:
default.conf: | default.conf: |
upstream vllm_backend { upstream vllm_backend {
server vllm.vllm-service.svc.cluster.local:8000; server nuextract.vllm-service.svc.cluster.local:8000;
} }
server { server {