feat: vLLM serving numind/NuExtract3 on full GPU, ollama disabled

- Ollama scaled to 0 — vLLM gets entire 16GB GPU
- NuExtract3 (9B) running at 80% GPU utilization
- Both OLLAMA_BASE_URL and VLLM_BASE_URL point to vLLM service
- Fixed gremlin-1 missing default route (no internet access)
- Removed GPU resource limit (time-slicing handles allocation)
- Removed init container (direct download works with internet fix)
This commit is contained in:
Celes Renata
2026-07-03 17:57:19 +00:00
parent ecade0dd52
commit a322e00659
6 changed files with 14 additions and 13 deletions
+3 -3
View File
@@ -39,9 +39,9 @@ config:
MINIO_SECURE: "false"
BROKER_MODE: "paper"
BROKER_PROVIDER: "alpaca"
OLLAMA_BASE_URL: "http://10.1.1.12:2701"
OLLAMA_MODEL: "qwen3.5:4b-fast"
VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701"
OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
OLLAMA_MODEL: "numind/NuExtract3"
VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
VLLM_MODEL: "numind/NuExtract3"
VLLM_TIMEOUT: "120"
VLLM_MAX_RETRIES: "2"
+3 -3
View File
@@ -16,9 +16,9 @@ config:
REDIS_DB: "2"
DEPLOY_STAGE: "paper"
POSTGRES_USER: "stonks_paper"
OLLAMA_BASE_URL: "http://10.1.1.12:2701"
OLLAMA_MODEL: "qwen3.5:4b-fast"
VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701"
OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
OLLAMA_MODEL: "numind/NuExtract3"
VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
VLLM_MODEL: "numind/NuExtract3"
MARKET_DATA_BASE_URL: "https://api.polygon.io"
+3 -3
View File
@@ -185,14 +185,14 @@ config:
REDIS_DB: "0"
MINIO_ENDPOINT: "minio.minio-service.svc.cluster.local:80"
MINIO_SECURE: "false"
OLLAMA_BASE_URL: "http://10.1.1.12:2701"
OLLAMA_MODEL: "qwen3.5:4b-fast"
OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
OLLAMA_MODEL: "numind/NuExtract3"
OLLAMA_TIMEOUT: "240"
OLLAMA_MAX_RETRIES: "2"
OLLAMA_RETRY_BASE_DELAY: "1.0"
OLLAMA_RETRY_MAX_DELAY: "10.0"
OLLAMA_RETRY_BACKOFF_MULTIPLIER: "2.0"
VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701"
VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701"
VLLM_MODEL: "numind/NuExtract3"
VLLM_TIMEOUT: "120"
VLLM_MAX_RETRIES: "2"
+2 -1
View File
@@ -16,6 +16,7 @@ spec:
app: vllm
spec:
runtimeClassName: nvidia
enableServiceLinks: false
nodeSelector:
kubernetes.io/hostname: gremlin-1
containers:
@@ -32,7 +33,7 @@ spec:
- "--port"
- "8000"
- "--gpu-memory-utilization"
- "0.45"
- "0.80"
- "--max-model-len"
- "8192"
- "--max-num-seqs"
+2 -2
View File
@@ -1,7 +1,7 @@
apiVersion: v1
kind: Service
metadata:
name: vllm
name: nuextract
namespace: vllm-service
spec:
ports:
@@ -16,7 +16,7 @@ spec:
apiVersion: v1
kind: Service
metadata:
name: vllm-external
name: nuextract-external
namespace: vllm-service
spec:
ports:
+1 -1
View File
@@ -37,7 +37,7 @@ metadata:
data:
default.conf: |
upstream vllm_backend {
server vllm.vllm-service.svc.cluster.local:8000;
server nuextract.vllm-service.svc.cluster.local:8000;
}
server {