From a322e00659605421f4a18de1be605499a6c7743c Mon Sep 17 00:00:00 2001 From: Celes Renata Date: Fri, 3 Jul 2026 17:57:19 +0000 Subject: [PATCH] feat: vLLM serving numind/NuExtract3 on full GPU, ollama disabled MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - Ollama scaled to 0 — vLLM gets entire 16GB GPU - NuExtract3 (9B) running at 80% GPU utilization - Both OLLAMA_BASE_URL and VLLM_BASE_URL point to vLLM service - Fixed gremlin-1 missing default route (no internet access) - Removed GPU resource limit (time-slicing handles allocation) - Removed init container (direct download works with internet fix) --- infra/helm/stonks-oracle/values-beta.yaml | 6 +++--- infra/helm/stonks-oracle/values-paper.yaml | 6 +++--- infra/helm/stonks-oracle/values.yaml | 6 +++--- infra/kube-vllm/deployment.yaml | 3 ++- infra/kube-vllm/service.yaml | 4 ++-- infra/kube-vllm/vllm-metrics.yaml | 2 +- 6 files changed, 14 insertions(+), 13 deletions(-) diff --git a/infra/helm/stonks-oracle/values-beta.yaml b/infra/helm/stonks-oracle/values-beta.yaml index abf2cf6..d0a3f90 100644 --- a/infra/helm/stonks-oracle/values-beta.yaml +++ b/infra/helm/stonks-oracle/values-beta.yaml @@ -39,9 +39,9 @@ config: MINIO_SECURE: "false" BROKER_MODE: "paper" BROKER_PROVIDER: "alpaca" - OLLAMA_BASE_URL: "http://10.1.1.12:2701" - OLLAMA_MODEL: "qwen3.5:4b-fast" - VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" + OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" + OLLAMA_MODEL: "numind/NuExtract3" + VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" VLLM_MODEL: "numind/NuExtract3" VLLM_TIMEOUT: "120" VLLM_MAX_RETRIES: "2" diff --git a/infra/helm/stonks-oracle/values-paper.yaml b/infra/helm/stonks-oracle/values-paper.yaml index 43c7d6b..cc78d97 100644 --- a/infra/helm/stonks-oracle/values-paper.yaml +++ b/infra/helm/stonks-oracle/values-paper.yaml @@ -16,9 +16,9 @@ config: REDIS_DB: "2" DEPLOY_STAGE: "paper" POSTGRES_USER: "stonks_paper" - OLLAMA_BASE_URL: "http://10.1.1.12:2701" - OLLAMA_MODEL: "qwen3.5:4b-fast" - VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" + OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" + OLLAMA_MODEL: "numind/NuExtract3" + VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" VLLM_MODEL: "numind/NuExtract3" MARKET_DATA_BASE_URL: "https://api.polygon.io" diff --git a/infra/helm/stonks-oracle/values.yaml b/infra/helm/stonks-oracle/values.yaml index 66d959d..0c5b30a 100644 --- a/infra/helm/stonks-oracle/values.yaml +++ b/infra/helm/stonks-oracle/values.yaml @@ -185,14 +185,14 @@ config: REDIS_DB: "0" MINIO_ENDPOINT: "minio.minio-service.svc.cluster.local:80" MINIO_SECURE: "false" - OLLAMA_BASE_URL: "http://10.1.1.12:2701" - OLLAMA_MODEL: "qwen3.5:4b-fast" + OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" + OLLAMA_MODEL: "numind/NuExtract3" OLLAMA_TIMEOUT: "240" OLLAMA_MAX_RETRIES: "2" OLLAMA_RETRY_BASE_DELAY: "1.0" OLLAMA_RETRY_MAX_DELAY: "10.0" OLLAMA_RETRY_BACKOFF_MULTIPLIER: "2.0" - VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" + VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" VLLM_MODEL: "numind/NuExtract3" VLLM_TIMEOUT: "120" VLLM_MAX_RETRIES: "2" diff --git a/infra/kube-vllm/deployment.yaml b/infra/kube-vllm/deployment.yaml index 53060c3..9014954 100644 --- a/infra/kube-vllm/deployment.yaml +++ b/infra/kube-vllm/deployment.yaml @@ -16,6 +16,7 @@ spec: app: vllm spec: runtimeClassName: nvidia + enableServiceLinks: false nodeSelector: kubernetes.io/hostname: gremlin-1 containers: @@ -32,7 +33,7 @@ spec: - "--port" - "8000" - "--gpu-memory-utilization" - - "0.45" + - "0.80" - "--max-model-len" - "8192" - "--max-num-seqs" diff --git a/infra/kube-vllm/service.yaml b/infra/kube-vllm/service.yaml index 446c319..4bdc350 100644 --- a/infra/kube-vllm/service.yaml +++ b/infra/kube-vllm/service.yaml @@ -1,7 +1,7 @@ apiVersion: v1 kind: Service metadata: - name: vllm + name: nuextract namespace: vllm-service spec: ports: @@ -16,7 +16,7 @@ spec: apiVersion: v1 kind: Service metadata: - name: vllm-external + name: nuextract-external namespace: vllm-service spec: ports: diff --git a/infra/kube-vllm/vllm-metrics.yaml b/infra/kube-vllm/vllm-metrics.yaml index f894d9f..6c61eef 100644 --- a/infra/kube-vllm/vllm-metrics.yaml +++ b/infra/kube-vllm/vllm-metrics.yaml @@ -37,7 +37,7 @@ metadata: data: default.conf: | upstream vllm_backend { - server vllm.vllm-service.svc.cluster.local:8000; + server nuextract.vllm-service.svc.cluster.local:8000; } server {