diff --git a/infra/helm/stonks-oracle/values-beta.yaml b/infra/helm/stonks-oracle/values-beta.yaml index abf2cf6..d0a3f90 100644 --- a/infra/helm/stonks-oracle/values-beta.yaml +++ b/infra/helm/stonks-oracle/values-beta.yaml @@ -39,9 +39,9 @@ config: MINIO_SECURE: "false" BROKER_MODE: "paper" BROKER_PROVIDER: "alpaca" - OLLAMA_BASE_URL: "http://10.1.1.12:2701" - OLLAMA_MODEL: "qwen3.5:4b-fast" - VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" + OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" + OLLAMA_MODEL: "numind/NuExtract3" + VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" VLLM_MODEL: "numind/NuExtract3" VLLM_TIMEOUT: "120" VLLM_MAX_RETRIES: "2" diff --git a/infra/helm/stonks-oracle/values-paper.yaml b/infra/helm/stonks-oracle/values-paper.yaml index 43c7d6b..cc78d97 100644 --- a/infra/helm/stonks-oracle/values-paper.yaml +++ b/infra/helm/stonks-oracle/values-paper.yaml @@ -16,9 +16,9 @@ config: REDIS_DB: "2" DEPLOY_STAGE: "paper" POSTGRES_USER: "stonks_paper" - OLLAMA_BASE_URL: "http://10.1.1.12:2701" - OLLAMA_MODEL: "qwen3.5:4b-fast" - VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" + OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" + OLLAMA_MODEL: "numind/NuExtract3" + VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" VLLM_MODEL: "numind/NuExtract3" MARKET_DATA_BASE_URL: "https://api.polygon.io" diff --git a/infra/helm/stonks-oracle/values.yaml b/infra/helm/stonks-oracle/values.yaml index 66d959d..0c5b30a 100644 --- a/infra/helm/stonks-oracle/values.yaml +++ b/infra/helm/stonks-oracle/values.yaml @@ -185,14 +185,14 @@ config: REDIS_DB: "0" MINIO_ENDPOINT: "minio.minio-service.svc.cluster.local:80" MINIO_SECURE: "false" - OLLAMA_BASE_URL: "http://10.1.1.12:2701" - OLLAMA_MODEL: "qwen3.5:4b-fast" + OLLAMA_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" + OLLAMA_MODEL: "numind/NuExtract3" OLLAMA_TIMEOUT: "240" OLLAMA_MAX_RETRIES: "2" OLLAMA_RETRY_BASE_DELAY: "1.0" OLLAMA_RETRY_MAX_DELAY: "10.0" OLLAMA_RETRY_BACKOFF_MULTIPLIER: "2.0" - VLLM_BASE_URL: "http://vllm-external.vllm-service.svc.cluster.local:2701" + VLLM_BASE_URL: "http://nuextract-external.vllm-service.svc.cluster.local:2701" VLLM_MODEL: "numind/NuExtract3" VLLM_TIMEOUT: "120" VLLM_MAX_RETRIES: "2" diff --git a/infra/kube-vllm/deployment.yaml b/infra/kube-vllm/deployment.yaml index 53060c3..9014954 100644 --- a/infra/kube-vllm/deployment.yaml +++ b/infra/kube-vllm/deployment.yaml @@ -16,6 +16,7 @@ spec: app: vllm spec: runtimeClassName: nvidia + enableServiceLinks: false nodeSelector: kubernetes.io/hostname: gremlin-1 containers: @@ -32,7 +33,7 @@ spec: - "--port" - "8000" - "--gpu-memory-utilization" - - "0.45" + - "0.80" - "--max-model-len" - "8192" - "--max-num-seqs" diff --git a/infra/kube-vllm/service.yaml b/infra/kube-vllm/service.yaml index 446c319..4bdc350 100644 --- a/infra/kube-vllm/service.yaml +++ b/infra/kube-vllm/service.yaml @@ -1,7 +1,7 @@ apiVersion: v1 kind: Service metadata: - name: vllm + name: nuextract namespace: vllm-service spec: ports: @@ -16,7 +16,7 @@ spec: apiVersion: v1 kind: Service metadata: - name: vllm-external + name: nuextract-external namespace: vllm-service spec: ports: diff --git a/infra/kube-vllm/vllm-metrics.yaml b/infra/kube-vllm/vllm-metrics.yaml index f894d9f..6c61eef 100644 --- a/infra/kube-vllm/vllm-metrics.yaml +++ b/infra/kube-vllm/vllm-metrics.yaml @@ -37,7 +37,7 @@ metadata: data: default.conf: | upstream vllm_backend { - server vllm.vllm-service.svc.cluster.local:8000; + server nuextract.vllm-service.svc.cluster.local:8000; } server {