guest@muellerchen:~/k3s-homelab/apps/ollama$ cat README.md

Ollama + Open WebUI

Lokale LLMs, GPU-beschleunigt — Chatbot ohne dass die Prompts irgendwo in der Cloud landen.

gpu-pinning.svg
BrowserIngressOpen WebUIWEBUI_AUTH: falseCluster-DNS, internNODE1 · FEST GEPINNTOllamakein Ingressnur intern erreichbar
  • Ollama ist fest an node1 gepinnt. Node1 und node2 haben beide eine Nvidia Quadro P600 — Photoprism läuft ohne festes Pinning auf beiden, Ollama bewusst nur auf node1. Braucht dafür den Nvidia-Device-Plugin und eine eigene runtimeClassName.
  • Eigene unreplizierte StorageClass für die Modelle: node-lokale Performance zählt hier mehr als Redundanz — ein Modell lässt sich notfalls einfach neu ziehen.
  • Ollama selbst hat gar keinen Ingress. Erreichbar ist nur Open WebUI von außen, das intern über Cluster-DNS mit Ollama spricht.
  • Open WebUI läuft ohne eigenes Login — internes Netz, ein einziger Nutzer, kein Grund für zusätzliche Reibung.