Was lokale KI bedeutet und was nicht
Lokale KI bedeutet konkret, dass ein Sprachmodell (ein LLM, Large Language Model) auf einem eigenen KI-Server in eurem eigenen Rechenzentrum läuft. Deshalb verlassen weder eure Anfragen noch eure Dokumente das Firmennetz. Ihr nutzt dabei offene Modelle wie Gemma von Google oder Qwen von Alibaba, denn diese lassen sich frei herunterladen und ohne Nutzungsgebühr betreiben. Im Fachjargon heißt das On-Premise-KI: Das Modell läuft im Haus und nicht beim Anbieter.
Das bedeutet allerdings nicht, dass ihr eine eigene KI trainiert. In der Praxis reicht es völlig aus, fertige Modelle zu betreiben und ihnen eure Dokumente als Kontext zu geben. Der Fachbegriff dafür ist RAG (Retrieval Augmented Generation): Das Modell bekommt zu jeder Frage die passenden Textstellen aus eurer Ablage und antwortet mit Quellenangabe. Ein echtes Training oder Fine-Tuning ist hingegen ein Sonderfall und für den Büroalltag meist unnötig.
Lokal ist zudem nicht automatisch besser als die Cloud. Zwar reichen lokale Modelle für den größten Teil der Büroaufgaben im Mittelstand aus, aber die stärksten Modelle laufen nach wie vor in der Cloud. Daher nutzen wir in unserem Betrieb beides parallel. Eine detaillierte Gegenüberstellung findet ihr in unserer großen KI-Übersicht.
Unser KI-Server in Köln: die Hardware
Seit Mai 2026 betreiben wir eine GPU-Workstation als KI-Server statt eines klassischen Rack-Servers. Wir haben uns deshalb für diesen Weg entschieden, weil dies für unsere Größe die günstigste Klasse mit Profi-Grafikkarten und normalem Hersteller-Support ist. Die Hardware setzt sich wie folgt zusammen:
- Lenovo ThinkStation P8
- AMD Ryzen Threadripper PRO 9975WX mit 32 Kernen
- 128 GB DDR5-ECC-Arbeitsspeicher
- 2 x NVIDIA RTX PRO 6000 Blackwell Max-Q mit je 96 GB Grafikspeicher (insgesamt 192 GB)
- 2 TB NVMe für Modelle, 1 TB NVMe für das System und 3 TB RAID 1 für Daten
- 1.400-Watt-Netzteil
- Ubuntu Linux (bei uns die LTS-Version 26.04)
Die entscheidende Zahl ist hierbei der Grafikspeicher, denn das Modell muss komplett hineinpassen. Mit 96 GB pro Karte reichen die Ressourcen für Modelle mit rund 30 Milliarden Parametern in hoher Qualität oder 70 bis 80 Milliarden Parametern in komprimierter Form. Zudem bleibt genug Platz für ein Kontextfenster von bis zu 256.000 Token.
Zwei Karten bedeuten bei uns allerdings nicht ein doppeltes Tempo für einen einzelnen Nutzer. Stattdessen ermöglichen sie uns, zwei verschiedene Modelle gleichzeitig im Speicher zu halten. Darüber hinaus haben wir so eine Reserve für parallele Anfragen mehrerer Nutzer.
Was darauf läuft und wer darf
Wir setzen auf eine Mischung verschiedener spezialisierter Modelle. Konkret nutzen wir Gemma 4 mit 31 Milliarden Parametern für den Chat, Texte sowie die Bild- und Texterkennung aus Scans. Für Code und Agenten kommt Qwen 3.8 Flash-Next mit 27 Milliarden Parametern zum Einsatz. Zudem nutzen wir Qwen3-Embedding mit 8 Milliarden Parametern plus Reranker für die Wissenssuche, Qwen-Image für die Bildbearbeitung und Faster-Whisper für die Umwandlung von Sprache in Text.
Vor den Modellen geschaltet ist ein eigenes Gateway. Dieses steuert den Zugriff über persönliche API-Schlüssel, aktuell sind 26 Schlüssel für Anwendungen und Mitarbeiter aktiv. Das Gateway übernimmt das Modell-Routing und führt ein Audit-Protokoll. So wissen wir genau, wer wann welche Daten an welches Modell geschickt hat.
Der Zugang ist streng reglementiert, weil Sicherheit Vorrang hat. Die Benutzeroberfläche ist nur aus dem Firmennetz mit einer Anmeldung per Microsoft 365 (SSO) erreichbar. Die Schnittstelle von außen funktioniert nur mit einem persönlichen Schlüssel, einem Geo-Filter und einer Drosselung. Die Modelle selbst hängen ausschließlich hinter dem Gateway im eigenen Rechenzentrum, ohne Cloud-Anbindung.
Was das kostet: Anschaffung, Strom, Betrieb
Unsere Zwei-GPU-Konfiguration war im Frühjahr 2026 eine Investition im mittleren fünfstelligen Bereich. Derselbe Aufbau ist heute, im September 2026, spürbar teurer, weil die Preise für Profi-Grafikkarten gestiegen sind. Eine Workstation mit einer Profi-GPU (96 GB) für 5 bis 15 Nutzer ist deutlich günstiger. Konkret entfallen die Hälfte bis zwei Drittel des Preises auf die Grafikkarten, wobei drei Jahre Hersteller-Support enthalten sind.
Der Stromverbrauch ist ein dauerhafter Kostenfaktor. Beide Grafikkarten brauchen im Leerlauf zusammen rund 30 Watt, die Modelle bleiben dabei geladen. Im Tagesmittel liegen die Karten bei 237 Watt, unter Volllast bei bis zu 600 Watt. Das ganze System kommt unter Last auf etwa 1,1 Kilowatt. Das ergibt einen Verbrauch von 10 bis 12 Kilowattstunden am Tag. Bei 32 Cent je Kilowattstunde kostet das rund 100 bis 115 Euro im Monat oder 1.200 bis 1.400 Euro im Jahr. Wir betreiben den Server dauerhaft, da unsere Assistenten auch nachts arbeiten; nur zu Bürozeiten läge der Verbrauch bei etwa der Hälfte.
Zudem fällt Aufwand für den Betrieb an. Modell-Updates, Treiber, das Gateway, Monitoring und Backups kosten uns einige Stunden im Monat. Ohne fundierte Linux- und GPU-Kenntnisse wird der Server schnell zum Risiko, da veraltete Modelle oder Stillstände nach Updates drohen.
Wer den Kaufpreis über vier Jahre Nutzungsdauer verteilt und den Strom dazurechnet, bekommt einen festen Monatsbetrag. Dieser Betrag wächst nicht mit der Zahl der Nutzer oder der Aufrufe. Das gilt für die Zwei-GPU-Workstation wie für die Ein-GPU-Workstation, die deutlich günstiger ist. Die Arbeitszeit für den Betrieb kommt in beiden Fällen hinzu.
Standard-Chat-Plätze kosten 20 bis 30 Euro je Nutzer und Monat, damit ist es aber nicht getan. Wer Coding-Werkzeuge oder Agenten nutzen will, braucht bei den großen Anbietern einen Premium-Platz für rund 100 Euro je Nutzer und Monat im Jahresabo, bei monatlicher Zahlung rund 125 Euro. Alternativ läuft die Nutzung über die API und wird je Token abgerechnet, ohne feste Obergrenze.
Bei uns programmieren acht Mitarbeiter mit dem lokalen Coding-Modell und brauchen dafür keinen Premium-Platz. Das spart rund 800 Euro im Monat, was über vier Jahre gerechnet unseren Server samt Strom trägt. Der Chat für alle Mitarbeiter, die Dokumentenverarbeitung und die nächtlichen Assistenten kommen ohne Aufpreis dazu. Wie viel das ist, zeigt der Listenpreis der Claude-API vom 17. September 2026, ohne Rabatte für Caching oder Batch, also die Obergrenze.
| Monat | Eingabe-Token | Ausgabe-Token | Opus 5 | Sonnet 5 |
|---|---|---|---|---|
| August 2026 | 1,047 Mrd. | 17,7 Mio. | 5.675 $ | 2.270 $ |
| September bis 17.09. | 1,192 Mrd. | 67,1 Mio. | 7.638 $ | 3.055 $ |
| September hochgerechnet | 2,11 Mrd. | 119 Mio. | 13.548 $ | 5.419 $ |
| Gesamt seit Juni | 3,85 Mrd. | 110 Mio. | 21.987 $ | 8.795 $ |
Ein Teil dieser Menge entsteht allerdings nur, weil sie bei uns nichts kostet. Für die anspruchsvollsten Entwicklungsaufgaben ohne Kundendaten nutzen wir weiterhin einzelne Cloud-Zugänge.
Was der KI-Server leistet: Zahlen aus vier Monaten Betrieb
Unser Gateway-Audit vom 18. Mai bis 16. September 2026 zeigt bei 210.340 Anfragen eine hohe Auslastung. Im August verarbeiteten wir 37.845 Anfragen und 1,06 Milliarden Token, was einem Schnitt von 34,3 Millionen Token am Tag entspricht. Im September stieg die Last in nur 16 Tagen auf 50.126 Anfragen und 1,14 Milliarden Token. Hochgerechnet auf den Monat wären das rund 2,1 Milliarden Token.
Seit Juni haben wir insgesamt 3,84 Milliarden Token verarbeitet. Davon entfallen 93,5 Millionen auf die erzeugte Ausgabe. In Textseiten ausgedrückt sind das rund 160.000 geschriebene Seiten und etwa 6,5 Millionen gelesene Seiten Kontext. Der Spitzentag war der 13. Juli 2026 mit 265 Millionen Token. Am 15. September verzeichneten wir mit 7.162 die meisten Anfragen an einem Tag.
Die Nutzung ist über den Tag verteilt, denn 25,4 Prozent der Anfragen erfolgen nachts zwischen 22 und 6 Uhr. Der größte Einzelprompt nutzte mit 262.143 Token den vollen Kontext. Die längste Antwort im September umfasste 22.697 Token. Eine typische Chat-Anfrage im September bestand aus 848 Token Frage und 640 Token Antwort. Die Erfolgsquote im Chat lag je nach Monat zwischen 97,1 und 99,0 Prozent.
Das Tempo ist für uns absolut ausreichend. Gemma 4 liefert je nach Auslastung 50 bis 90 Token je Sekunde. Das entspricht rund 35 bis 60 deutschen Wörtern pro Sekunde, was schneller ist als man lesen kann. Flash-Next ist mit 66 bis 135 Token je Sekunde noch schneller. In einem Lasttest am 16. September wurden acht gleichzeitige Anfragen mit je rund 220 Token in 6 bis 8 Sekunden fertig. Das ergibt 35 Token je Sekunde pro Nutzer und 210 in Summe, während im Hintergrund ein weiterer Auftrag lief. Ein Dokument mit 29.000 Zeichen (rund 15 Seiten) wurde samt Zusammenfassung in 7,9 Sekunden verarbeitet.
Wir müssen allerdings ehrlich über die Grenzen sprechen. Ein Modell mit 31 Milliarden Parametern ist bei kniffligem Schlussfolgern, mehrstufigen Aufgaben und seltenen Fachthemen schwächer als die großen Cloud-Modelle. Deshalb müssen Antworten öfter geprüft werden. Für anspruchsvolle Entwicklungsaufgaben ohne Kundendaten nutzen wir weiterhin Cloud-Modelle. Alles mit Kundendaten oder in großer Menge bleibt lokal.
Wofür wir unseren KI-Server wirklich nutzen
Wir setzen die lokale KI für ganz konkrete Aufgaben ein:
- Mitarbeiter-Chat mit unserem Wissen: Techniker fragen in normaler Sprache nach Dokumentationen, Runbooks, OneNote und SharePoint über mehr als 200 Wissensbereiche. Die Suche läuft auf einem zweiten, kleineren GPU-Server mit zwei RTX 4000 Ada, während der große Server die Antwort formuliert. Jede Antwort enthält eine Quelle.
- Dokumentenanalyse: Wir lesen Rechnungen, Verträge, Lieferscheine und Screenshots von Fehlermeldungen aus, um sie in strukturierte Daten zu wandeln. Nichts verlässt dabei das Haus.
- Automatisierte Nacht-Assistenten: Das System sortiert Monitoring-Meldungen vor, bereitet Tickets vor und bereitet Rechnungsdaten auf. Weil keine Gebühr je Aufruf anfällt, kostet das nachts nichts extra; bei Cloud-Diensten wäre genau das die teuerste Position.
- Coding-Assistenz: Wir nutzen die KI für Skripte, Automatisierungen und Konfigurationen.
- Medienverarbeitung: Seit Mai haben wir 1.786 Bilder erzeugt, 2.601 Transkriptionen erstellt und 26.709 Embedding-Aufrufe für die Wissenssuche getätigt.
Ein wichtiger Nebeneffekt ist die Experimentierfreude. Weil kein Aufruf und keine Lizenz pro Kopf kostet, probieren unsere Mitarbeiter Dinge aus, die sie bei einem kostenpflichtigen Abo niemals beantragt hätten.
Lokal oder Cloud: wann sich was rechnet
Die Entscheidung zwischen eigenem KI-Server und Cloud hängt von verschiedenen Kriterien ab. Bei den Kosten steht eine hohe Vorab-Investition plus Strom und Betrieb gegen Standard-Abos von 20 bis 30 Euro pro Nutzer, Premium-Plätze für Coding und Agenten ab rund 100 Euro oder Token-Abrechnung über die API. Beim Datenschutz stehen Daten im eigenen Netz gegen Auftragsverarbeitung und Drittlandtransfer beim Anbieter. Die Modellqualität ist lokal gut für Bürotexte und Suche, während die Cloud die stärksten, ständig aktualisierten Modelle bietet.
In puncto Kapazität ist ein eigener Server fest und planbar, die Cloud hingegen praktisch unbegrenzt. Beim Betrieb bedeutet lokal eigener Aufwand, während man in der Cloud von Preisänderungen und Anbieterentscheidungen abhängig ist. Bei einem Ausfall ist man lokal selbst verantwortlich, in der Cloud hat man keinen Einfluss.
Wir haben eine Faustformel in zwei Stufen entwickelt, die über vier Jahre Nutzungsdauer inklusive Strom gerechnet ist. Geht es nur um Chat, rechnet sich ein KI-Server mit einer GPU ab etwa 15 bis 20 täglichen Nutzern, eine Zwei-GPU-Lösung ab etwa 30 bis 35. Sobald Mitarbeiter Coding-Werkzeuge oder Agenten brauchen, zählt der Premium-Platz für rund 100 Euro, und dann ist die Ein-GPU-Lösung schon ab 4 bis 5 Nutzern gleichauf, die Zwei-GPU-Lösung ab 8 bis 9. Gemischte Teams liegen dazwischen. Unter zehn reinen Chat-Nutzern gewinnt die Cloud rein über den Preis fast immer, denn zehn Standard-Plätze kosten nur 200 bis 300 Euro.
Es gibt jedoch drei Fälle, in denen die reine Kostenrechnung nicht zählt. Erstens, wenn Daten das Haus nicht verlassen dürfen, wie in Kanzleien, Praxen oder in der Konstruktion. Zweitens bei der Massenverarbeitung von hunderten Dokumenten täglich, da hier der tausendste Aufruf lokal nichts mehr kostet. Drittens aus Gründen der Unabhängigkeit, damit kein Anbieter Modelle abschalten oder Bedingungen ändern kann.
Ein Mittelweg ist es, einen KI-Server zu mieten statt zu kaufen, in einem deutschen Rechenzentrum. Hier gibt es eine feste Miete und die Daten liegen beim Hoster statt beim KI-Anbieter. Der häufigste Weg für kleine und mittlere Unternehmen ist jedoch ein hybrider Ansatz: Lokal als Standard und Cloud für Aufgaben, bei denen das Modell den Unterschied macht und keine sensiblen Daten im Spiel sind.
Drei Betriebe, drei Antworten: mögliche Szenarien
Die drei Betriebe gibt es so nicht. Wir haben sie aus typischen Anfragen zusammengesetzt, die Einordnung stammt aus der Faustformel oben.
1. Die Steuerkanzlei (18 Mitarbeiter, Köln): Mandantendaten dürfen das Haus nicht verlassen, zudem fragen 15 Mitarbeiter täglich Dokumente und Fristen ab. Entscheidung: Ein-GPU-Workstation, betrieben über den IT-Dienstleister. Die Begründung ist, dass 15 tägliche Nutzer bereits in dem Bereich liegen, ab dem sich der eigene Server gegenüber Cloud-Plätzen rechnet. Die Cloud wird nur für allgemeine Recherchen ohne Mandantenbezug genutzt.
2. Der Produktionsbetrieb (45 Mitarbeiter, Hagen): Täglich werden mehrere hundert Lieferscheine, Rechnungen und Prüfprotokolle gelesen und in das Warenwirtschaftssystem übertragen. In der Cloud würde jede Seite Token kosten. Entscheidung: Zwei-GPU-Workstation, wobei Assistenten nachts laufen und die Cloud als Plan B dient. In der Praxis kostet bei dieser Menge der tausendste Aufruf lokal nichts mehr.
3. Die Werbeagentur (8 Mitarbeiter, Langenfeld): Hier stehen Texte, Übersetzungen und Ideen im Vordergrund, es gibt keine sensiblen Kundendaten und keine Massenverarbeitung, und niemand braucht Coding-Werkzeuge oder Agenten. Entscheidung: Standard-Plätze in der Cloud für rund 200 Euro im Monat. Ein eigener Server hätte sich erst gerechnet, wenn mehrere Mitarbeiter Premium-Plätze bräuchten oder 15 Kollegen täglich damit arbeiten würden.
Datenschutz und Recht: leichter, aber nicht papierlos
Ein eigener Server vereinfacht vieles, da keine Auftragsverarbeitung durch einen KI-Anbieter nötig ist und die Drittlandfrage entfällt. Dennoch bleibt die Dokumentationspflicht bestehen. Ihr müsst das Verzeichnis der Verarbeitungstätigkeiten nach Art. 30 DSGVO pflegen. Bei einer umfangreichen Verarbeitung personenbezogener Daten ist zudem eine Datenschutz-Folgenabschätzung nach Art. 35 DSGVO zu prüfen. Falls ein Betriebsrat existiert, muss dieser bei der Verarbeitung von Beschäftigtendaten beteiligt werden.
Die KI-Verordnung der EU gilt unabhängig vom Standort des Modells. Seit dem 2. Februar 2025 besteht eine Schulungspflicht für Mitarbeiter, die KI einsetzen (Art. 4). Zudem gelten seit dem 2. August 2026 Transparenzpflichten nach Art. 50. Wer Kunden von einem KI-Assistenten antworten lässt, muss dies kenntlich machen.
Diese Details solltet ihr mit eurem Datenschutzbeauftragten klären. Wir liefern die notwendige technische Dokumentation dazu. Mehr Informationen findet ihr in unserem Artikel zum KI-Kompetenznachweis für Unternehmen.
Sieben Fragen vor dem Kauf
Wer einen KI-Server kaufen oder mieten will, sollte vorher diese sieben Fragen beantworten.
- Wer nutzt die KI täglich? Zählt hierbei die Anzahl der Menschen und die Menge der Aufgaben, nicht die Lizenzen.
- Welche Daten gehen hinein? Kunden-, Personal- oder Konstruktionsdaten kippen die Entscheidung meist Richtung lokal.
- Wer betreibt die Maschine? Klärt, ob Linux-Kenntnisse, Treiber-Updates und Monitoring intern oder über den IT-Dienstleister erfolgen.
- Wo steht sie? Die Hardware ist hörbar und heizt den Raum, daher gehört sie in den Serverraum an eine USV.
- Passen die Modelle in den Grafikspeicher? Es ist besser, ein Modell zu wählen, das vollständig passt, als ein größeres, das ausgelagert wird.
- Wie wird abgesichert? Nutzt ein Gateway mit persönlichen Schlüsseln, Protokollierung und Backups der Konfiguration ohne direkten Modellzugriff.
- Was ist Plan B? Legt vor dem ersten Engpass fest, ob ein Cloud-Zugang für Spitzen und Sonderfälle existiert.
Unser Fazit nach vier Monaten
Die Entscheidung für lokale KI ist keine Glaubensfrage, sondern eine Frage der Auslastung und der Daten. Unter zehn reinen Chat-Nutzern ohne sensible Daten ist die Cloud günstiger und einfacher. Sobald mehrere Mitarbeiter Coding-Werkzeuge oder Agenten brauchen, kippt die Rechnung allerdings schon bei acht bis neun Nutzern; bei uns zahlen acht Entwicklerplätze den Server. Ab 15 bis 20 täglichen Chat-Nutzern, bei großen Dokumentenmassen oder bei Daten, die das Haus nicht verlassen dürfen, rechnet sich ein eigener KI-Server, sofern jemand ihn betreibt.
Unser KI-Server in Köln läuft seit Mai stabil und kostet rund 100 Euro Strom im Monat. Seit Juni hat er 3,84 Milliarden Token verarbeitet und beantwortet acht Anfragen gleichzeitig in Lesegeschwindigkeit. Für die anspruchsvollsten Aufgaben nutzen wir trotzdem die Cloud. Genau diese Kombination empfehlen wir den meisten kleinen und mittleren Unternehmen mit 10 bis 50 Arbeitsplätzen.
Wer überlegt, ob lokale KI in den eigenen Betrieb passt, bekommt bei unserer KI-Beratung in Köln den KI-Server im Betrieb gezeigt. Wir betreuen kleine und mittelständische Unternehmen in Köln, Langenfeld, Düsseldorf, Leverkusen, Hagen und Umgebung. Wir rechnen dann mit euren Nutzerzahlen und Datenarten durch, ob Cloud, eigener Server oder eine Kombination passt. Passend dazu ist auch unser Artikel über KI für kleine und mittelständische Unternehmen in Köln.
