Eigener KI-Server: Was er kostet, was er leistet und wann die Cloud günstiger ist

Wir betreiben seit Mai 2026 in Köln einen eigenen KI-Server mit rund 100 Euro Stromkosten im Monat. Anhand echter Zahlen aus vier Monaten zeigen wir euch, was die Hardware leistet und ab wann sie sich gegenüber Cloud-Abos sowie Premium-Plätzen für Coding und Agenten rechnet.

Schwarze Workstation mit rotem Frontrahmen steht kniehoch auf dem Boden neben einem leeren Bürostuhl und einem Schreibtisch in einem hellen Großraumbüro

Was lokale KI bedeutet und was nicht

Lokale KI bedeutet konkret, dass ein Sprachmodell (ein LLM, Large Language Model) auf einem eigenen KI-Server in eurem eigenen Rechenzentrum läuft. Deshalb verlassen weder eure Anfragen noch eure Dokumente das Firmennetz. Ihr nutzt dabei offene Modelle wie Gemma von Google oder Qwen von Alibaba, denn diese lassen sich frei herunterladen und ohne Nutzungsgebühr betreiben. Im Fachjargon heißt das On-Premise-KI: Das Modell läuft im Haus und nicht beim Anbieter.

Das bedeutet allerdings nicht, dass ihr eine eigene KI trainiert. In der Praxis reicht es völlig aus, fertige Modelle zu betreiben und ihnen eure Dokumente als Kontext zu geben. Der Fachbegriff dafür ist RAG (Retrieval Augmented Generation): Das Modell bekommt zu jeder Frage die passenden Textstellen aus eurer Ablage und antwortet mit Quellenangabe. Ein echtes Training oder Fine-Tuning ist hingegen ein Sonderfall und für den Büroalltag meist unnötig.

Lokal ist zudem nicht automatisch besser als die Cloud. Zwar reichen lokale Modelle für den größten Teil der Büroaufgaben im Mittelstand aus, aber die stärksten Modelle laufen nach wie vor in der Cloud. Daher nutzen wir in unserem Betrieb beides parallel. Eine detaillierte Gegenüberstellung findet ihr in unserer großen KI-Übersicht.

Unser KI-Server in Köln: die Hardware

Seit Mai 2026 betreiben wir eine GPU-Workstation als KI-Server statt eines klassischen Rack-Servers. Wir haben uns deshalb für diesen Weg entschieden, weil dies für unsere Größe die günstigste Klasse mit Profi-Grafikkarten und normalem Hersteller-Support ist. Die Hardware setzt sich wie folgt zusammen:

  • Lenovo ThinkStation P8
  • AMD Ryzen Threadripper PRO 9975WX mit 32 Kernen
  • 128 GB DDR5-ECC-Arbeitsspeicher
  • 2 x NVIDIA RTX PRO 6000 Blackwell Max-Q mit je 96 GB Grafikspeicher (insgesamt 192 GB)
  • 2 TB NVMe für Modelle, 1 TB NVMe für das System und 3 TB RAID 1 für Daten
  • 1.400-Watt-Netzteil
  • Ubuntu Linux (bei uns die LTS-Version 26.04)

Die entscheidende Zahl ist hierbei der Grafikspeicher, denn das Modell muss komplett hineinpassen. Mit 96 GB pro Karte reichen die Ressourcen für Modelle mit rund 30 Milliarden Parametern in hoher Qualität oder 70 bis 80 Milliarden Parametern in komprimierter Form. Zudem bleibt genug Platz für ein Kontextfenster von bis zu 256.000 Token.

Zwei Karten bedeuten bei uns allerdings nicht ein doppeltes Tempo für einen einzelnen Nutzer. Stattdessen ermöglichen sie uns, zwei verschiedene Modelle gleichzeitig im Speicher zu halten. Darüber hinaus haben wir so eine Reserve für parallele Anfragen mehrerer Nutzer.

Was darauf läuft und wer darf

Wir setzen auf eine Mischung verschiedener spezialisierter Modelle. Konkret nutzen wir Gemma 4 mit 31 Milliarden Parametern für den Chat, Texte sowie die Bild- und Texterkennung aus Scans. Für Code und Agenten kommt Qwen 3.8 Flash-Next mit 27 Milliarden Parametern zum Einsatz. Zudem nutzen wir Qwen3-Embedding mit 8 Milliarden Parametern plus Reranker für die Wissenssuche, Qwen-Image für die Bildbearbeitung und Faster-Whisper für die Umwandlung von Sprache in Text.

Vor den Modellen geschaltet ist ein eigenes Gateway. Dieses steuert den Zugriff über persönliche API-Schlüssel, aktuell sind 26 Schlüssel für Anwendungen und Mitarbeiter aktiv. Das Gateway übernimmt das Modell-Routing und führt ein Audit-Protokoll. So wissen wir genau, wer wann welche Daten an welches Modell geschickt hat.

Der Zugang ist streng reglementiert, weil Sicherheit Vorrang hat. Die Benutzeroberfläche ist nur aus dem Firmennetz mit einer Anmeldung per Microsoft 365 (SSO) erreichbar. Die Schnittstelle von außen funktioniert nur mit einem persönlichen Schlüssel, einem Geo-Filter und einer Drosselung. Die Modelle selbst hängen ausschließlich hinter dem Gateway im eigenen Rechenzentrum, ohne Cloud-Anbindung.

Was das kostet: Anschaffung, Strom, Betrieb

Unsere Zwei-GPU-Konfiguration war im Frühjahr 2026 eine Investition im mittleren fünfstelligen Bereich. Derselbe Aufbau ist heute, im September 2026, spürbar teurer, weil die Preise für Profi-Grafikkarten gestiegen sind. Eine Workstation mit einer Profi-GPU (96 GB) für 5 bis 15 Nutzer ist deutlich günstiger. Konkret entfallen die Hälfte bis zwei Drittel des Preises auf die Grafikkarten, wobei drei Jahre Hersteller-Support enthalten sind.

Der Stromverbrauch ist ein dauerhafter Kostenfaktor. Beide Grafikkarten brauchen im Leerlauf zusammen rund 30 Watt, die Modelle bleiben dabei geladen. Im Tagesmittel liegen die Karten bei 237 Watt, unter Volllast bei bis zu 600 Watt. Das ganze System kommt unter Last auf etwa 1,1 Kilowatt. Das ergibt einen Verbrauch von 10 bis 12 Kilowattstunden am Tag. Bei 32 Cent je Kilowattstunde kostet das rund 100 bis 115 Euro im Monat oder 1.200 bis 1.400 Euro im Jahr. Wir betreiben den Server dauerhaft, da unsere Assistenten auch nachts arbeiten; nur zu Bürozeiten läge der Verbrauch bei etwa der Hälfte.

Zudem fällt Aufwand für den Betrieb an. Modell-Updates, Treiber, das Gateway, Monitoring und Backups kosten uns einige Stunden im Monat. Ohne fundierte Linux- und GPU-Kenntnisse wird der Server schnell zum Risiko, da veraltete Modelle oder Stillstände nach Updates drohen.

Wer den Kaufpreis über vier Jahre Nutzungsdauer verteilt und den Strom dazurechnet, bekommt einen festen Monatsbetrag. Dieser Betrag wächst nicht mit der Zahl der Nutzer oder der Aufrufe. Das gilt für die Zwei-GPU-Workstation wie für die Ein-GPU-Workstation, die deutlich günstiger ist. Die Arbeitszeit für den Betrieb kommt in beiden Fällen hinzu.

Standard-Chat-Plätze kosten 20 bis 30 Euro je Nutzer und Monat, damit ist es aber nicht getan. Wer Coding-Werkzeuge oder Agenten nutzen will, braucht bei den großen Anbietern einen Premium-Platz für rund 100 Euro je Nutzer und Monat im Jahresabo, bei monatlicher Zahlung rund 125 Euro. Alternativ läuft die Nutzung über die API und wird je Token abgerechnet, ohne feste Obergrenze.

Bei uns programmieren acht Mitarbeiter mit dem lokalen Coding-Modell und brauchen dafür keinen Premium-Platz. Das spart rund 800 Euro im Monat, was über vier Jahre gerechnet unseren Server samt Strom trägt. Der Chat für alle Mitarbeiter, die Dokumentenverarbeitung und die nächtlichen Assistenten kommen ohne Aufpreis dazu. Wie viel das ist, zeigt der Listenpreis der Claude-API vom 17. September 2026, ohne Rabatte für Caching oder Batch, also die Obergrenze.

Was unsere Token-Mengen über die Claude-API gekostet hätten (Listenpreise vom 17. September 2026, ohne Rabatte für Caching oder Batch)
MonatEingabe-TokenAusgabe-TokenOpus 5Sonnet 5
August 20261,047 Mrd.17,7 Mio.5.675 $2.270 $
September bis 17.09.1,192 Mrd.67,1 Mio.7.638 $3.055 $
September hochgerechnet2,11 Mrd.119 Mio.13.548 $5.419 $
Gesamt seit Juni3,85 Mrd.110 Mio.21.987 $8.795 $

Ein Teil dieser Menge entsteht allerdings nur, weil sie bei uns nichts kostet. Für die anspruchsvollsten Entwicklungsaufgaben ohne Kundendaten nutzen wir weiterhin einzelne Cloud-Zugänge.

Was der KI-Server leistet: Zahlen aus vier Monaten Betrieb

Unser Gateway-Audit vom 18. Mai bis 16. September 2026 zeigt bei 210.340 Anfragen eine hohe Auslastung. Im August verarbeiteten wir 37.845 Anfragen und 1,06 Milliarden Token, was einem Schnitt von 34,3 Millionen Token am Tag entspricht. Im September stieg die Last in nur 16 Tagen auf 50.126 Anfragen und 1,14 Milliarden Token. Hochgerechnet auf den Monat wären das rund 2,1 Milliarden Token.

Seit Juni haben wir insgesamt 3,84 Milliarden Token verarbeitet. Davon entfallen 93,5 Millionen auf die erzeugte Ausgabe. In Textseiten ausgedrückt sind das rund 160.000 geschriebene Seiten und etwa 6,5 Millionen gelesene Seiten Kontext. Der Spitzentag war der 13. Juli 2026 mit 265 Millionen Token. Am 15. September verzeichneten wir mit 7.162 die meisten Anfragen an einem Tag.

Die Nutzung ist über den Tag verteilt, denn 25,4 Prozent der Anfragen erfolgen nachts zwischen 22 und 6 Uhr. Der größte Einzelprompt nutzte mit 262.143 Token den vollen Kontext. Die längste Antwort im September umfasste 22.697 Token. Eine typische Chat-Anfrage im September bestand aus 848 Token Frage und 640 Token Antwort. Die Erfolgsquote im Chat lag je nach Monat zwischen 97,1 und 99,0 Prozent.

Das Tempo ist für uns absolut ausreichend. Gemma 4 liefert je nach Auslastung 50 bis 90 Token je Sekunde. Das entspricht rund 35 bis 60 deutschen Wörtern pro Sekunde, was schneller ist als man lesen kann. Flash-Next ist mit 66 bis 135 Token je Sekunde noch schneller. In einem Lasttest am 16. September wurden acht gleichzeitige Anfragen mit je rund 220 Token in 6 bis 8 Sekunden fertig. Das ergibt 35 Token je Sekunde pro Nutzer und 210 in Summe, während im Hintergrund ein weiterer Auftrag lief. Ein Dokument mit 29.000 Zeichen (rund 15 Seiten) wurde samt Zusammenfassung in 7,9 Sekunden verarbeitet.

Wir müssen allerdings ehrlich über die Grenzen sprechen. Ein Modell mit 31 Milliarden Parametern ist bei kniffligem Schlussfolgern, mehrstufigen Aufgaben und seltenen Fachthemen schwächer als die großen Cloud-Modelle. Deshalb müssen Antworten öfter geprüft werden. Für anspruchsvolle Entwicklungsaufgaben ohne Kundendaten nutzen wir weiterhin Cloud-Modelle. Alles mit Kundendaten oder in großer Menge bleibt lokal.

Wofür wir unseren KI-Server wirklich nutzen

Wir setzen die lokale KI für ganz konkrete Aufgaben ein:

  • Mitarbeiter-Chat mit unserem Wissen: Techniker fragen in normaler Sprache nach Dokumentationen, Runbooks, OneNote und SharePoint über mehr als 200 Wissensbereiche. Die Suche läuft auf einem zweiten, kleineren GPU-Server mit zwei RTX 4000 Ada, während der große Server die Antwort formuliert. Jede Antwort enthält eine Quelle.
  • Dokumentenanalyse: Wir lesen Rechnungen, Verträge, Lieferscheine und Screenshots von Fehlermeldungen aus, um sie in strukturierte Daten zu wandeln. Nichts verlässt dabei das Haus.
  • Automatisierte Nacht-Assistenten: Das System sortiert Monitoring-Meldungen vor, bereitet Tickets vor und bereitet Rechnungsdaten auf. Weil keine Gebühr je Aufruf anfällt, kostet das nachts nichts extra; bei Cloud-Diensten wäre genau das die teuerste Position.
  • Coding-Assistenz: Wir nutzen die KI für Skripte, Automatisierungen und Konfigurationen.
  • Medienverarbeitung: Seit Mai haben wir 1.786 Bilder erzeugt, 2.601 Transkriptionen erstellt und 26.709 Embedding-Aufrufe für die Wissenssuche getätigt.

Ein wichtiger Nebeneffekt ist die Experimentierfreude. Weil kein Aufruf und keine Lizenz pro Kopf kostet, probieren unsere Mitarbeiter Dinge aus, die sie bei einem kostenpflichtigen Abo niemals beantragt hätten.

Lokal oder Cloud: wann sich was rechnet

Die Entscheidung zwischen eigenem KI-Server und Cloud hängt von verschiedenen Kriterien ab. Bei den Kosten steht eine hohe Vorab-Investition plus Strom und Betrieb gegen Standard-Abos von 20 bis 30 Euro pro Nutzer, Premium-Plätze für Coding und Agenten ab rund 100 Euro oder Token-Abrechnung über die API. Beim Datenschutz stehen Daten im eigenen Netz gegen Auftragsverarbeitung und Drittlandtransfer beim Anbieter. Die Modellqualität ist lokal gut für Bürotexte und Suche, während die Cloud die stärksten, ständig aktualisierten Modelle bietet.

In puncto Kapazität ist ein eigener Server fest und planbar, die Cloud hingegen praktisch unbegrenzt. Beim Betrieb bedeutet lokal eigener Aufwand, während man in der Cloud von Preisänderungen und Anbieterentscheidungen abhängig ist. Bei einem Ausfall ist man lokal selbst verantwortlich, in der Cloud hat man keinen Einfluss.

Wir haben eine Faustformel in zwei Stufen entwickelt, die über vier Jahre Nutzungsdauer inklusive Strom gerechnet ist. Geht es nur um Chat, rechnet sich ein KI-Server mit einer GPU ab etwa 15 bis 20 täglichen Nutzern, eine Zwei-GPU-Lösung ab etwa 30 bis 35. Sobald Mitarbeiter Coding-Werkzeuge oder Agenten brauchen, zählt der Premium-Platz für rund 100 Euro, und dann ist die Ein-GPU-Lösung schon ab 4 bis 5 Nutzern gleichauf, die Zwei-GPU-Lösung ab 8 bis 9. Gemischte Teams liegen dazwischen. Unter zehn reinen Chat-Nutzern gewinnt die Cloud rein über den Preis fast immer, denn zehn Standard-Plätze kosten nur 200 bis 300 Euro.

Es gibt jedoch drei Fälle, in denen die reine Kostenrechnung nicht zählt. Erstens, wenn Daten das Haus nicht verlassen dürfen, wie in Kanzleien, Praxen oder in der Konstruktion. Zweitens bei der Massenverarbeitung von hunderten Dokumenten täglich, da hier der tausendste Aufruf lokal nichts mehr kostet. Drittens aus Gründen der Unabhängigkeit, damit kein Anbieter Modelle abschalten oder Bedingungen ändern kann.

Ein Mittelweg ist es, einen KI-Server zu mieten statt zu kaufen, in einem deutschen Rechenzentrum. Hier gibt es eine feste Miete und die Daten liegen beim Hoster statt beim KI-Anbieter. Der häufigste Weg für kleine und mittlere Unternehmen ist jedoch ein hybrider Ansatz: Lokal als Standard und Cloud für Aufgaben, bei denen das Modell den Unterschied macht und keine sensiblen Daten im Spiel sind.

Drei Betriebe, drei Antworten: mögliche Szenarien

Die drei Betriebe gibt es so nicht. Wir haben sie aus typischen Anfragen zusammengesetzt, die Einordnung stammt aus der Faustformel oben.

1. Die Steuerkanzlei (18 Mitarbeiter, Köln): Mandantendaten dürfen das Haus nicht verlassen, zudem fragen 15 Mitarbeiter täglich Dokumente und Fristen ab. Entscheidung: Ein-GPU-Workstation, betrieben über den IT-Dienstleister. Die Begründung ist, dass 15 tägliche Nutzer bereits in dem Bereich liegen, ab dem sich der eigene Server gegenüber Cloud-Plätzen rechnet. Die Cloud wird nur für allgemeine Recherchen ohne Mandantenbezug genutzt.

2. Der Produktionsbetrieb (45 Mitarbeiter, Hagen): Täglich werden mehrere hundert Lieferscheine, Rechnungen und Prüfprotokolle gelesen und in das Warenwirtschaftssystem übertragen. In der Cloud würde jede Seite Token kosten. Entscheidung: Zwei-GPU-Workstation, wobei Assistenten nachts laufen und die Cloud als Plan B dient. In der Praxis kostet bei dieser Menge der tausendste Aufruf lokal nichts mehr.

3. Die Werbeagentur (8 Mitarbeiter, Langenfeld): Hier stehen Texte, Übersetzungen und Ideen im Vordergrund, es gibt keine sensiblen Kundendaten und keine Massenverarbeitung, und niemand braucht Coding-Werkzeuge oder Agenten. Entscheidung: Standard-Plätze in der Cloud für rund 200 Euro im Monat. Ein eigener Server hätte sich erst gerechnet, wenn mehrere Mitarbeiter Premium-Plätze bräuchten oder 15 Kollegen täglich damit arbeiten würden.

Datenschutz und Recht: leichter, aber nicht papierlos

Ein eigener Server vereinfacht vieles, da keine Auftragsverarbeitung durch einen KI-Anbieter nötig ist und die Drittlandfrage entfällt. Dennoch bleibt die Dokumentationspflicht bestehen. Ihr müsst das Verzeichnis der Verarbeitungstätigkeiten nach Art. 30 DSGVO pflegen. Bei einer umfangreichen Verarbeitung personenbezogener Daten ist zudem eine Datenschutz-Folgenabschätzung nach Art. 35 DSGVO zu prüfen. Falls ein Betriebsrat existiert, muss dieser bei der Verarbeitung von Beschäftigtendaten beteiligt werden.

Die KI-Verordnung der EU gilt unabhängig vom Standort des Modells. Seit dem 2. Februar 2025 besteht eine Schulungspflicht für Mitarbeiter, die KI einsetzen (Art. 4). Zudem gelten seit dem 2. August 2026 Transparenzpflichten nach Art. 50. Wer Kunden von einem KI-Assistenten antworten lässt, muss dies kenntlich machen.

Diese Details solltet ihr mit eurem Datenschutzbeauftragten klären. Wir liefern die notwendige technische Dokumentation dazu. Mehr Informationen findet ihr in unserem Artikel zum KI-Kompetenznachweis für Unternehmen.

Sieben Fragen vor dem Kauf

Wer einen KI-Server kaufen oder mieten will, sollte vorher diese sieben Fragen beantworten.

  1. Wer nutzt die KI täglich? Zählt hierbei die Anzahl der Menschen und die Menge der Aufgaben, nicht die Lizenzen.
  2. Welche Daten gehen hinein? Kunden-, Personal- oder Konstruktionsdaten kippen die Entscheidung meist Richtung lokal.
  3. Wer betreibt die Maschine? Klärt, ob Linux-Kenntnisse, Treiber-Updates und Monitoring intern oder über den IT-Dienstleister erfolgen.
  4. Wo steht sie? Die Hardware ist hörbar und heizt den Raum, daher gehört sie in den Serverraum an eine USV.
  5. Passen die Modelle in den Grafikspeicher? Es ist besser, ein Modell zu wählen, das vollständig passt, als ein größeres, das ausgelagert wird.
  6. Wie wird abgesichert? Nutzt ein Gateway mit persönlichen Schlüsseln, Protokollierung und Backups der Konfiguration ohne direkten Modellzugriff.
  7. Was ist Plan B? Legt vor dem ersten Engpass fest, ob ein Cloud-Zugang für Spitzen und Sonderfälle existiert.

Unser Fazit nach vier Monaten

Die Entscheidung für lokale KI ist keine Glaubensfrage, sondern eine Frage der Auslastung und der Daten. Unter zehn reinen Chat-Nutzern ohne sensible Daten ist die Cloud günstiger und einfacher. Sobald mehrere Mitarbeiter Coding-Werkzeuge oder Agenten brauchen, kippt die Rechnung allerdings schon bei acht bis neun Nutzern; bei uns zahlen acht Entwicklerplätze den Server. Ab 15 bis 20 täglichen Chat-Nutzern, bei großen Dokumentenmassen oder bei Daten, die das Haus nicht verlassen dürfen, rechnet sich ein eigener KI-Server, sofern jemand ihn betreibt.

Unser KI-Server in Köln läuft seit Mai stabil und kostet rund 100 Euro Strom im Monat. Seit Juni hat er 3,84 Milliarden Token verarbeitet und beantwortet acht Anfragen gleichzeitig in Lesegeschwindigkeit. Für die anspruchsvollsten Aufgaben nutzen wir trotzdem die Cloud. Genau diese Kombination empfehlen wir den meisten kleinen und mittleren Unternehmen mit 10 bis 50 Arbeitsplätzen.

Wer überlegt, ob lokale KI in den eigenen Betrieb passt, bekommt bei unserer KI-Beratung in Köln den KI-Server im Betrieb gezeigt. Wir betreuen kleine und mittelständische Unternehmen in Köln, Langenfeld, Düsseldorf, Leverkusen, Hagen und Umgebung. Wir rechnen dann mit euren Nutzerzahlen und Datenarten durch, ob Cloud, eigener Server oder eine Kombination passt. Passend dazu ist auch unser Artikel über KI für kleine und mittelständische Unternehmen in Köln.

Häufige Fragen

Was kostet ein KI-Server für ein kleines oder mittelständisches Unternehmen?

Eine GPU-Workstation mit zwei Profi-Grafikkarten wie die von netzwerkfaehig in Köln ist eine Investition im mittleren fünfstelligen Bereich. Ein Aufbau mit einer Profi-GPU für 5 bis 15 Nutzer ist hingegen deutlich günstiger. Konkret entfallen die Hälfte bis zwei Drittel des Preises auf die Grafikkarten. Zudem kommen Stromkosten von rund 100 bis 115 Euro im Monat bei Dauerbetrieb sowie Arbeitszeit für den Betrieb hinzu. Wer nicht kaufen will, kann stattdessen einen KI-Server in einem deutschen Rechenzentrum mieten.

Welche Hardware braucht man für lokale KI im Unternehmen?

Entscheidend ist der Grafikspeicher. Wir nutzen eine Lenovo ThinkStation P8 mit einem AMD Ryzen Threadripper PRO 9975WX und 128 GB DDR5-ECC-Arbeitsspeicher. Zudem verbauten wir zwei NVIDIA RTX PRO 6000 Blackwell Max-Q mit insgesamt 192 GB Grafikspeicher. Für die Daten nutzen wir 2 TB NVMe für Modelle, 1 TB NVMe für das System und 3 TB RAID 1. Das System läuft mit Ubuntu Linux, bei uns in der LTS-Version 26.04.

Sind lokale KI-Modelle so gut wie ChatGPT oder Copilot?

Lokale Modelle sind bei kniffligem Schlussfolgern oder seltenen Fachthemen schwächer als große Cloud-Modelle. Deshalb prüfen wir die Antworten häufiger. Wir nutzen lokale Modelle für alle Kundendaten und große Mengen. Für anspruchsvolle Entwicklungsaufgaben ohne sensible Daten greifen wir hingegen auf Cloud-Modelle zurück. Kurz gesagt ist ein hybrider Weg für kleine und mittlere Unternehmen oft am sinnvollsten.

Ist lokale KI automatisch DSGVO-konform?

Nein, die Technik allein reicht nicht aus. Ihr müsst die Verarbeitungstätigkeiten nach Art. 30 DSGVO verzeichnen. Zudem ist bei umfangreicher Verarbeitung personenbezogener Daten eine Datenschutz-Folgenabschätzung nach Art. 35 DSGVO nötig. Falls ihr einen Betriebsrat habt, müsst ihr diesen bei der Verarbeitung von Beschäftigtendaten beteiligen. Darüber hinaus schreibt der EU AI Act Schulungspflichten und Transparenzpflichten vor.

Wie viele Nutzer schafft ein KI-Server gleichzeitig?

Das hängt von der Hardware und den Modellen ab. In unserem Lasttest bearbeitete der Server acht Anfragen gleichzeitig. Jede Antwort mit rund 220 Token war nach 6 bis 8 Sekunden fertig. Dabei erreichten wir 35 Token je Sekunde pro Nutzer. Insgesamt lieferte das System 210 Token je Sekunde, während im Hintergrund ein weiterer Auftrag lief.

Lohnt sich ein KI-Server für 10 Mitarbeiter?

Bei zehn reinen Chat-Nutzern gewinnt die Cloud rein preislich fast immer. Zehn Standard-Plätze kosten 200 bis 300 Euro im Monat, ein Ein-GPU-Server inklusive Strom rechnet sich bei reinem Chat erst ab etwa 15 bis 20 täglichen Nutzern. Anders sieht es aus, sobald mehrere der zehn Coding-Werkzeuge oder Agenten brauchen. Dafür verlangen die Anbieter Premium-Plätze für rund 100 Euro je Nutzer und Monat im Jahresabo, und ab vier bis fünf Premium-Plätzen kippt die Rechnung Richtung eigener Server. Dazu kommen der Datenschutz und die Freiheit, ohne Gebühr je Aufruf zu arbeiten.

Welche Modelle laufen auf dem KI-Server von netzwerkfaehig?

Auf unserem KI-Server in Köln setzen wir auf offene Modelle (Open Weights) ohne Nutzungsgebühr. Für Chat und OCR nutzen wir Gemma 4 mit 31 Milliarden Parametern. Qwen 3.8 Flash-Next übernimmt Code und Agenten, während Qwen3-Embedding die Wissenssuche steuert. Zudem nutzen wir Qwen-Image für Bilder und Faster-Whisper für Sprache-zu-Text. Die Chat- und Coding-Modelle arbeiten mit einem Kontextfenster von bis zu 256.000 Token.

Wie schnell antwortet ein lokales KI-Modell?

Die Geschwindigkeit ist meist höher als das Lesetempo. Gemma 4 antwortet im Median mit 89 Token je Sekunde, was etwa 60 deutschen Wörtern entspricht. Flash-Next ist mit einem Median von 135 Token je Sekunde noch schneller. Ein Dokument mit 10.700 Token, rund 15 Seiten, hat unser Server samt Zusammenfassung in 7,9 Sekunden verarbeitet.

Kann man einen KI-Server mieten statt kaufen?

Ja, das ist eine echte Alternative. Ihr könnt einen KI-Server in einem deutschen Rechenzentrum mieten statt kaufen. Dadurch entfällt die hohe Anfangsinvestition und ihr zahlt eine feste Monatsmiete. Die Daten liegen dann beim Hoster statt beim KI-Anbieter. In der Praxis ist dies eine gute Lösung für kleine und mittlere Unternehmen, die kein eigenes Rechenzentrum betreiben wollen.

Was kostet der Strom für einen KI-Server?

Die Kosten hängen von der Auslastung ab. Unsere beiden Grafikkarten liegen im Tagesmittel bei 237 Watt, das ganze System unter Volllast bei etwa 1,1 Kilowatt. Das ergibt 10 bis 12 Kilowattstunden am Tag. Bei 32 Cent je Kilowattstunde kostet der Dauerbetrieb rund 100 bis 115 Euro im Monat. Wer den Server nur zu Bürozeiten nutzt, zahlt etwa die Hälfte.

Passende Artikel

Habt ihr diese 4 wichtigen Punkte in den letzten 6 Monaten einmal überprüft? Falls nein, sprecht uns an, wir entwerfen mit euch einen Plan und setzen ihn auch um, wenn gewünscht.

  • Sicherheitsprüfung eurer Firewall und Server-Infrastruktur
  • Kontrolle alter Benutzerkonten und Zugriffsrechte
  • Prüfung von Zugriffsrechten auf eure Unternehmensdaten
  • Test einer vollständigen Datenwiederherstellung (Notfallprobe)
Jetzt anfragen

Jetzt Kontakt aufnehmen

Interesse geweckt? Ruft uns an oder schreibt uns über das Formular. Wir melden uns in der Regel noch am selben Werktag.

Telefon

0221 677 864 12

Büroanschrift

netzwerkfähig H & F GmbH
Karl-Benz-Straße 9
40764 Langenfeld

Datenschutzerklärung öffnen

Spamschutz aktiv – die Prüfung läuft automatisch im Hintergrund.