Table of Contents
Noch vor zwei Jahren bedeutete „eigene KI“ für die meisten Unternehmen vor allem eines: ein Abonnement für ChatGPT oder Copilot. Heute erreichen immer mehr Organisationen den Punkt, an dem die Cloud nicht mehr ausreicht. Dafür gibt es meist drei Gründe: Kosten, die mit der Zahl der Anfragen steigen, Daten, die das Unternehmen nicht verlassen dürfen, und die Anforderung, dass KI mit eigenen Dokumenten, Datenbanken und Prozessen arbeitet statt mit allgemeinem Wissen aus dem Internet.
An diesem Punkt stellt sich die Frage: Welchen KI-Server sollte man eigentlich kaufen und was kostet er?
Die Antwort ist spannender, als es zunächst scheint, denn die Preisspanne ist enorm: von einem buchgroßen Gerät für gut zwanzigtausend Złoty bis hin zu einer Maschine für mehr als zwei Millionen. Und wichtig ist: Jede dieser Lösungen ist sinnvoll – nur jeweils für andere Anforderungen. Im Folgenden beschreibe ich drei Investitionsstufen, eine Rechnung, die vor der Entscheidung sinnvoll ist, sowie fünf Fragen, mit denen sich die passende Hardware auswählen lässt, ohne zu viel oder zu wenig zu kaufen.
Was unterscheidet einen KI-Server von einem herkömmlichen Server?
Ein herkömmlicher Server ist um den Prozessor herum aufgebaut. Ein KI-Server ist auf GPU-Beschleuniger ausgelegt – sie übernehmen die gesamte Arbeit mit den Modellen, während die übrige Hardware zu ihrer Unterstützung dient. Daraus ergeben sich drei praktische Unterschiede.
- GPU-Beschleuniger und ihr Speicher. In einer solchen Maschine arbeiten vier bis acht Beschleuniger – in Rack-Servern meist als PCIe-Karten, in den leistungsstärksten Plattformen als Module, die auf einer gemeinsamen Platine verlötet sind. Ihr gemeinsamer Speicher ist der wichtigste Parameter bei der gesamten Anschaffung – dazu gleich mehr.
- Stromversorgung. Acht Karten unter Last benötigen 5–6 kW, also so viel wie mehrere Dutzend Bürorechner. Dafür sind ein entsprechend versorgtes Rack und eine leistungsfähige Wärmeabfuhr im Serverraum erforderlich.
- Netzwerk. Für eine einzelne Maschine genügt ein standardmäßiges schnelles Netzwerk. Werden mehrere Server zu einem System verbunden, sind deutlich schnellere Verbindungen erforderlich, da die GPU-Beschleuniger in unterschiedlichen Gehäusen Daten mit einer Latenz austauschen müssen, die mit dem Betrieb innerhalb eines Gehäuses vergleichbar ist.
Es handelt sich daher nicht einfach um einen „leistungsstärkeren Server“. Es ist eine andere Hardwarekategorie, die nach anderen Kriterien ausgewählt wird.
GPU-Speicher: die eine Kennzahl, die die gesamte Auswahl strukturiert
Ein Parameter ist wichtiger als der Preis: wie viel gemeinsamen Speicher die GPU-Beschleuniger im Server haben.
Warum? Das Modell muss vollständig in diesen Speicher passen – ähnlich wie eine Datei erst in ein Programm geladen werden muss, um damit arbeiten zu können. Passt es nicht hinein, startet es schlicht nicht.
Das Modell selbst ist jedoch nur der Anfang der Rechnung. Jeder angemeldete Nutzer und jedes analysierte Dokument belegen zusätzlichen Speicher für die laufende Unterhaltung. Dasselbe Modell benötigt für hundert Personen daher deutlich mehr Speicherplatz als für eine Person – und gerade die Nutzerzahl, nicht allein die Modellgröße, entscheidet meist darüber, welche Hardwarestufe erforderlich ist.
Den grundlegenden Speicherbedarf von Modellen erläutert der Leitfaden Welchen Computer für KI sollte man wählen?. Die folgende Tabelle zeigt die zweite Dimension dieser Rechnung: wie sich der Bedarf mit dem Umfang der Implementierung verändert. Die Werte sind Richtwerte und beziehen sich auf eine typische Produktionskonfiguration.
| Modellgröße | 5 Nutzer | 50 Nutzer | 200 Nutzer | Hardwarestufe |
|---|---|---|---|---|
| klein (Klasse 8B) | ca. 8 GB | ca. 20 GB | ca. 50 GB | DGX Spark |
| mittel (Klasse 70B) | ca. 45 GB | ca. 70 GB | ca. 130 GB | Rack-Server, 1–2 Karten |
| groß (Klasse 200B+) | ca. 130 GB | ca. 200 GB | ca. 350 GB | Server mit acht Karten |
| Training eines eigenen Modells | mehrfach höher als der reine Betrieb | – | – | HGX-Plattform B200 |
Bezeichnungen wie 8B oder 70B geben an, aus wie vielen Milliarden Parametern ein Modell besteht – 8B steht für acht Milliarden. Je mehr Parameter, desto besser die Qualität der Antworten und desto mehr GPU-Speicher belegt das Modell.
Hinzu kommt ein Punkt, der leicht übersehen wird.
Reserve. Die oben genannten Zahlen gelten für den Normalbetrieb. Für Lastspitzen sollte ein Puffer von 20–30 % eingeplant werden, da das System bei höherem Datenverkehr sonst Anfragen ablehnt.
Stufe 1: NVIDIA DGX Spark – der Einstiegspunkt
NVIDIA DGX Spark ist ein buchgroßes Desktop-Gerät mit 128 GB einheitlichem Speicher und einer KI-Rechenleistung von rund 1 PetaFLOPS. Damit lassen sich Modelle der Klasse, die bekannte Assistenten antreibt, lokal ausführen, ohne auch nur ein Dokument in die Cloud zu senden. Es gibt mehrere Varianten, die sich hauptsächlich durch die Speicherkapazität (1, 2 oder 4 TB) und das Supportpaket unterscheiden. Das vollständige Angebot dieser Hardwareklasse, einschließlich Modellen von acht Herstellern, finden Sie in der Kategorie KI-Computer und -Workstations.
Für wen? Für Unternehmen, die zunächst prüfen möchten, ob KI den Kundenservice, die Vertragsanalyse oder die Angebotserstellung verbessert, bevor ein großes Budget freigegeben wird. Die Investition liegt bei ca. 5.524,23 € netto und damit unter den jährlichen Abonnementkosten für KI-Tools für ein Team von gut einem Dutzend Personen. Zwei Geräte lassen sich zu einem System verbinden.
Einschränkung. Diese Hardware ist für ein einzelnes Team gedacht, nicht für die gesamte Organisation. Sie lässt sich nicht in einem Rack montieren, verfügt über keine redundante Stromversorgung und kann nicht in die im Serverraum geltenden Serviceprozesse eingebunden werden. Sollen hundert Personen KI gleichzeitig nutzen, ist die nächsthöhere Stufe erforderlich.
Stufe 2: GPU-Rack-Server – produktive KI für Unternehmen
Meiner Ansicht nach wird diese Stufe heute am häufigsten übersehen, obwohl sie für Unternehmen mit einem konkreten KI-Einsatz die sinnvollste Wahl ist.
Gemeint ist eine dedizierte GPU-Rack-Plattform (5U), die für acht Karten doppelter Breite ausgelegt ist. Sie ist nicht an ein bestimmtes Beschleunigermodell gebunden – die Auswahl der Karten richtet sich nach dem Einsatzzweck. Die Basis bilden zwei AMD EPYC-Prozessoren, bis zu 6 TB DDR5 Speicher in 24 Steckplätzen sowie sechs redundant arbeitende 2700 W-Netzteile.
Entscheidend ist die Anzahl der Karten, denn sie bestimmt den verfügbaren GPU-Speicher. Zwei RTX PRO 6000 mit jeweils 96 GB ergeben 192 GB und reichen für einen internen Assistenten für mehrere Dutzend Personen. Die Vollausstattung mit acht Karten bietet 768 GB – genug für mehrere hundert Nutzer oder sehr große Modelle. Weitere Karten lassen sich im selben Gehäuse ergänzen, ohne den Server auszutauschen. Das ist der größte Vorteil dieser Stufe: Der Einstieg muss nicht gleich als Vollausbau erfolgen.
Konkretes Modell: Supermicro AS-5126GS-TNRT Gold Series
Erhältlich als komplettes, vorkonfiguriertes System. Investitionsvolumen für die Einstiegskonfiguration mit zwei Karten: ca. 115.088,04 € netto. Die genaue Konfiguration und den aktuellen Preis finden Sie auf der Produktseite.
Was bedeutet das in der Praxis? Ein solcher Server kann große Sprachmodelle lokal betreiben, unternehmensweite Dokumentenarchive analysieren, den Kundenservice automatisieren, Inhalte in mehreren Sprachen generieren oder Bilder aus Produktionslinien auswerten. Darüber hinaus sind RTX PRO-Karten vielseitig einsetzbar: Derselbe Server kann für Rendering, Engineering-Simulationen oder die Virtualisierung von Workstations genutzt werden. Das ist häufig ein entscheidendes Argument: Die Hardware bleibt zwischen KI-Projekten nicht ungenutzt.
Für wen? In der Einstiegskonfiguration: für Unternehmen mit mehreren Dutzend Mitarbeitenden, die die Testphase abgeschlossen haben und ihren Teams Zugriff auf einen internen Assistenten mit Kenntnis der Unternehmensprozesse geben möchten. In der Vollausstattung: für große Organisationen, mehrere hundert gleichzeitige Nutzer und regulierte Branchen wie Finanzwesen, Medizin oder den öffentlichen Sektor, in denen Daten im Gebäude bleiben müssen.
Worauf Sie achten sollten. Die Leistungsaufnahme steigt mit der Anzahl der Karten: von ca. 2 kW bei zwei Karten auf 5–6 kW bei acht. Das Rack muss diese Leistung bereitstellen können, und die Kühlung muss die entstehende Wärme abführen. Wenn Sie einen Ausbau planen, sollten Sie Stromversorgung und Klimatisierung direkt für die Zielkonfiguration statt für die Einstiegskonfiguration dimensionieren.
Stufe 3: NVIDIA HGX B200 – Infrastruktur für das Training von Modellen
An der Spitze steht Hardware, über die man in Berichten zum Technologiewettlauf der weltweit größten Unternehmen liest. Ein Server mit der Plattform NVIDIA HGX B200 verfügt über acht Blackwell-Chips, derzeit die leistungsstärksten KI-Beschleuniger am Markt, mit insgesamt 1,44 TB HBM3e-Speicher – dem schnellsten Speicher, der heute erhältlich ist.
Die Maschine belegt 10U im Rack und verfügt über acht Netzwerkschnittstellen mit 400 Gb/s, da sie für den Zusammenschluss mit weiteren baugleichen Servern zu einem Cluster konzipiert ist. Die Stromversorgung basiert auf sechs Netzteilen mit einer Leistung von jeweils ca. 5 kW, die redundant im 3+3-Schema arbeiten. Die tatsächliche Leistungsaufnahme der Maschine liegt unter Last bei etwa 10 kW; der Rest dient als Reserve und Absicherung bei Ausfällen. Zur Ausstattung gehören ein BlueField-3-Prozessor, der das Hauptsystem von Netzwerk- und Sicherheitsaufgaben entlastet, sowie drei Jahre Support mit Vor-Ort-Service am nächsten Arbeitstag.
Konkretes Modell: Supermicro AS-A126GS-TNBR
Ausgelegt für wissenschaftliche Berechnungen, KI, industrielle Automatisierung und Datenanalyse. Investitionsvolumen: ca. 460.352,17 € netto pro Server; den aktuellen Preis finden Sie auf der Produktseite.
Der Unterschied zu einem GPU-Server der zweiten Stufe besteht nicht darin, dass B200 „dasselbe nur schneller“ erledigt. Er liegt darin, dass damit Aufgaben möglich werden, die der andere Server nicht in angemessener Zeit bewältigt: das Training eigener Modelle von Grund auf, das Fine-Tuning von Modellen mit Hunderten Milliarden Parametern, der parallele Betrieb für Hunderte Nutzer, wissenschaftliche Forschung und Simulationen im industriellen Maßstab.
Für wen? Für Unternehmen, die KI-basierte Produkte entwickeln und nicht auf fertige Modelle setzen, sondern eigene erstellen. Für Forschungseinrichtungen und Hochschulen. Für Telekommunikationsanbieter, Banken, große Industriegruppen und Pharmaunternehmen.
In der Praxis wird selten nur eine solche Maschine gekauft. Hinzu kommen Netzwerkinfrastruktur, Stromversorgung und die Kühlung des Rechenzentrums. Bei 10 kW pro Gehäuse kommt in der Regel Flüssigkeitskühlung zum Einsatz. Das ist keine reine Hardwarebeschaffung, sondern eine strategische Entscheidung.
Wie wählen Sie einen Server für KI aus? Fünf Fragen, die Sie sich stellen sollten
Wissen Sie bereits, welche Aufgaben KI in Ihrem Unternehmen übernehmen soll?
Falls nicht, wählen Sie die erste Stufe. Zum Preis eines Premium-Laptops erhalten Sie eine Umgebung, in der Sie innerhalb von zwei Wochen mehrere Ideen testen und Entscheidungen auf Basis von Fakten statt Präsentationen treffen können.
Wie viele Personen werden die Lösung nutzen und wie häufig?
Wenn die Antwort „das gesamte Unternehmen, täglich“ lautet, reicht ein Gerät für den Schreibtisch nicht aus – ein GPU-Server für das Rack ist dann die richtige Wahl. Es lohnt sich zu berechnen, wie viel Sie derzeit für Cloud-APIs und Abonnements ausgeben. Bei großem Umfang ist eigene Hardware über einen Zeitraum von zwei bis drei Jahren kostengünstiger.
Entwickeln Sie eigene Modelle oder nutzen Sie fertige?
Die Nutzung fertiger, selbst sehr großer Modelle gehört zur zweiten Stufe. Die Entwicklung eigener Modelle erfordert bereits B200. Hier ist die Grenze klar und es besteht selten Zweifel daran, auf welcher Seite ein Unternehmen steht.
Wie groß ist das Modell, das Sie betreiben müssen, und für wie viele Personen?
Sehen Sie erneut in die Speichertabelle. Wenn das gewählte Modell 60 GB belegt und von fünfzig Personen gleichzeitig genutzt werden soll, ist eine Karte mit 96 GB Speicher das absolute Minimum. Zwei Karten bieten mehr Spielraum und Kapazität für Wachstum.
Was kann Ihr Rechenzentrum leisten?
Die häufigste Überraschung bei KI-Projekten betrifft nicht die Hardware, sondern das Gebäude: Wie viel Strom lässt sich zuführen, kann die Klimatisierung die zusätzliche Wärme abführen und ist Platz im Rack vorhanden? Prüfen Sie das besser vor der Bestellung als nach der Lieferung.
Was gehört noch zum Implementierungsbudget?
Der Serverpreis macht in der Regel 70–85 % des Projektbudgets aus. Die übrigen Positionen sollten bereits in der Planungsphase berücksichtigt werden.
- Stromversorgung und Rack – PDU mit ausreichender Leistung, Phasenverteilung, unterbrechungsfreie Stromversorgung und in Teilen der Installation auch ein neuer Netzanschluss.
- Kühlung – bis etwa 5–6 kW pro Rack reicht in der Regel eine Präzisionsklimatisierung aus. Oberhalb von 10 kW kommt Flüssigkeitskühlung zum Einsatz, die Anpassungen am Raum und ein separates Serviceverfahren erfordert. Wenn der Serverraum dafür nicht ausgelegt wurde, sollte dieser Kostenpunkt bereits im Angebot berücksichtigt werden.
- Arbeitsspeicher – KI-Konfigurationen beginnen bei mehreren hundert Gigabyte, und die Preise für Servermodule sind im Jahr 2026 deutlich gestiegen. Der Unterschied zwischen 512 GB und 1 TB kann ein wesentlicher Posten in der Kostenkalkulation sein.
- Netzwerk – Switch mit ausreichender Bandbreite, Transceiver und Verkabelung. In Cluster-Konfigurationen kommt ein separates Netzwerk für die GPUs hinzu.
- Massenspeicher – Modelle und Dokumentensammlungen belegen Terabytes, und der Lesedurchsatz sollte der Leistung der Grafikkarten entsprechen.
- Implementierung – Installation der Software, Inbetriebnahme des Modells, Integration in das unternehmensweite Login und in die von Ihnen genutzten Systeme.
- Support und Garantie – Für Produktionsumgebungen ist ein Vor-Ort-Service am nächsten Arbeitstag Standard.
Womit beginnen?
Der häufigste Fehler bei solchen Beschaffungen besteht darin, mit dem Katalog zu beginnen. Die sinnvollere Reihenfolge ist umgekehrt: zuerst ein konkreter Anwendungsfall, dann die Anzahl der Nutzer, anschließend ein Vergleich mit den aktuellen Cloud-Kosten und erst zum Schluss die Konfiguration.
Wenn noch nicht genau feststeht, wofür KI eingesetzt werden soll, reicht die erste Stufe für einige Monate Tests und kostet etwa so viel wie ein Laptop. Wenn die Tests bereits abgeschlossen sind und der Assistent für das gesamte Unternehmen arbeiten soll, ist die zweite Stufe derzeit für die meisten Organisationen die sinnvollste Wahl. Die dritte Stufe kommt infrage, wenn Sie eigene Modelle entwickeln – dann ist die Entscheidung in der Regel eindeutig.
Wenn die Konfiguration an Ihren Serverraum angepasst werden muss – etwa hinsichtlich Anzahl der Karten, Arbeitsspeicher, Netzwerk oder Kühlung –, erstellt unser Team einen Vorschlag für Ihren konkreten Anwendungsfall.
FAQ
Die Preisspanne ist groß: von ca. 5.524,23 € netto für ein Desktop-Gerät der DGX-Spark-Klasse über ca. 115.090,34 € für einen GPU-Server für das Rack in einer Einstiegskonfiguration bis zu ca. 460.361,38 € für eine HGX-Plattform B200. Zum Hardwarepreis kommen 15–30 % für Stromversorgung, Kühlung, Netzwerk und Implementierung hinzu.
Das hängt vom Umfang ab. Die Cloud-Kosten steigen mit der Anzahl der Anfragen, während die Kosten eines eigenen Servers fix sind – nach dem Kauf zahlen Sie nicht für jeden einzelnen Aufruf. Deshalb lohnt es sich, die aktuellen API-Rechnungen und Abonnements mit den auf drei Jahre verteilten Hardwarekosten und den Energiekosten zu vergleichen. Bei intensiver Nutzung ist die eigene Infrastruktur im Vorteil, bei gelegentlicher Nutzung bleibt die Cloud günstiger.
Das Modell muss vollständig in den Speicher der Grafikkarten passen. Als Orientierung: Ein Modell der Klasse 8B benötigt einige zehn Gigabyte, ein Modell der Klasse 70B je nach Speicherpräzision 70 bis 140 GB, und Modelle mit mehr als 200 Milliarden Parametern beginnen bei mehreren hundert Gigabyte. Hinzu kommt Speicher für laufende Gespräche, der mit der Anzahl der Nutzer wächst.
Für Tests und einzelne Anwendungsfälle: ja. Für den Produktionseinsatz in der Regel nicht, da der insgesamt verfügbare Grafikkartenspeicher sowie die Stromversorgung und Kühlung eines Gehäuses limitieren, das nicht für acht Beschleuniger ausgelegt wurde.
Soll die KI für alle produktiv eingesetzt werden, ist ein GPU-Server für das Rack mit zwei Grafikkarten und der Option zur späteren Erweiterung die sinnvollste Wahl. Befindet sich das Projekt noch in der Testphase oder wird die KI nur von einem Team genutzt, genügt ein Desktop-Gerät der DGX-Spark-Klasse, gegebenenfalls zwei zu einem System zusammengeschaltete Geräte.
Ein Desktop-Gerät etwa 240 W. Ein GPU-Server für das Rack benötigt mit zwei Grafikkarten ab ca. 2 kW, mit acht Grafikkarten 5–6 kW, und eine HGX-Plattform B200 liegt bei etwa 10 kW. Berechnen Sie die Kosten anhand Ihres eigenen kWh-Tarifs und der geplanten Betriebszeit – bei Dauerbetrieb ist der Unterschied zwischen den Stufen um ein Vielfaches höher.
