NachrichtenRechnerFallbeispiele
← Zur Portalübersicht

FALLBEISPIEL / KI-HARDWARE UND STROMKOSTEN

Dritte RTX 3090: Wann lohnt sie sich bei 5 ct/kWh?

Günstiger Strom macht eine zusätzliche Grafikkarte leichter tragbar. Wirtschaftlich sinnvoll wird sie aber erst, wenn genug zusätzlicher nutzbarer Output entsteht. Mit 1.500 Euro Mehrkosten braucht der Dreikarten-PC in dieser Rechnung rund 25 bis 30 Prozent mehr Durchsatz als das Zweikartensystem.

Solarbefund · KI-gestützte Redaktion · Aktualisiert

Die Ausgangslage: Eine Karte kostet mehr als ihren Strom

Ausgangspunkt ist ein PC mit zwei RTX 3090 für insgesamt 7.000 Euro. Für eine zusätzliche gebrauchte Karte setzen wir 1.500 Euro an; das entspricht einem am 7. Oktober 2026 abgerufenen Einzelangebot. Das Dreikartensystem kostet damit zunächst 8.500 Euro. Dieser Betrag enthält keine zusätzlich erforderlichen Umbauten an Netzteil, Mainboard, Gehäuse oder Kühlung. Wir verteilen die Anschaffung auf zehn Jahre, setzen den Restwert auf null und rechnen mit 5 ct/kWh. Für zwei Karten nehmen wir 600 Watt Gesamtverbrauch an, für drei Karten 900 Watt. Die 300 Watt Differenz kosten dann nur 1,5 Cent je aktiver Stunde: 131,40 Euro pro Jahr bei täglichem Dauerbetrieb oder 43,80 Euro bei acht Stunden täglich. Das sind Rechenwerte aus der angenommenen Leistungsaufnahme, keine Messwerte dieses Aufbaus.

Mehr Grafikkarten garantieren keinen linearen Geschwindigkeitsgewinn

Ein kontrollierter Nutzerbericht zu Qwen3.8-27B vergleicht eine und zwei RTX 3090. Dort beträgt der Geschwindigkeitsgewinn der zweiten Karte je nach Konfiguration ungefähr 16 bis 35 Prozent. Daraus lässt sich kein gesicherter Dreikartenwert ableiten. Kommunikation zwischen Karten, Modellaufteilung, Software und Speichernutzung beeinflussen das Ergebnis. Zudem können Karten unterschiedliche Aufgaben übernehmen: Sie können gemeinsam ein Modell ausführen oder getrennte Modellinstanzen für unabhängige Jobs betreiben. Die vLLM-Dokumentation behandelt dafür unterschiedliche Parallelisierungsverfahren. Vor dem Kauf muss feststehen, welche Betriebsart zum gewünschten Modell, zu dessen Quantisierung und zum verwendeten Rechner passt.

Was 140, 175 oder 210 Tokens pro Sekunde kosten würden

Für die Vergleichsrechnung liefert das Zweikartensystem 140 Output-Tokens pro Sekunde. Beim Dreikartensystem betrachten wir unveränderten Durchsatz, 25 Prozent Mehrleistung und 50 Prozent Mehrleistung. Die drei Varianten sind ausdrücklich Rechenszenarien. Für einen gemeinsam über drei GPUs laufenden Qwen-Aufbau wurde hier kein Benchmark durchgeführt. DGX Spark, 60 Tokens/s: 24 Stunden täglich: 0,40 Euro; 8 Stunden täglich: 1,14 Euro; 2 Stunden täglich: 4,47 Euro. Zwei RTX 3090, 140 Tokens/s: 24 Stunden täglich: 0,22 Euro; 8 Stunden täglich: 0,54 Euro; 2 Stunden täglich: 1,96 Euro. Drei RTX 3090, 140 Tokens/s: 24 Stunden täglich: 0,28 Euro; 8 Stunden täglich: 0,67 Euro; 2 Stunden täglich: 2,40 Euro. Drei RTX 3090, 175 Tokens/s: 24 Stunden täglich: 0,23 Euro; 8 Stunden täglich: 0,53 Euro; 2 Stunden täglich: 1,92 Euro. Drei RTX 3090, 210 Tokens/s: 24 Stunden täglich: 0,19 Euro; 8 Stunden täglich: 0,44 Euro; 2 Stunden täglich: 1,60 Euro. Alle Werte sind Euro je Million Output-Tokens einschließlich Anschaffung und Strom. Außerhalb der produktiven Stunden sind die Rechner ausgeschaltet. Der Spark dient mit den im Grundlagenartikel angesetzten 7.000 Euro, 60 Tokens/s und 150 Watt als zusätzliche Referenz.

Die wirtschaftliche Schwelle liegt bei etwa 25 bis 30 Prozent

Im Dauerbetrieb muss das Dreikartensystem mindestens rund 181 statt 140 Output-Tokens pro Sekunde liefern, um bei den Kosten pro Token mit zwei Karten gleichzuziehen. Das entspricht rund 29 Prozent Mehrleistung. Bei acht Stunden täglich liegt die Schwelle bei etwa 175 Tokens/s und rund 25 Prozent. Bei zwei Stunden täglich sind es etwa 172 Tokens/s und rund 23 Prozent. Der unterschiedliche Bedarf entsteht aus dem Verhältnis von Anschaffungs- und Stromkosten. Für die dritte Karte steigt der Kaufpreis um rund 21 Prozent; die angenommene Leistungsaufnahme wächst um 50 Prozent. Ein tatsächlicher Zuwachs von 50 Prozent auf 210 Tokens/s würde die Tokenkosten im Dauerbetrieb von etwa 0,22 auf 0,19 Euro senken. Ohne Mehrleistung steigen sie dagegen auf etwa 0,28 Euro.

Zusätzliche unabhängige Jobs können der bessere Einsatz sein

Wenn das gewünschte quantisierte Modell einschließlich Kontext und Arbeitsdaten auf eine einzelne 24-GB-Karte passt, kann die dritte GPU einen zusätzlichen Worker übernehmen. Damit wird mehr unabhängige Arbeit gleichzeitig erledigt. Die Antwort eines einzelnen Jobs wird dadurch nicht automatisch schneller. Der erwähnte Messbericht belegt einen Betrieb des dortigen quantisierten Modells auf einer einzelnen 3090. Für diese Betriebsart muss der gesamte Output aller gleichzeitig laufenden Jobs gemessen werden. Ein fairer Vergleich nutzt auch die beiden vorhandenen Karten sinnvoll für dieselbe Art Arbeit. Die Werte für einen einzelnen Job über zwei Karten dürfen nicht ohne Erklärung mit dem aufsummierten Durchsatz mehrerer unabhängiger Instanzen verglichen werden.

Parallele Jobs verschlechtern die Qualität nicht automatisch

Mehrere Anfragen allein bedeuten keine zwangsläufig schlechteren Antworten. Entscheidend sind derselbe Modellstand, dieselbe Präzision und ein ausreichender Kontext. Die vLLM-Dokumentation zeigt allerdings, dass Batchgröße und Ausführungsreihenfolge numerische Unterschiede verursachen können. Wortgleiche Antworten sind daher ohne passende deterministische Ausführung nicht garantiert. Wenn zusätzliche Jobs eine niedrigere Präzision, kürzere Kontexte oder das Abschneiden von Eingaben erzwingen, kann das die Ergebnisse verändern. Für die Wirtschaftlichkeit zählen dann nur Antworten, die den Qualitätsmaßstab der Aufgabe erreichen. Bloß mehr erzeugte Tokens verbessern die Kosten brauchbarer Ergebnisse nicht zwangsläufig.

Vor dem Einbau sind Rechner und Eigenstrom zu prüfen

Drei große Grafikkarten brauchen geeignete Steckplätze, ausreichend Platz und Kühlung sowie passende Stromversorgung. Die Zahl physisch langer Steckplätze sagt allein noch nicht, wie schnell die Karten angebunden sind. Ein notwendiger Plattformwechsel erhöht die 8.500-Euro-Annahme und damit den erforderlichen Geschwindigkeitsgewinn. Bei einem Budget von 9.000 statt 8.500 Euro würde die Schwelle im Dauerbetrieb beispielsweise auf rund 189 Tokens/s steigen. Auch 5 ct/kWh müssen über die tatsächlichen Betriebsstunden erreichbar sein. Wenn günstiger Eigenstrom nur tagsüber vorhanden ist, sollten zusätzliche Jobs in dieses Zeitfenster gelegt und nächtlicher Netzbezug separat eingerechnet werden. Ein gemessener Durchschnittspreis und der gesamte Rechnerverbrauch sind für die Entscheidung nützlicher als eine pauschale GPU-Nennleistung.

Die Entscheidung aus einer Messung ableiten

Die dritte Karte rechnet sich in dieser Beispielrechnung, wenn sie den produktiven Gesamtdurchsatz ausreichend anhebt und keine großen Umbaukosten auslöst. Dafür sollte zuerst eine repräsentative Jobliste feststehen: gleiche Modellpräzision, vergleichbare Prompt- und Ausgabelängen und eine überprüfbare Ergebnisqualität. Gemessen werden Zeit, Output und Kilowattstunden für dieselbe Jobliste. Den Grundlagenvergleich samt Formel, Strompreisen von 35, 10 und 5 ct/kWh sowie den Auswirkungen der Auslastung enthält der Artikel „DGX Spark oder RTX 3090: Was kostet lokale KI?“.

Quellen

HyperQwen, Messbericht eines Nutzers ↗ · abgerufen 2026-10-07

eBay, privates Verkäuferangebot ↗ · abgerufen 2026-10-07

vLLM ↗ · abgerufen 2026-10-07

vLLM ↗ · abgerufen 2026-10-07

Solarbefund – offengelegte redaktionelle Beispielrechnung ↗ · abgerufen 2026-10-07

So prüfen wir Meldungen · Keine eigenen Produkttests.