Zum Inhalt springen
souveraen.ai
PRIVATE SPARK

Ihre KI lokal auf einer NVIDIA DGX Spark. Jetzt verfügbar.

Private Spark ist souveraen.ai auf einer NVIDIA DGX Spark, die lokal bei Ihnen steht. Darauf laufen die KI-Modelle, liegt Ihr Wissen und arbeiten Ihre Agenten. Für die Verwaltung besteht standardmäßig eine Verbindung zu souveraen.ai.

  • 2.790 € netto / Monat inkl. Spark DGX Hardware
  • Laufzeit: 24 Monate. Bei Vorabkauf der DGX sinken die monatlichen Kosten auf 2.490 € / Monat.

Datenquellen

  • Verträge
  • Handbücher
  • E-Mails

Lokales Modell

gpt-oss-120b

rund 35 Tokens/s

NVIDIA DGX Spark

128 GB gemeinsamer Speicher

  • Daten, Index und Modelle lokal
  • Verwaltung über souveraen.ai

LOKALE GESCHWINDIGKEIT

So schnell antwortet ein Modell auf Ihrer Appliance.

Wählen Sie ein Modell. Die Antwort erscheint genau so schnell, wie dieses Modell auf einem DGX Spark Tokens erzeugt – gemessen für eine einzelne Anfrage.

Modell
souveraen.ai · Qwen 3.5 9B
Sie
souveraen.ai

Der Wartungsvertrag mit der Nordtech GmbH läuft seit dem 1. März 2025 und verlängert sich jeweils um zwölf Monate. Die wichtigsten Punkte: 1. Kündigung: drei Monate zum Ende der Laufzeit, schriftlich. 2. Reaktionszeit: vier Stunden an Werktagen, 24 Stunden am Wochenende. 3. Preis: 1.850 € netto im Monat, jährliche Anpassung um höchstens 3 %. 4. Haftung: begrenzt auf die Jahresvergütung, außer bei Vorsatz. Die nächste Kündigung ist zum 28. Februar 2027 möglich; die Frist dafür endet am 30. November 2026.

0 / 180

Tokens

36,8

Tokens pro Sekunde

0,0

Sekunden

Zum Vergleich: Beim stillen Lesen schaffen Erwachsene rund vier Wörter pro Sekunde.

Messwerte für eine Anfrage ohne Denkphase. Qwen 3.5: llama.cpp mit 4-Bit-Quantisierung (Q4_K_M), 512 erzeugte Tokens, veröffentlicht im Benchmark BAEM1N llm-bench (2026). gpt-oss-120b: eigene Messung mit vLLM und MXFP4 auf einem DGX Spark, ohne spekulatives Decoding. Optimierte Laufzeiten erreichen mehr, etwa rund 52 Tokens pro Sekunde für Qwen 3.5 122B-A10B mit spekulativem Decoding. Arbeiten mehrere Personen gleichzeitig, teilen sie sich die Leistung. Gemessen auf unserer Referenz-DGX in Auerbach. Die Werte gelten für Qwen 3.5; die aktuelle Generation im Katalog heißt Qwen3.6.

KURZ ERKLÄRT

Was ist ein Token?

Sprachmodelle lesen und schreiben Text weder Buchstabe für Buchstabe noch Wort für Wort, sondern in Tokens: kurzen Textbausteinen aus einem festen Vokabular. Häufige Wörter sind ein einzelnes Token, seltene oder zusammengesetzte Wörter werden in mehrere Teile zerlegt.

Tokens pro Sekunde geben deshalb an, wie schnell ein Modell Text erzeugt. Entscheidend ist vor allem, wie viele Parameter es je Token aus dem Speicher lesen muss: Mixture-of-Experts-Modelle wie Qwen 3.5 35B-A3B nutzen je Token nur einen Teil ihrer Parameter und sind deshalb schneller als kleinere Modelle, die immer alle Parameter lesen.

So zerlegt ein Qwen-Modell das Wort „Wartungsvertrag“:

5 Tokens

Deutsche Texte brauchen mehr Tokens als englische: Die Beispielantwort oben hat 80 Wörter und 180 Tokens, die englische Version 91 Wörter und 140 Tokens.

Als Faustregel ist ein Modell ab etwa 10 Tokens pro Sekunde schneller, als Sie mitlesen können.

WAS IM PREIS ENTHALTEN IST

Was im Preis
enthalten ist.

  • Betrieb in Ihrer Infrastruktur, externe Modelle optional
  • Eine DGX Spark reicht für eine Abteilung, nicht für den ganzen Konzern
  • Onboarding-Workshop (4 h, remote) inklusive

Die DGX Spark ist etwa so groß wie ein dickes Buch, braucht eine Steckdose und ein Netzwerkkabel und steht bei Ihnen im Serverraum oder unterm Schreibtisch. Wir richten sie remote ein; der Onboarding-Workshop von 4 Stunden ist enthalten. Wenn etwas kaputtgeht, bekommen Sie innerhalb von fünf Werktagen ein Ersatzgerät. Ihre Daten liegen auf dem Gerät – ein Backup gehört dazu und wird im Angebot festgelegt. Sprechen Sie mit Klaus Bauer, (03744) 365 2202. Wir sagen Ihnen, ob eine DGX Spark für Ihr Team reicht.

Mit dem kostenlosen Plan anfangen

2.790 €

netto / Monat

inkl. Spark DGX Hardware

Laufzeit: 24 Monate

Bei Vorabkauf der DGX sinken die monatlichen Kosten auf 2.490 € / Monat

UNVERBINDLICHE ANGEBOTSÜBERSICHT

Private Spark

Die Übersicht hier bestellt nichts. Abschließen können Sie im Konto. Den konkreten Leistungsumfang halten wir im Angebot fest. 2.790 € netto / Monat inkl. Spark DGX Hardware. Bei Vorabkauf der DGX sinken die monatlichen Kosten auf 2.490 € / Monat. Laufzeit: 24 Monate. Monatlich abgerechnet.