Lokal zuerst. Ihre Daten bleiben lokal.
souveraen.ai läuft auf einer NVIDIA DGX Spark in Ihrem Serverraum. Externe Modelle nutzen Sie nur, wenn Sie es wollen, und Sie zahlen einen festen Monatspreis statt Tokens.
NVIDIA GB10 · 128 GB gemeinsamer Speicher · Daten lokal
Alles, was die KI braucht, liegt auf einem Gerät.
Ihre Datenquellen werden lokal gelesen, die Modelle rechnen lokal, und die Antworten bleiben lokal. Ein externes Modell kommt nur dazu, wenn Sie es zuschalten.
Modelle auf dem Gerät
Offene Modelle laufen auf der Appliance, ohne Schnittstelle zu einem Anbieter.
Wissen auf dem Gerät
Abschnitte, Suchindizes und Wissensgraph liegen auf derselben Appliance, mit Leserechten an jedem Abschnitt.
Werkzeuge im signierten Paket
Geprüfte MCP-Server kommen als signiertes Paket, zur Laufzeit wird nichts nachgeladen. Weitere Server fügen Admins oder, je nach Berechtigung, Nutzer hinzu.
Lokaler Betrieb auf DGX Spark oder als Air-Gap Enterprise.
Eine DGX Spark ist für eine Abteilung ausgelegt. Brauchen Sie mehr Rechenleistung, Ausfallsicherheit oder einen vollständig abgeschotteten Betrieb, legen wir die Hardware mit Ihnen aus.
Alle Preise netto zzgl. Umsatzsteuer. Was in Ihrem Angebot steht, gilt.
LOKALE GESCHWINDIGKEIT
So schnell antwortet ein Modell auf Ihrer Appliance.
Wählen Sie ein Modell. Die Antwort erscheint genau so schnell, wie dieses Modell auf einem DGX Spark Tokens erzeugt – gemessen für eine einzelne Anfrage.
Der Wartungsvertrag mit der Nordtech GmbH läuft seit dem 1. März 2025 und verlängert sich jeweils um zwölf Monate. Die wichtigsten Punkte: 1. Kündigung: drei Monate zum Ende der Laufzeit, schriftlich. 2. Reaktionszeit: vier Stunden an Werktagen, 24 Stunden am Wochenende. 3. Preis: 1.850 € netto im Monat, jährliche Anpassung um höchstens 3 %. 4. Haftung: begrenzt auf die Jahresvergütung, außer bei Vorsatz. Die nächste Kündigung ist zum 28. Februar 2027 möglich; die Frist dafür endet am 30. November 2026.
0 / 180
Tokens
36,8
Tokens pro Sekunde
0,0
Sekunden
Zum Vergleich: Beim stillen Lesen schaffen Erwachsene rund vier Wörter pro Sekunde.
Messwerte für eine Anfrage ohne Denkphase. Qwen 3.5: llama.cpp mit 4-Bit-Quantisierung (Q4_K_M), 512 erzeugte Tokens, veröffentlicht im Benchmark BAEM1N llm-bench (2026). gpt-oss-120b: eigene Messung mit vLLM und MXFP4 auf einem DGX Spark, ohne spekulatives Decoding. Optimierte Laufzeiten erreichen mehr, etwa rund 52 Tokens pro Sekunde für Qwen 3.5 122B-A10B mit spekulativem Decoding. Arbeiten mehrere Personen gleichzeitig, teilen sie sich die Leistung. Gemessen auf unserer Referenz-DGX in Auerbach. Die Werte gelten für Qwen 3.5; die aktuelle Generation im Katalog heißt Qwen3.6.
Im Preis enthalten
So groß wie ein dickes Buch. Eine Steckdose, ein Netzwerkkabel.
Die DGX Spark steht bei Ihnen im Serverraum oder unter dem Schreibtisch. Wir richten sie remote ein und schulen Ihr Team. Ihre Daten liegen auf dem Gerät; wie das Backup läuft, halten wir im Angebot fest.
Ob ein Gerät für Ihr Team reicht, sagt Ihnen Klaus Bauer: (03744) 365 2202.
0 h
Onboarding-Workshop, remote
0 Tage
bis zum Ersatzgerät, gerechnet in Werktagen
0 Monate
Laufzeit, monatlich abgerechnet
9 €
Tokenkosten für lokale Modelle
Was IT und Geschäftsführung vorher wissen wollen.
Zu Hardware, Netz und Betrieb.