Zum Inhalt springen
souveraen.ai
On-Premise · Private Spark

Lokal zuerst. Ihre Daten bleiben lokal.

souveraen.ai läuft auf einer NVIDIA DGX Spark in Ihrem Serverraum. Externe Modelle nutzen Sie nur, wenn Sie es wollen, und Sie zahlen einen festen Monatspreis statt Tokens.

NVIDIA GB10 · 128 GB gemeinsamer Speicher · Daten lokal

Lokal zuerst
Modelle, Wissen und Agenten laufen lokal auf der Appliance. Für die Verwaltung besteht eine Verbindung zu souveraen.ai.
Externe Modelle optional
Größere Modelle externer Anbieter sind optional zuschaltbar, mit Tokenkosten des jeweiligen Anbieters.
Datenschutz im Gerät
Ihr Dokumentenbestand bleibt lokal, auch nicht bei einem zugeschalteten externen Modell.
Keine Tokenkosten
Fester Monatspreis ab 2.490 €. Lokale Anfragen kosten nichts extra, egal wie viel Ihr Team fragt.
Was lokal bleibt

Alles, was die KI braucht, liegt auf einem Gerät.

Ihre Datenquellen werden lokal gelesen, die Modelle rechnen lokal, und die Antworten bleiben lokal. Ein externes Modell kommt nur dazu, wenn Sie es zuschalten.

Externe ModelleOptional zuschaltbar, mit Tokenkosten
Fileserver
SharePoint
DGX Spark · Ihr Haus
Nextcloud
Confluence

Modelle auf dem Gerät

Offene Modelle laufen auf der Appliance, ohne Schnittstelle zu einem Anbieter.

Qwen3.6gpt-oss-120bMistral Small 4

Wissen auf dem Gerät

Abschnitte, Suchindizes und Wissensgraph liegen auf derselben Appliance, mit Leserechten an jedem Abschnitt.

StichwortindexVektorindexWissensgraph

Werkzeuge im signierten Paket

Geprüfte MCP-Server kommen als signiertes Paket, zur Laufzeit wird nichts nachgeladen. Weitere Server fügen Admins oder, je nach Berechtigung, Nutzer hinzu.

SigniertGeprüftOhne Nachladen
Private Spark und Enterprise

Lokaler Betrieb auf DGX Spark oder als Air-Gap Enterprise.

Eine DGX Spark ist für eine Abteilung ausgelegt. Brauchen Sie mehr Rechenleistung, Ausfallsicherheit oder einen vollständig abgeschotteten Betrieb, legen wir die Hardware mit Ihnen aus.

Private Spark

Am häufigsten

DGX Spark inklusive, für eine Abteilung.

2.790 €netto / Monat

inkl. Spark DGX Hardware · Laufzeit: 24 Monate

Angebot anfragen

Enthalten

Betrieb in Ihrer Infrastruktur, externe Modelle optional

DGX Spark im Preis enthalten

Onboarding-Workshop (4 h, remote)

Ersatzgerät innerhalb von fünf Werktagen

Private Spark

DGX Spark vorab gekauft, niedrigere Monatsrate.

2.490 €netto / Monat

zzgl. Spark DGX Hardware · Laufzeit: 24 Monate

Angebot anfragen

Enthalten

Gleiche Software, gleicher Funktionsumfang

DGX Spark einmalig vorab gekauft

Onboarding-Workshop (4 h, remote)

Laufzeit 24 Monate

Air-Gap Enterprise

Vollständig abgeschottet, Hardware nach Bedarf.

Nach Angebot
Gespräch vereinbaren

Enthalten

Keine Verbindung nach außen

Hardware nach Kapazität und Verfügbarkeit ausgelegt

Anbindung an Ihre bestehenden Systeme

Abnahme und Übergabe nach Ihren Vorgaben

Alle Preise netto zzgl. Umsatzsteuer. Was in Ihrem Angebot steht, gilt.

LOKALE GESCHWINDIGKEIT

So schnell antwortet ein Modell auf Ihrer Appliance.

Wählen Sie ein Modell. Die Antwort erscheint genau so schnell, wie dieses Modell auf einem DGX Spark Tokens erzeugt – gemessen für eine einzelne Anfrage.

Modell
souveraen.ai · Qwen 3.5 9B
Sie
souveraen.ai

Der Wartungsvertrag mit der Nordtech GmbH läuft seit dem 1. März 2025 und verlängert sich jeweils um zwölf Monate. Die wichtigsten Punkte: 1. Kündigung: drei Monate zum Ende der Laufzeit, schriftlich. 2. Reaktionszeit: vier Stunden an Werktagen, 24 Stunden am Wochenende. 3. Preis: 1.850 € netto im Monat, jährliche Anpassung um höchstens 3 %. 4. Haftung: begrenzt auf die Jahresvergütung, außer bei Vorsatz. Die nächste Kündigung ist zum 28. Februar 2027 möglich; die Frist dafür endet am 30. November 2026.

0 / 180

Tokens

36,8

Tokens pro Sekunde

0,0

Sekunden

Zum Vergleich: Beim stillen Lesen schaffen Erwachsene rund vier Wörter pro Sekunde.

Messwerte für eine Anfrage ohne Denkphase. Qwen 3.5: llama.cpp mit 4-Bit-Quantisierung (Q4_K_M), 512 erzeugte Tokens, veröffentlicht im Benchmark BAEM1N llm-bench (2026). gpt-oss-120b: eigene Messung mit vLLM und MXFP4 auf einem DGX Spark, ohne spekulatives Decoding. Optimierte Laufzeiten erreichen mehr, etwa rund 52 Tokens pro Sekunde für Qwen 3.5 122B-A10B mit spekulativem Decoding. Arbeiten mehrere Personen gleichzeitig, teilen sie sich die Leistung. Gemessen auf unserer Referenz-DGX in Auerbach. Die Werte gelten für Qwen 3.5; die aktuelle Generation im Katalog heißt Qwen3.6.

Im Preis enthalten

So groß wie ein dickes Buch. Eine Steckdose, ein Netzwerkkabel.

Die DGX Spark steht bei Ihnen im Serverraum oder unter dem Schreibtisch. Wir richten sie remote ein und schulen Ihr Team. Ihre Daten liegen auf dem Gerät; wie das Backup läuft, halten wir im Angebot fest.

Ob ein Gerät für Ihr Team reicht, sagt Ihnen Klaus Bauer: (03744) 365 2202.

0 h

Onboarding-Workshop, remote

0 Tage

bis zum Ersatzgerät, gerechnet in Werktagen

0 Monate

Laufzeit, monatlich abgerechnet

9 €

Tokenkosten für lokale Modelle

Fragen

Was IT und Geschäftsführung vorher wissen wollen.

Zu Hardware, Netz und Betrieb.

Eine DGX Spark ist für eine Abteilung ausgelegt, nicht für einen ganzen Konzern. Arbeiten mehrere Personen gleichzeitig, teilen sie sich die Leistung. Ob ein Gerät reicht oder Air-Gap Enterprise besser passt, klären wir vorher mit Ihnen.

Lokaler Betrieb

Sprechen Sie mit uns über Ihren Serverraum.

Sagen Sie uns, wie viele Personen arbeiten und welche Datenquellen angebunden werden sollen. Sie bekommen ein Angebot mit Hardware, Modellen und Einrichtung.

  1. Bedarf klären1
  2. Angebot erhalten2
  3. Appliance einrichten3