Zum Inhalt springen
souveraen.ai
Modelle

Welche KI-Modelle bei Ihnen laufen.

Auf der Appliance laufen Open-Weight-Modelle wie Qwen, Mistral und gpt-oss lokal, Ihre Daten bleiben auf dem Gerät. Im Hosting in Deutschland stehen zusätzlich größere Open-Weight-Modelle zur Verfügung. Externe Modelle stehen in On Demand je nach Plan zur Verfügung und werden in EU- und Zero-Data-Retention-Mandanten der Anbieter verarbeitet.

  • Lokal oder offline mit Air-Gap
  • Open-Weight-Modelle als Standard
  • Eine Schnittstelle für alle Aufgaben

Modellkatalog

Ab Werk auf der Appliance

22

  • Mistral Small 4

    Mistral AI

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Ministral 3 8B

    Mistral AI

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Devstral Small 2

    Mistral AI

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    CodeLokal verfügbar
  • Magistral Small 1.2

    Mistral AI

    Kontextfenster
    128.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Qwen3.6-35B-A3B

    Qwen (Alibaba)

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Qwen3.6-27B

    Qwen (Alibaba)

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Qwen3-Coder-30B-A3B

    Qwen (Alibaba)

    Kontextfenster
    262.144 Tokens
    Max. Ausgabe
    –
    CodeLokal verfügbar
  • Qwen3-30B-A3B-2507

    Qwen (Alibaba)

    Kontextfenster
    262.144 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Qwen3-14B

    Qwen (Alibaba)

    Kontextfenster
    32.768 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Qwen3-8B

    Qwen (Alibaba)

    Kontextfenster
    32.768 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Qwen3 Embedding 8B

    Qwen (Alibaba)

    Kontextfenster
    –
    Max. Ausgabe
    –
    EinbettungLokal verfügbar
  • Gemma 4

    Google

    Kontextfenster
    128.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Gemma 3 27B

    Google

    Kontextfenster
    128.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • gpt-oss-120b

    OpenAI

    Kontextfenster
    131.072 Tokens
    Max. Ausgabe
    131.072 Tokens
    ChatLokal verfügbar
  • gpt-oss-20b

    OpenAI

    Kontextfenster
    131.072 Tokens
    Max. Ausgabe
    131.072 Tokens
    ChatLokal verfügbar
  • Llama 4 Scout

    Meta

    Kontextfenster
    10.000.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Llama 3.3 70B

    Meta

    Kontextfenster
    128.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Llama 3.1 8B

    Meta

    Kontextfenster
    128.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Phi-4

    Microsoft

    Kontextfenster
    16.384 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Phi-4-reasoning-plus

    Microsoft

    Kontextfenster
    32.768 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Llama 3.3 Nemotron Super 49B

    NVIDIA

    Kontextfenster
    128.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar
  • Nemotron Nano 9B v2

    NVIDIA

    Kontextfenster
    128.000 Tokens
    Max. Ausgabe
    –
    ChatLokal verfügbar

Zusätzlich im Hosting in Deutschland

4

  • Mistral Large 3

    Mistral AI

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    ChatEU-gehostet
  • Mistral Medium 3.5

    Mistral AI

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    ChatEU-gehostet
  • Codestral

    Mistral AI

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    CodeEU-gehostet
  • Mistral Embed

    Mistral AI

    Kontextfenster
    –
    Max. Ausgabe
    –
    EinbettungEU-gehostet

Externe Modelle

25

Verfügbar in On Demand, über das KI-Guthaben. Bei On-Premise-Installationen optional zuschaltbar, mit Tokenkosten des jeweiligen Anbieters. Nicht bei Air-Gap Enterprise.

  • DeepSeek V4-Pro

    DeepSeek

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    –
    ChatExtern · EU/ZDR
  • DeepSeek V4-Flash

    DeepSeek

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    –
    ChatExtern · EU/ZDR
  • Claude Fable 5.1

    Anthropic

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • Claude Fable 5

    Anthropic

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • Claude Opus 5.5

    Anthropic

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • Claude Opus 5

    Anthropic

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • Claude Opus 4.8

    Anthropic

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • Claude Sonnet 5

    Anthropic

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • Claude Haiku 4.5

    Anthropic

    Kontextfenster
    200.000 Tokens
    Max. Ausgabe
    64.000 Tokens
    ChatExtern · EU/ZDR
  • Gemini 3.1 Pro

    Google

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    64.000 Tokens
    ChatExtern · EU/ZDR
  • Gemini 3.5 Flash

    Google

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    64.000 Tokens
    ChatExtern · EU/ZDR
  • Gemini 3.1 Flash-Lite

    Google

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    64.000 Tokens
    ChatExtern · EU/ZDR
  • Gemini Embedding 2

    Google

    Kontextfenster
    –
    Max. Ausgabe
    –
    EinbettungExtern · EU/ZDR
  • GPT-5.6 Sol

    OpenAI

    Kontextfenster
    1.050.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • GPT-5.6 Terra

    OpenAI

    Kontextfenster
    1.050.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • GPT-5.6 Luna

    OpenAI

    Kontextfenster
    1.050.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • GPT-5.5

    OpenAI

    Kontextfenster
    1.050.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • GPT-5.4

    OpenAI

    Kontextfenster
    1.050.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • GPT-5.4 mini

    OpenAI

    Kontextfenster
    400.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • GPT-5.1

    OpenAI

    Kontextfenster
    400.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • GPT-5

    OpenAI

    Kontextfenster
    400.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • GPT Image 2

    OpenAI

    Kontextfenster
    –
    Max. Ausgabe
    –
    BildExtern · EU/ZDR
  • GLM-5.2

    Z.ai (GLM)

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    128.000 Tokens
    ChatExtern · EU/ZDR
  • Kimi K2.6

    Moonshot AI (Kimi)

    Kontextfenster
    256.000 Tokens
    Max. Ausgabe
    –
    ChatExtern · EU/ZDR
  • MiniMax-M3

    MiniMax

    Kontextfenster
    1.000.000 Tokens
    Max. Ausgabe
    –
    ChatExtern · EU/ZDR

51 von 51 Modellen

Ab Werk laufen Open-Weight-Modelle auf der Appliance und in On Demand. Größere Open-Weight-Modelle gibt es zusätzlich im Hosting in Deutschland. Externe Modelle von OpenAI, Anthropic, Google, DeepSeek und weiteren Anbietern sind in On Demand über das KI-Guthaben verfügbar und On-Premise optional zuschaltbar, dort mit Tokenkosten des jeweiligen Anbieters. Externe Modelle werden in EU- und Zero-Data-Retention-Mandanten der Anbieter verarbeitet.

Fehlt ein Modell?

Weitere Open-Weight-Modelle nehmen wir nach einer Lizenz- und Qualitätsprüfung in Ihr Modellprofil auf. Nennen Sie uns das gewünschte Modell.

Modell anfragen
Modellbetrieb

Wie Modelle bei souveraen.ai betrieben werden.

Feste Modellversionen, Modell und Verarbeitungsort zu jeder Antwort, Updates nur nach Ihrer Freigabe.

Modellauswahl je Aufgabe

Modelle für Chat, Code, Einbettung und Bild. Open-Weight-Modelle und, in On Demand, externe Modelle in EU- und ZDR-Mandanten.

Modell und Verarbeitungsort je Antwort

Zu jeder Antwort werden das verwendete Modell und der Ort der Verarbeitung angezeigt.

Modell-Updates nur nach Freigabe

Neue Modellversionen werden erst eingespielt, wenn Sie das Update freigeben.

Betriebsarten

Betriebsart und verfügbare Modelle

Die Betriebsart legt fest, wo Ihre Anfragen verarbeitet werden und welche Modelle zur Verfügung stehen. Deshalb wählen Sie zuerst die Betriebsart und danach die Modelle.

Lokal auf der Appliance

Open-Weight-Modelle wie Qwen3.6, Mistral Small 4, Gemma 4, Llama und gpt-oss laufen lokal auf der DGX-Appliance in Ihrem Unternehmen. Externe Modelle sind optional zuschaltbar, mit Tokenkosten des jeweiligen Anbieters.

  • Daten bleiben lokal
  • Lokale Modelle ohne Tokenkosten
  • Fester monatlicher Preis
Private Spark ansehen

On Demand

Dieselbe Software wie auf der Appliance, betrieben in Rechenzentren in Deutschland. Wir schließen mit Ihnen einen Vertrag zur Auftragsverarbeitung nach DSGVO. Für Vertrag und Betrieb gilt deutsches und europäisches Recht. Externe Modelle werden hier in EU- und Zero-Data-Retention-Mandanten der Anbieter verarbeitet.

  • Auftragsverarbeitung nach DSGVO
  • Getrennter Mandant
  • Kostenlos starten
Pläne und Preise

Externe Modelle

In On Demand stehen Modelle von OpenAI, Anthropic, Google und weiteren Anbietern je nach Plan zur Verfügung. Sie werden in EU- und Zero-Data-Retention-Mandanten der Anbieter verarbeitet. Bei Private Spark sind sie optional zuschaltbar.

  • In EU- und ZDR-Mandanten der Anbieter
  • On-Premise optional, mit Tokenkosten
  • Nicht bei Air-Gap Enterprise
Einsatz besprechen
Häufige Fragen

Fragen zur Modellauswahl

Was Geschäftsführung, IT und Datenschutz vor dem Start wissen wollen.

Lieber persönlich sprechen?

Wir klären Einsatzfall, Datenschutz und Betriebsart in einem kurzen Gespräch, ohne Verkaufsdruck. Telefon (03744) 365 2202.

Beratung anfragen

Das legen Sie fest. Auf der Appliance läuft ein Open-Weight-Modell wie Qwen3.6 oder gpt-oss-120b. Die Auswahl richtet sich nach Ihren Aufgaben und der Zahl gleichzeitiger Nutzer und wird im Angebot festgehalten. Im Hosting in Deutschland stehen zusätzlich größere Open-Weight-Modelle zur Verfügung. In On Demand kommen je nach Plan externe Modelle in EU- und ZDR-Mandanten der Anbieter hinzu.

Modellprofil

Modellauswahl für Ihre Appliance

Nennen Sie uns Ihre Aufgaben und die Zahl gleichzeitiger Nutzer. Wir schlagen ein passendes Modellprofil vor und halten es im Angebot fest.

  1. Aufgaben und Nutzerzahl nennen1
  2. Modellprofil erhalten2
  3. Im Angebot festhalten3