Zum Inhalt springen

Lokale Modelle

Modelle nutzen,
ohne Daten
herauszugeben.

souveraen.ai betreibt seine Sprachmodelle vollständig auf Ihrer eigenen Hardware: offene Gewichte, festgeschriebene Versionen, keine externe Modell-API. Keine Eingabe und kein Dokument verlässt Ihr Haus.

  • Modelle mit offenen Gewichten
  • Keine externe Modell-API
  • Fester monatlicher Preis
Modelle mit offenen Gewichten liegen verschlossen in einer Appliance im eigenen Haus; kein Weg führt nach außen

So kommt ein Modell auf die Appliance

Von der Auswahl
bis zum ersten Arbeitstag.

Kein Modell wird aus dem Internet nachgeladen. Jedes durchläuft zuvor denselben Weg.

Welche Modelle das sind
  1. 1

    Auswahl

    Nur Modelle mit offenen Gewichten und einer Lizenz, die kommerzielle Nutzung erlaubt.

  2. 2

    Qualifizierung

    Qualität, Geschwindigkeit und Speicherbedarf werden auf der Referenz-Appliance gemessen.

  3. 3

    Festschreiben

    Version und Revision werden festgehalten. Es läuft genau der geprüfte Stand.

  4. 4

    Auslieferung

    Modellstände kommen als geprüfte Pakete auf die Appliance, auch ohne Internetzugang.

  5. 5

    Betrieb

    Die Vermittlungsschicht ordnet jede Aufgabe dem passenden Modell zu und protokolliert den Aufruf.

Eine neue Modellversion ersetzt den alten Stand erst, nachdem sie denselben Weg durchlaufen hat. Ein automatisches Nachladen zur Laufzeit gibt es nicht.

Warum lokale Modelle

Was Sie davon haben, wenn das Modell im Haus steht.

Die Gewichte liegen offen, die Versionen sind festgeschrieben, und die Rechnung hängt nicht an der Zahl Ihrer Anfragen.

Betriebsmodelle und Preise vergleichen

Datensouveränität

Alle Modelle laufen auf der Appliance in Ihrem Haus. Ohne externe Modell-API verlässt keine Eingabe und kein Dokument Ihr Netz.

Unter Ihrer Kontrolle

Jede Modellversion ist festgeschrieben und geprüft ausgeliefert. Was heute antwortet, antwortet morgen genauso, bis Sie ein Update freigeben.

Planbare Kosten

Ein fester monatlicher Preis statt Abrechnung je Token. Intensive Nutzung macht die Plattform nicht teurer.

Betrieb ohne Internet

Im Air-Gap-Betrieb arbeitet die Plattform vollständig ohne Internetverbindung. Updates kommen als geprüfte Offline-Pakete.

Ein Zugang, mehrere Modelle

Ihre Anwendungen wählen kein Modell aus.

Anwendungen sprechen eine stabile Schnittstelle an. Dahinter ordnet die Vermittlungsschicht jede Aufgabe dem festgeschriebenen Modell zu. Chat, Suche, Nachsortierung und Schutzprüfung laufen getrennt, aber auf derselben Appliance.

  • Stabile Schnittstelle
  • Zuordnung konfiguriert
  • Je Anfrage protokolliert
Chat, Suche und Schutzprüfung laufen über eine gemeinsame Vermittlungsschicht auf mehrere festgeschriebene Modelle innerhalb einer abgeschlossenen Appliance

Modelle auf der Appliance

Jede Aufgabe hat ihr festes Modell.

Jedes Modell hat eine klar umrissene Aufgabe und eine Lizenz, die kommerzielle Nutzung erlaubt. Alle Modelle liegen auf der Appliance in Ihrem Haus.

ModellAufgabeLizenz
Qwen3-8BChat und Schlussfolgern im Profil Appliance/Standard; zusätzlich Umformulierung und Klassifikation.Apache-2.0
Qwen3-32B (FP8)Chat im Qualitätsprofil: höhere Antwortqualität bei weniger gleichzeitigen Nutzern. Das Profil geben wir gemeinsam für Ihre Installation frei.Apache-2.0
BGE-M3Einbettungen für die Vektorsuche im Hybrid-Index.MIT
BGE Reranker v2-M3Lokale Nachsortierung der Fundstellen, bevor eine Antwort entsteht.MIT
Qwen3-0.6B (GGUF)Schutzprüfungen und kurze Klassifikation als eigener CPU-Prozess neben dem Chatmodell.Apache-2.0
Weitere offene ModelleZum Beispiel europäische Modelle für Ausschreibungen: Lizenz und Qualität prüfen wir und nehmen das Modell in Ihr Profil auf.je Modell
  • Jedes Modell ist auf der Referenz-Appliance qualifiziert, gemessen und als geprüftes Paket ausgeliefert.
  • Welches Profil in Ihrer Installation aktiv ist, geben wir gemeinsam frei; die Zuordnung von Aufgabe zu Modell bleibt dokumentiert.
  • Lizenz, Qualität und Aufwand weiterer offener Modelle bestätigen wir im Angebot.

Die konkrete Modellausstattung hängt vom gewählten Profil ab. Welche Modelle auf Ihrer Appliance liegen, halten wir im Angebot fest.

Profile und Aufgabenklassen

Welches Profil für welche Aufgabe.

Die Zuordnung von Aufgabe zu Modell ist konfiguriert und je Anfrage nachvollziehbar. Welches Profil in Ihrer Installation arbeitet, entscheidet, wie viele Personen gleichzeitig antworten lassen.

ProfilModell im ChatWorauf es ausgelegt ist
Profil Appliance/StandardQwen3-8BChat und Schlussfolgern für viele gleichzeitige Nutzer. Dieses Profil läuft auf der Referenz-Appliance.
QualitätsprofilQwen3-32B in FP8-QuantisierungHöhere Antwortqualität für weniger gleichzeitige Nutzer. Welches Profil passt, klären wir im Angebot.

Was auf Ihrer Appliance arbeitet

Antworten mit Belegen

Im Profil Appliance/Standard beantwortet Qwen3-8B Chat und Schlussfolgern, mit Belegen aus Ihren Quellen.

  • Qwen3-8B
  • Chat
  • Schlussfolgern

Suche und Nachsortierung

BGE-M3 und der BGE-Reranker tragen Vektorsuche und Nachsortierung der Fundstellen im Hybrid-Index.

  • BGE-M3
  • BGE Reranker v2-M3

Getrennte Schutzprüfung

Ein eigener CPU-Prozess prüft Eingaben getrennt vom Chatmodell, ohne Rechenzeit auf der GPU zu binden.

  • Qwen3-0.6B
  • Eigener CPU-Prozess

Aufgabenklassen getrennt geführt

Chat, Schlussfolgern, Klassifikation, Umformulierung und Schutzprüfung werden getrennt geführt. Modell und Version werden je Anfrage protokolliert.

  • Konfiguriert
  • Je Anfrage protokolliert

Offene Gewichte, geprüfte Lizenz

Weitere Modelle mit offenen Gewichten nehmen wir nach Lizenz- und Qualitätsprüfung in Ihr Profil auf, darunter europäische Modelle für Ausschreibungen.

  • Lizenzprüfung
  • Europäische Modelle

Jede Aufgabe im Haus

Auch Aufgaben wie Transkription und Übersetzung laufen auf derselben Appliance. Es gibt keinen Weg zu einem externen Dienst.

  • Transkription
  • Übersetzung

Ein abgestimmter Modellsatz trägt Antwort, Suche, Nachsortierung und Schutzprüfung. Welche Modelle auf Ihrer Appliance liegen, halten wir im Angebot fest.

Die Hardware

NVIDIA DGX Spark, die Recheneinheit im Haus.

Private Spark liefert die Plattform auf einer kompakten Recheneinheit, die in Ihr Haus zieht. Ein eigenes Rechenzentrum brauchen Sie dafür nicht.

Private Spark im Detail
NVIDIA DGX Spark, die Recheneinheit von Private Spark
NVIDIA DGX Spark – die Recheneinheit von Private Spark.
  • NVIDIA GB10 (Grace Blackwell) mit 128 GB gemeinsamem Speicher für CPU und GPU, genug für Chatmodell, Einbettungen und Nachsortierung gleichzeitig.
  • Kompaktes Gerät für Büro oder Serverraum. Der Anschluss erfolgt in Ihrem Netz, hinter Ihrer Firewall.
  • Für höhere Anforderungen oder vollständig getrennte Netze dimensionieren wir Air-Gap Enterprise nach Angebot.

Häufige Fragen

Woran Häuser vor dem Kauf am häufigsten hängen bleiben.

Welches Modell beantwortet unsere Fragen?

Im Profil Appliance/Standard ist das Qwen3-8B, ein Modell mit offenen Gewichten unter Apache-2.0-Lizenz. Das Qualitätsprofil setzt auf Qwen3-32B in FP8-Quantisierung. Welche Modelle auf Ihrer Appliance liegen, hängt vom Profil ab und wird im Angebot festgehalten.

Werden unsere Daten zum Training der Modelle verwendet?

Nein. Die Modelle laufen als festgeschriebene Versionen und werden mit Ihren Inhalten nicht nachtrainiert. Was die Plattform aus Ihren Dokumenten lernt, liegt als belegtes Wissen in Ihrer Wissensschicht, nicht in Modellgewichten; dieses Wissen ist prüfbar und löschbar.

Brauchen die Modelle eine Internetverbindung?

Nein. Alle Modelle liegen vollständig auf der Appliance. Im Air-Gap-Betrieb arbeitet die Plattform ohne jede Internetverbindung; Updates kommen als geprüfte Offline-Pakete.

Was kostet uns eine einzelne Anfrage?

Nichts zusätzlich. Es gibt keine Abrechnung je Token: Sie zahlen einen festen monatlichen Preis für die Appliance, unabhängig davon, wie intensiv Ihr Team arbeitet.

Wie kommen neue Modellversionen auf die Appliance?

Als geprüfte Pakete. Eine neue Version durchläuft dieselbe Qualifizierung wie das erste Modell, wird festgeschrieben und ersetzt den alten Stand erst nach der Auslieferung. Ein automatisches Nachladen aus dem Internet gibt es nicht.

Können wir zusätzlich ein externes Modell anbinden?

Auf Private Spark und Air-Gap Enterprise bewusst nicht: Dort gibt es keinen Weg zu einer externen Modell-API. Wer ein betriebenes Angebot bevorzugt, findet mit European On Demand ein eigenes Betriebsmodell; beides bleibt strikt getrennt.

Lokale Modelle

Wie viele Personen arbeiten gleichzeitig damit?

Aus dieser Zahl und Ihren Anforderungen an die Daten ergibt sich, welches Modellprofil auf Ihre Appliance gehört. Sagen Sie uns beides, dann rechnen wir Ihnen Profil und Kosten aus.