Why now – Palantir alternatives for Europe: what 'sovereign' actually means, and how European public bodies are decidingRegistrieren →
MODELLE · RETRIEVAL · AGENTEN · OHNE WEG NACH DRAUSSEN

Air-Gapped LLMs & Agenten auf Ihrem eigenen Cluster

Die KI-Hälfte einer air-gapped Bereitstellung, im Detail: wo die Gewichte liegen, wie Retrieval sich ohne Embedding-API verankert, womit die Tools eines Agenten sprechen, wenn es nichts zu erreichen gibt, und wie das alles aktuell bleibt.

Gewichte liegen auf Ihrem Cluster

Open-Weight-Modelle werden von Hardware innerhalb Ihres Perimeters bereitgestellt. Es gibt keinen externen Inferenz-Endpunkt zu erreichen — und damit auch keinen zu verlieren.

Retrieval verankert sich lokal

Embeddings, Indexierung und Retrieval laufen alle innerhalb der Umgebung, verankert in Ihrer eigenen Ontologie und Ihren Dokumenten — nirgends im Pfad ein gehosteter Embedding-Dienst.

Nichts telefoniert nach Hause

Keine Lizenzprüfung, keine Telemetrie, kein Rückruf zum Modellanbieter. Updates kommen, wenn Sie sie hereintragen — über einen Kanal, den Sie kontrollieren und protokollieren.

Kurz gesagt

„Es läuft offline" ist leicht gesagt und schwer eingelöst. Die meisten KI-Stacks haben mindestens eine Stelle, die still und leise Internet braucht — den Modell-Endpunkt, einen Embedding-Aufruf, eine Lizenzprüfung, ein Telemetriesignal — und welche das ist, erfahren Sie an dem Tag, an dem das Kabel gezogen wird. Diese Seite ist die Inventur: jeder Teil der KI, der normalerweise nach draußen greift, und was er stattdessen tut.

Lesenswert, wenn Sie als Architekt nachweisen muss, dass eine KI-Bereitstellung wirklich keine ausgehende Abhängigkeit hat — und das vor der Akkreditierung belegen muss.


Definition

Air-Gapped KI führt Modellbereitstellung, Retrieval und Agentenausführung vollständig innerhalb eines Netzes ohne Route ins öffentliche Internet aus. Open-Weight-Modelle werden von Ihrem eigenen Cluster bereitgestellt, Embeddings und Retrieval werden lokal gegen Ihre eigene Ontologie und Ihre Dokumente berechnet, Agenten-Tools lösen nur auf Systeme innerhalb des Perimeters auf, und Modell- und Software-Updates kommen über einen kontrollierten Kanal herein, den Sie selbst betreiben.

Eine Plattform ist erst an dem Punkt air-gapped, an dem jede Abhängigkeit ein lokales Ziel hat. Die Infrastrukturhälfte davon — Cluster, Speicher, Isolation — steht unter [Souveräne Grundlagen](/platform/sovereign-infra/air-gapped). Diese Seite ist die andere Hälfte: was mit der KI selbst geschieht. Inferenz ist kein API-Aufruf mehr, sondern eine Arbeitslast, die Sie einplanen. Retrieval setzt keinen gehosteten Embedding-Dienst mehr voraus. Agenten-Tools lösen auf nichts außerhalb mehr auf. Auswertung, Updates und Lizenzierung telefonieren nicht mehr nach Hause. Nichts davon ist ein eingeschränkter Modus — so ist die Plattform gebaut, und deshalb ist der Funktionsumfang in einem getrennten Netz derselbe, den Sie verbunden hätten.

Wo es sich einfügt

Air-Gapped KI in der Scrydon-Plattform

Eine integrierte, souveräne Architektur. Hier fügt sich Air-Gapped KI ein — hervorgehoben im Kontext des gesamten Stacks, mit dem es zusammenarbeitet.

CRM synchronisieren
Identität prüfen
...
Genehmigen
Begrüßen

Das AI OS für Menschen und KI-Agenten

Umsatzübersicht — Q2 2026
Verbunden mit Cognitive Enterprise
Umsatz
€4.2M
+12%
Pipeline
€11.7M
+8%
Abwanderung
2.1%
−0.3pp
Monatlicher UmsatzJan. – Dez. 2025
JanMarJunSepDec
Dritt-
anbieter
C
Kunde
Konto
Auftrag
Produkt
Vertrag
Auftragsposition
Lieferant
Abrechnung
hält
erteilte
von

Ontologie- und Semantikschicht: ein zusammenhängendes Modell für Ihre Daten, Ihr Wissen und Ihre Prozesse

Das Beste aus Data Lakes, Data Warehouses und Suche vereint

TabellenWissen

KI-Agenten, Workflows und Automatisierungen, die über Ihre Systeme hinweg ausgeführt werden

KI-Workflows

Integrieren Sie über A2A, MCP, Legacy-Systeme und Datenquellen

Sichere Domänenföderation, vertrauenswürdiger Datenaustausch und Intelligenz über Grenzen hinweg

Souveräne Grundlagen

Bereitstellung von Air-Gap bis Hyperscale
Genauer betrachtet

Air-Gapped KI im Detail

Mensch + KI-Orchestrierung

CRM synchronisieren
Identität prüfen
...
Genehmigen
Begrüßen

Das AI OS für Menschen und KI-Agenten

AI Operating System (AI OS)

Der Human + AI Orchestrator ist die operative Runtime im Herzen des AI OS — auch Agentic OS genannt — der jede Aufgabe in Ihrem Unternehmen plant, routet und steuert, ob sie nun von einem KI-Agenten, einem bestehenden System oder einem Menschen ausgeführt wird.

Die meisten Organisationen haben kaputte Prozesse: kodiert in isolierten Systemen oder eingeschlossen in den Köpfen der Mitarbeitenden. Das AI OS macht sie sichtbar und ausführbar. Es erfasst die Absicht, führt den Kontext zusammen, handelt — und speist jedes Ergebnis zurück in die Ontologie, sodass der nächste Durchlauf intelligenter wird. Und das alles innerhalb Ihres Perimeters.

Souveräne Grundlagen

Observability
Full-Stack-Monitoring & Alerting
Zero-Trust
Kontinuierliche Verifizierung
Automatisierung
GitOps & Policy-as-Code
Schlüsselverwaltung
HSM-gestützte Secrets
Kubernetes
Souveräne Cluster-Orchestrierung
Identität
Föderiertes IAM (SAML/OIDC)

Das AI OS funktioniert nur, wenn man ihm vertrauen kann. Jede Schicht der Plattform ruht auf einem Zero-Trust-Infrastruktur- und Identitätsfundament, das konsistent arbeitet — von vollständig air-gapped On-Premises-Installationen bis hin zu Hyperscale-Cloud-Umgebungen. Souveränität ist kein obenauf gesetztes Feature — sie ist die Bedingung, unter der alles andere operiert.

  • Zero-Trust-Architektur: Kontinuierliche Verifizierung für jede Anfrage, jeden Nutzer und jede Workload — kein implizites Vertrauen, auch nicht innerhalb des Perimeters.
  • Föderierte Identität: Nahtlose Integration mit Ihrem bestehenden IdP (SAML, OAuth 2.0, OIDC) für einheitliche, richtliniengesteuerte Zugriffskontrolle.
  • Air-Gap-Bereitstellung: Betreiben Sie die komplette Plattform ohne externe Netzwerkabhängigkeiten — ideal für Verteidigung, kritische nationale Infrastruktur und klassifizierte Workloads.
  • Confidential Computing: Verschlüsselung von Daten während der Nutzung auf Hardwareebene via AMD SEV-SNP und Intel SGX, wodurch Workloads selbst vor Infrastrukturadministratoren geschützt sind.

Deployment Options: From Air-gapped to Cloud

DIE INVENTUR

Vier Dinge, die normalerweise Internet brauchen — und was sie stattdessen tun

Nehmen Sie einen beliebigen KI-Stack und fragen Sie, wonach er greift. Meist gibt es vier Antworten, und jede davon muss ersetzt statt abgeschaltet werden, bevor „air-gapped" etwas bedeutet. Inferenz ist die offensichtliche: Open-Weight-Modelle werden von Hardware innerhalb des Perimeters bereitgestellt, sodass Generierung eine Arbeitslast ist, die das Cluster einplant, statt einer Anfrage, die es verlässt. Retrieval ist die, an der es scheitert — ein Stack kann sein eigenes Chat-Modell bereitstellen und trotzdem jeden Dokumentabschnitt an einen gehosteten Embedding-Endpunkt schicken; deshalb laufen Embedding, Indexierung und Suche hier lokal, verankert in Ihrer Ontologie und belegbar auf Datensätze, die sich nie bewegt haben. Bei Agenten-Tools ändert sich weniger, als man denkt: Agenten erreichen Systeme über dasselbe Model Context Protocol und einander über dasselbe A2A wie überall sonst, und der einzige Unterschied ist, welche Ziele auflösen. Eine Laufzeitumgebung, deren Egress ohnehin standardmäßig verweigert wird, braucht für ein Netz ohne jeden Egress keine Sonderbehandlung. Übrig bleibt der Lebenszyklus — Auswertung, Observability, Audit und Updates — und all das entsteht, bleibt und wird freigegeben innerhalb der Umgebung.

  • InferenzOpen-Weight-Modelle, die auf Ihrem eigenen Cluster bereitgestellt statt über eine API aufgerufen werden. Die Plattform ist modellunabhängig, also ist die Wahl der Gewichte Ihre Entscheidung — und sie kann sich ändern, ohne das Darüberliegende neu zu bauen.

  • RetrievalEmbedding, Indexierung und Suche laufen innerhalb des Perimeters gegen Ihre eigene Ontologie und Ihre Dokumente, sodass Antworten verankert und belegbar bleiben, ohne dass etwas das Netz verlässt.

  • Agenten-ToolsAgenten erreichen Systeme über dieselben Protokolle wie überall sonst, nur lösen ausschließlich Ziele innerhalb Ihrer Umgebung auf. Standardmäßig verweigerte Egress ist in einem Netz ohne Egress schlicht der Normalfall.

  • LebenszyklusAuswertung, Observability und Audit entstehen und bleiben lokal. Modell- und Software-Updates kommen über Ihren freigegebenen Kanal — kein Hintergrund-Download, keine stille Versionsdrift.

WO OFFLINE-VERSPRECHEN SCHEITERN

Die Abhängigkeiten, die sich erst zeigen, wenn das Kabel gezogen ist

Kaum jemand baut absichtlich einen Stack, der Internet braucht. Es passiert nebenbei, eine bequeme Abhängigkeit nach der anderen, und die Rechnung kommt an dem Tag, an dem die Umgebung geschlossen wird. Der gehostete Embedding-Aufruf ist der Klassiker: Das Chat-Modell wurde ins Haus geholt, der Retrieval-Pfad nicht, und jeder Dokumentabschnitt geht weiterhin hinaus. Lizenz-Herzschläge sind der zweite — Berechtigungsprüfungen, die über das Netz validieren, funktionieren im Labor einwandfrei und fallen am dreißigsten Tag im Tresorraum aus; deshalb hängt Berechtigung hier nicht von Erreichbarkeit ab. Telemetrie und Absturzberichte sind meist voreingestellt aktiv und lange vor einer Datenschutzfrage eine Frage des Datenabflusses; in einer akkreditierten Umgebung sind sie zudem eine Feststellung. Und die Modell-Registry geht stillschweigend davon aus, beim ersten Gebrauch Gewichte oder einen Tokenizer nachladen zu können, was aus einem Kaltstart einen Ausfall macht. Dass das hier nicht greift, liegt nicht daran, dass jedes Einzelne gefunden und abgeschaltet wurde. Es liegt daran, dass Getrenntsein der Entwurfsfall war und nicht eine Einstellung davon — es gab also nie einen Abruf zum Abschalten. Von der Infrastrukturseite ist dieser Unterschied unter Souveräne Grundlagen beschrieben.

  • Der gehostete Embedding-AufrufEin Stack kann sein eigenes Chat-Modell bereitstellen und trotzdem jeden Dokumentabschnitt an einen gehosteten Embedding-Endpunkt schicken. Retrieval ist der am häufigsten übersehene ausgehende Pfad in einer ansonsten lokalen Bereitstellung.

  • Der Lizenz-HerzschlagSoftware, die Berechtigungen über das Netz prüft, funktioniert im Labor tadellos und fällt am dreißigsten Tag im Tresorraum aus. Berechtigung hängt hier nicht von Erreichbarkeit ab.

  • Telemetrie und AbsturzberichteVoreinstellungen, die still Nutzung melden, sind lange vor einer Datenschutzfrage eine Frage des Datenabflusses. In einer eingestuften Umgebung sind sie zudem eine Prüfungsfeststellung.

  • Die Modell-RegistryGewichte oder Tokenizer beim ersten Gebrauch nachzuladen macht aus einem Kaltstart einen Ausfall. Alles, was zum Bereitstellen eines Modells nötig ist, liegt vor, bevor die Umgebung geschlossen wird.

AKTUELL OHNE VERBINDUNG

Wie eine getrennte Umgebung Schritt hält

Der berechtigte Einwand gegen getrennte KI ist nicht, ob sie läuft — sondern ob sie schlecht altert. Modelle verbessern sich schnell, und eine Umgebung, die keine Registry erreichen kann, ist eine Umgebung, die auf einem ein Jahr alten Modell sitzen bleiben kann, ohne dass jemand das entschieden hätte. Die Antwort besteht darin, das Aktualisieren bewusst statt automatisch zu machen. Modell- und Plattform-Updates laufen über den Kanal, den Sie ohnehin für alles andere betreiben — freigegebene Wechselmedien oder eine Datendiode — bereitgestellt, geprüft und freigegeben nach Ihrem Zeitplan. Weil die Plattform modellunabhängig ist, ist der Wechsel auf ein neueres Open-Weight-Modell ein Bereitstellungsschritt statt einer Migration der darauf aufbauenden Agenten, des Retrievals und der Prozesse — die Kosten des Aktuellbleibens sind also niedrig genug, dass es tatsächlich geschieht. Bevor etwas freigegeben wird, wird es innerhalb der Umgebung gegen Ihre eigenen Daten und Ihre eigenen Aufgaben ausgewertet, was ein besserer Test ist als ein öffentlicher Benchmark — und hier ohnehin der einzig verfügbare. Die Nachweise daraus — Traces, Auswertungen, Audit-Einträge — entstehen und bleiben lokal, sodass das Material, nach dem eine Akkreditierungsprüfung fragt, bereits im Raum liegt, statt anderswo eingesammelt werden zu müssen.

  • Updates, die Sie hereintragenModell- und Plattform-Updates laufen über Ihren eigenen kontrollierten, protokollierten Kanal — freigegebene Wechselmedien oder eine Datendiode — nach Ihrem Zeitplan statt dem eines Anbieters.

  • Modelle wechseln ohne UmbauWeil die Plattform modellunabhängig ist, ist der Wechsel auf ein neueres Open-Weight-Modell ein Bereitstellungsschritt und keine Migration von allem, was darauf aufbaut.

  • Prüfen vor dem FreigebenDie Auswertung läuft innerhalb der Umgebung gegen Ihre eigenen Daten, sodass ein neues Modell an der Arbeit gemessen wird, die es tatsächlich tun soll, statt an einem öffentlichen Benchmark.

  • Nachweise bleiben drinnenTraces, Auswertungen und Audit-Einträge entstehen und bleiben lokal — die Akkreditierungsnachweise müssen die Umgebung nie verlassen, um erhoben zu werden.

FAQ

Häufig gestellte Fragen

Kann ein LLM wirklich air-gapped laufen?+
Ja. Open-Weight-Modelle werden von Ihrem eigenen Cluster innerhalb des isolierten Netzes bereitgestellt, sodass Inferenz eine Arbeitslast ist, die Sie einplanen, statt einer API, die Sie aufrufen. Nichts an der Generierung erfordert eine ausgehende Verbindung. Entscheidend ist, dass alles darum herum — Retrieval, Tools, Lizenzierung, Telemetrie — genauso lokal ist, und genau das beschreiben diese Seite und Souveräne Grundlagen gemeinsam.
Wie funktioniert RAG ohne Internetverbindung?+
Embedding, Indexierung und Retrieval laufen alle innerhalb des Perimeters. Enterprise RAG verankert Antworten in Ihren eigenen Dokumenten und Ihrer eigenen Ontologie, mit Belegen, die auf Datensätze in der Umgebung verweisen. Es gibt keinen gehosteten Embedding-Dienst im Pfad — genau die Abhängigkeit, die eine angeblich offline laufende Bereitstellung am häufigsten doch verbunden macht.
Funktionieren KI-Agenten auch ohne Netz?+
Ja, gegenüber den vorhandenen Systemen. Agenten erreichen Tools über das Model Context Protocol und einander über A2A genau wie überall sonst; der Unterschied ist, welche Ziele auflösen. Eine Agenten-Laufzeitumgebung, deren Egress ohnehin standardmäßig verweigert wird, passt von selbst zu einem Netz, das gar keinen Egress hat.
Wie aktualisiert man Modelle und Software in einem air-gapped Netz?+
Über einen kontrollierten Kanal, den Sie selbst betreiben — in der Regel freigegebene Wechselmedien oder eine Datendiode — wobei Updates nach Ihrem Zeitplan bereitgestellt, geprüft und freigegeben werden. Nichts lädt im Hintergrund herunter, und keine Komponente driftet still auf eine neue Version, weil keine Komponente eine Route hat, sich eine zu holen.
Welche Modelle können wir offline betreiben?+
Jedes Open-Weight-Modell, das Ihre Hardware bereitstellen kann. Die Plattform ist modellunabhängig, die Wahl liegt also bei Ihnen und kann sich später ändern, ohne die darauf aufbauenden Agenten, das Retrieval und die Prozesse neu zu entwerfen. Frontier-Modelle, die als gehosteter Dienst geliefert werden, sind in einem getrennten Netz per Definition nicht verfügbar — und genau deshalb zählt Modellunabhängigkeit hier.
Braucht eine air-gapped Bereitstellung eigene Hardware?+
Sie braucht ein Cluster innerhalb des isolierten Netzes — die Plattform läuft als Cluster-Bereitstellung nahe am Ort der Arbeit, sei das ein Rechenzentrum, eine akkreditierte Liegenschaft oder ein verlegtes Hauptquartier. Es ist keine Inferenzbibliothek, die auf einem einzelnen Gerät läuft.
Fehlt etwas gegenüber einer verbundenen Bereitstellung?+
Der Funktionsumfang ist derselbe: dasselbe AI OS, dieselben Agenten, dieselbe Ontologie und Analytik, dieselbe Governance und Auditierbarkeit. Anders ist, dass gehostete Frontier-Modelle nicht verfügbar sind und Updates etwas sind, das Sie hereintragen, statt etwas, das ankommt. Nichts läuft in einem reduzierten Modus, weil das Netz fehlt.
Worin unterscheidet sich das von der Air-Gapped-Seite unter Souveräne Grundlagen?+
Jene Seite ist die Antwort auf Plattformebene — die vollständige KI- und Datenplattform in getrennten Netzen und die Infrastruktur, die das möglich macht. Diese Seite ist die KI-Schicht im Detail: wo die Gewichte liegen, wie sich Retrieval verankert, womit Agenten sprechen und wie Modelle aktuell bleiben. Beginnen Sie dort für das Bereitstellungsbild; kommen Sie hierher für das, was die KI selbst tut.

Oder schreiben Sie uns

Sagen Sie uns, woran Sie arbeiten und wer antworten soll. Ein Mensch liest es und antwortet innerhalb eines Werktags.

Wir verwenden diese Angaben nur, um Ihnen zu antworten. Datenschutzerklärung

Lieber schreiben? Senden Sie eine E-Mail an hello [at] scrydon.com und wir melden uns bei Ihnen.

Partner

Gemeinsam mit führenden Innovatoren die Zukunft von Daten & KI gestalten. Mehr erfahren.
Delaware logo