Neuer Open Code Software-Stack ermöglicht es Unternehmen, validierte Open Weight KI-Modelle auf eigener Infrastruktur on-premise auszuführen. Planbare Kosten, Datensouveränität und Kontrolle über Modelle...
Hintergrund
Unternehmen stehen beim produktiven Einsatz ihrer KI vor der Herausforderung, Kosten planbarer zu machen (s.a. Token!), mehr Kontrolle über den gesamten Lebenszyklus von Modellen zu gewinnen und die Datensouveränität zu stärken. Für Organisationen kann deshalb die Lösung in einer hybriden Architektur liegen, in der besonders kritische KI-Prozesse on-Premise ausgeführt werden. Lokale Inferenz ermöglicht es, diese Anforderungen miteinander zu verbinden und zugleich sicherzustellen, dass sensible Daten innerhalb der vom Unternehmen selbst kontrollierten Infrastruktur verbleiben.
Ankündigungsübersicht
Scality hat am 08. Oktober 2026 dazu jetzt die Verfügbarkeit seiner "Scality AI Inference Factory" bekannt gegeben. Dabei handelt es sich um einen Open Code Software-Stack zur Bereitstellung und den Betrieb von KI-Inferenz auf der eigenen Infrastruktur (on-premise). Die Lösung kann Unternehmen, Behörden und Neo-Cloud Anbietern eine unterstützte Alternative zu Cloud-basierten KI-Diensten geben, ohne dass sie dazu den gesamten Software-Stack selbst zusammenstellen, integrieren und warten müssen.
Ankündigungsdetails
Scality AI Inference Factory vereint validierte Open-Weight Modelle, disaggregierte Inference-Serving Schicht, eine Control Plane für Authentifizierung, Abrechnung, Routing und Scheduling sowie Scality AI Data Infrastructure (ADI). Diese ermöglicht die richtliniengesteuerte, autonome Verwaltung umfangreicher Datensätze über den gesamten KI-Lebenszyklus hinweg. Scality validiert, liefert und wartet dazu den vollständig integrierten Stack.
Herausforderungen der Cloud-KI erhöht das Interesse an on-Premises Inferenz
Unternehmen, die KI für den produktiven Einsatz skalieren, sehen sich mitunter schnell mit den Herausforderungen Cloud-basierter Inferenz-Modelle konfrontiert. Bei einer Abrechnung pro Token steigen die Kosten mit der Nutzung von KI-Workflows. Dadurch entstehen Ausgaben, die schwer vorhersehbar und nach oben nicht begrenzt sind. Zudem können Anbieter Modellversionen und Quantisierung nach eigenem Ermessen ändern, was sich auf darauf aufbauende Workflows auswirken kann.
Für Betriebe, die mit sensiblen oder regulierten Daten arbeiten, stellt sich ferner die Frage nach der Datensouveränität: Wo werden Prompts, Dokumente und proprietärer Code verarbeitet? Welcher Rechtsordnung unterliegen die Daten? Und wer hat die Möglichkeit, den Zugriff darauf zu kontrollieren oder einzuschränken?
Die Scality AI Inference Factory richtet sich deshalb an Organisationen, die kritische KI-Workloads auf einer von ihnen kontrollierten Infrastruktur ausführen und gleichzeitig flexibel bei Modellen, Hardware und Software bleiben möchten. Der Stack unterstützt laut Anbieter spezialisierte Chatbots, KI-gestützte Softwareentwicklung, agentische Anwendungen sowie weitere,Inferenz-intensive Workloads. Die Lösung kombiniert dazu folgende Elemente (Quelle, Scality):
Validierte Open-Weight Modelle, die als Bestandteil des unterstützten Stacks gepflegt werden.
Disaggregiertes Inference Serving, bei dem Prefill und Decode getrennt werden, sodass beide Prozesse unabhängig voneinander skaliert werden können.
Eine Control Plane, die Anfragen authentifiziert und abrechnet, sie mit dem relevanten Kontext an geeignete GPUs routet und Workloads entsprechend definierter SLA-Ziele plant.
Scality ADI, das hochperformanten Objektspeicher für Modelle, Unternehmensdaten sowie den Inferenz-Zustand bereitstellt.
Scality validiert und wartet den vollständigen Stack als integrierte, unterstützte Lösung. So sollen Unternehmen mit der dynamischen Entwicklung von Modellen, Serving-Technologien und Sicherheitsanforderungen Schritt halten können, ohne dabei die einzelnen Komponenten selbst integrieren und warten zu müssen.
KI-Inferenz über die Grenzen des GPU-Speichers hinaus erweitern
Scality ADI fungiert als gemeinsam genutzte Speicherschicht der AI Inference Factory und erweitert den Key-Value (KV)-Cache über den begrenzten High-Bandwidth Memory (HBM) der GPUs hinaus. Dadurch kann die Inferenz-Infrastruktur Modellkontext speichern und bei Bedarf wieder abrufen, anstatt ihn auf den GPUs erneut berechnen zu müssen. Das verbessert die GPU-Auslastung und trägt dazu bei, die Kosten für die Inferenz zu senken.
Dies ist laut Entwickler insbesondere für Reasoning-Modelle und agentische Workloads relevant, bei denen der KV-Cache den verfügbaren GPU-Speicher schnell überschreiten kann. Scality ADI stellt einen gemeinsam genutzten Cache im Multi-Petabyte Maßstab bereit, auf den GPUs mit einer Latenz in derselben Größenordnung wie beim GPU-Speicher zugreifen können. Dadurch können sie vorhandenen Kontext abrufen und sich auf die Inferenz konzentrieren.

Bildquelle: Scality.
Anmerkung zur Abbildung: „Da sich der Cache in Scality ADI und nicht auf einem einzelnen Server befindet, kann jede GPU darauf zugreifen; dies macht „Split Serving“ möglich: die Ausführung der beiden Phasen der Inferenz auf separaten GPU-Pools. Beim „Prefill“ wird der KV-Cache für eine neue Eingabe berechnet, und beim „Decode“ wird die Antwort Token für Token generiert. Wenn beide auf denselben GPUs laufen, unterbricht jedes neue „Prefill“-Verfahren die bereits laufenden „Decode“-Vorgänge. Nach der Aufteilung führt jeder Pool eine Aufgabe in Vollzeit aus und skaliert eigenständig, wobei beide auf denselben gemeinsamen KV-Cache zugreifen.“
Der zugrunde liegende Research ist öffentlich zugänglich. DistServe (OSDI 2024) erzielte bei gleichen Latenzzielen bis zu 7,4-mal mehr Anfragen pro GPU, indem der Cache direkt zwischen den GPUs verschoben wurde. Quelle, externer link > https://arxiv.org/abs/2401.09670
Bei dem Scality-Design schreibt laut Entwickler „das Prefill stattdessen den KV-Cache in Scality ADI, und die Dekodierung liest ihn wieder aus, sodass jede Dekodierungs-GPU jeden zurückkehrenden Kontext übernehmen kann und die Ebene im Wesentlichen keine Begrenzung für die Größe dieses Caches setzt.“ (Quelle: Scality).
Tests des Anbieters haben nach diesen Angaben gezeigt, dass ADI den GPU-Verbrauch reduzieren kann, ohne dabei das Leistungsniveau zu beeinträchtigen. Im Detail:
„1,9 Sekunden Ladezeit für Gemma-3 27B nahezu zehnmal schneller als lokales NVMe. Das Modell wird dabei parallel über den gesamten Cluster per RDMA gestreamt
166 ms Warm Time-to-First Token bei der Wiederherstellung eines 14K-Token-Kontexts aus ADI, lediglich 83 ms hinter HBM
14-mal schnellerer Abruf des KV-Caches gegenüber einer Neuberechnung bei einem 14K-Token-Kontext und bis zu 72-mal schneller bei einem 439K-Token-Kontext
Ein nahezu 80-mal größerer KV-Cache als der Speicher einer einzelnen GPU ermöglicht es, bis zu 1.000 parallel laufende Sitzungen ohne erneute Berechnung nahtlos fortzusetzen
Keine messbaren Auswirkungen auf die Token-Generierung, da der Kontext vor der Ausgabe des ersten Tokens wiederhergestellt wird
97 % der Netzwerkleitungsrate bei der Datenübertragung zwischen GPUs und Storage.“Die Architektur trennt Prefill und Decode, wobei ADI als gemeinsam genutzter Cache zwischen den GPU-Pools fungiert. Dadurch können verfügbare Decode-GPUs auf vorhandenen Kontext zugreifen, ohne dass dieser an einen bestimmten GPU-Server gebunden ist.
Die Trennung von Prefill und Decode bietet laut Entwickler nachweisbare Vorteile: DistServe (OSDI 2024) erzielte bis zu 7,4-mal mehr bediente Anfragen innerhalb derselben Latenzziele.
Mit einem darüberliegenden, gemeinsamen KV-Cache Pool meldete Moonshot AI mit Mooncake 75 Prozent mehr Anfragen bei Kimi-Produktionsverkehr."
Kommentar (Auszug) Giorgio Regni, CTO, Scality: „Der KV-Cache auf Scality ADI ist schnell genug, um Teil des Serving-Pfads zu sein. Die Wiederherstellung eines Kontexts aus ADI liegt in derselben Größenordnung wie der Zugriff auf GPU-Speicher und ist 14-mal schneller als eine Neuberechnung, während die GPUs durchgehend ausgelastet bleiben. Storage ist damit kein Grund mehr, den KV-Cache innerhalb des GPU-Servers zu halten.“
Laut Regni eröffnet es den Weg für disaggregiertes Serving: „Ein GPU-Pool übernimmt das Prefill, verarbeitet den Prompt und schreibt den KV-Cache in ADI. Ein zweiter Pool übernimmt das Decode, liest den Cache zurück und generiert Tokens. Mit Scality ADI als gemeinsam genutztem Cache kann jede Decode-GPU jeden Kontext übernehmen, grundsätzlich ohne Größenlimit. Prefill unterbricht Decode nicht mehr, und beide Pools können unter Volllast laufen.“
Offene Architektur für mehr Flexibilität bei Modellen, Frameworks und Hardware
Die Scality AI Inference Factory ist laut Anbieter mit Open-Source Harnesses sowie agentischen Frameworks wie OpenCode, Hermes, Goose, LangGraph und Pydantic AI kompatibel und unterstützt validierte Open-Weight Modelle von Mistral, Gemma, gpt-oss, Qwen, Kimi, GLM und DeepSeek. Die Software kann auf Standard-Servern von Dell, HPE, Lenovo und Supermicro bereitgestellt werden.
"Jede von Scality ausgelieferte Softwarekomponente wird danach als Open Code bereitgestellt. Kunden können dadurch nachvollziehen, wie Inferenz-Zustände gespeichert und übertragen werden, und Beiträge zur Prüfung durch Scality einreichen.
Für Unternehmen mit sensiblen, regulierten oder souveränen KI-Workloads schafft dies Transparenz über die Software, die ihre Modelle und Daten verarbeitet, anstatt sie auf einen geschlossenen, externen Dienst angewiesen zu machen.
Scality ADI lässt sich in standardisierte KI-Stacks integrieren und im Multi-Petabyte Maßstab auf NVMe bereitstellen. Über RDMA besteht zudem Zugriff auf HDD, wodurch (Zitat) „praktisch unbegrenzte Kapazitäten für den KV-Cache möglich werden sollen.“
Ein einziger Namespace verteilt Daten automatisch über TLC, HDD sowie optional Tape. So können Unternehmen Performance und Wirtschaftlichkeit des Speichers an die unterschiedlichen Phasen des KI-Datenlebenszyklus anpassen."
Dazu auch Nataliya Yezhkova, Vice President, Storage and Data Management, Enterprise Infrastructure, IDC (Zitatauszug): „Untersuchungen von IDC zeigen, dass die Ausführung von Inferenz On-Premises für eine wachsende Zahl von Enterprise- und Public-Sector Workloads eine praktikable Option darstellt. Voraussetzung ist eine Infrastruktur, die den Modellzustand effizient und in großem Maßstab speichern und bereitstellen kann…“
Zur Verfügbarkeit: Scality’s AI Inference Factory ist laut Anbieter ab sofort als Softwarelizenz oder als vollständig gemanagter Service verfügbar. Die Lösung und ihre Referenzarchitektur wird dazu auch am 8. Oktober in Paris beim Scality Day vorgestellt.
Querverweis:
Unser Blogpost mit Podcast > KI-Storage-Herausforderungen: Wie kann Speicherplatz im KV-Cache beim Einsatz großer Sprachmodelle und der Vektorsuche optimiert werden?
Unser Beitrag > NVIDIA GTC Storage Update März 2026: KI-bezogene Speicherankündigungen in der Übersicht. Was ist NVIDIA Storage-Next?
Unser Beitrag > Vektorsuche mit MongoDB 9.0 und Atlas Infinite: KI-Anforderungen im großen Maßstab bedienen