Selbst gehostete KI-Infrastruktur · OpenAI-kompatibel · Open Source
Eine Ebene für Ihre gesamte KI
croit aiplane ist die Infrastrukturschicht, über die Ihre Unternehmens-KI läuft. Sie verbindet Anwendungen mit Modellen, Agenten, Tools und Unternehmensdaten und hält Identität, Richtlinien und Verbrauch an einem Ort zusammen.
Jedes Modell. Jedes Tool. Ihre Infrastruktur. Die OpenAI-kompatiblen Clients, die Sie bereits betreiben, laufen unverändert weiter.
Ein Modell-Endpunkt ist noch keine KI-Infrastruktur
vLLM oder SGLang liefert Ihnen schnelle Inferenz. Es weiß nicht, wer Ihre Nutzer sind, welche Modelle sie erreichen dürfen, was sie letzten Monat ausgegeben haben oder wie ein Modell an Ihr Wiki, Ihr Jira und Ihren Code kommt. aiplane ist die Schicht, die all das zusammenhält: ein Ort, an dem Modelle, Agenten, Tools, Daten, Identität und Richtlinien zusammenkommen, aufgesetzt auf die Inferenz, die Sie bereits betreiben. Es gibt kein Agenten-Framework zu übernehmen und keine Anwendung neu zu schreiben. (aiplane ist das Produkt, das zuvor als croit LLM Gateway veröffentlicht wurde.)
Eine Schicht, vier Dinge, die sie verbindet
Darüber: Ihre Anwendungen
Alles, was bereits die OpenAI- oder Anthropic-API spricht: SDKs, interne Dienste, IDE-Assistenten und CLI-Agenten, dazu eine eingebaute Chat-Oberfläche für alle, die keinen Code schreiben.
Hindurch: Identität und Richtlinien
Jede Anfrage kommt über OIDC-Anmeldung oder ein nutzereigenes Token herein und wird gegen die Modelle, Tools und Budgets geprüft, die diese Person nutzen darf, bevor sie weitergeht.
Darin: die Agent-Runtime
aiplane führt Tools serverseitig aus, innerhalb der Completion: Websuche, RAG, MCP-Connectors, Sandbox-Code, Memory. Ihr Client erhält weiterhin eine ganz normale Antwort.
Darunter: Ihre Modelle
Selbst gehostetes vLLM, SGLang, Ollama oder llama.cpp neben gehosteten Anbietern. aiplane prüft sie laufend, verteilt über Replicas und übersteht einen Ausfall, statt den Aufrufer scheitern zu lassen.
Warum Teams AIplane vor ihre Modelle setzen
Jedes Modell agentisch machen
Ein Modell hinter vLLM beantwortet Prompts. Hinter aiplane sucht es, liest Ihre Dokumente, führt Code aus und erinnert sich an das Gesagte, für jeden Nutzer und jeden OpenAI-kompatiblen Client.
Private KI, auf Ihrer eigenen Hardware
Inferenz, Prompts, Dokumente und Tool-Ausführung bleiben in Ihrem Netz. Sobald es einen freigegebenen Endpunkt gibt, sind öffentliche KI-Dienste nicht mehr der bequeme Weg.
Modelle mit Unternehmens-Tools und -Daten verbinden
RAG über Git, Nextcloud und WebDAV, Google Drive und Mailinglisten-Archive. MCP-Connectors zu GitHub, Jira, GitLab und Slack, jeweils im Namen der einzelnen Person authentifiziert.
Modelle kommen und gehen, Ihr aiplane bleibt
Ein Alias richtet einen Namen wie fast oder smart auf das, was ihn gerade bedient. Tauschen Sie ein Modell, ergänzen Sie ein Replica, ziehen Sie auf neue Hardware: Ihre Anwendungen senden weiter dieselbe Anfrage.
Private KI kommt zuerst
Selbst-Hosting ist hier der Standard, nicht eine Betriebsart unter mehreren. aiplane erkennt, was ein Backend tatsächlich ist, vLLM, SGLang, Ollama oder llama.cpp, und stellt sich darauf ein: Es ermittelt das Kontextfenster, trifft die Schreibweise, in der dieser Server Reasoning-Effort erwartet, und umgeht, was er nicht kann.
Das Routing folgt dem Verhalten der Inferenz. Eine KV-Cache-bewusste Strategie hält ein Gespräch auf dem Replica, das seinen Prefix schon hat; Least-Inflight und gewichtetes Round-Robin stehen bereit, wenn Sie sie lieber möchten. Health-Probes laufen alle paar Sekunden, und wenn alle Replicas belegt oder ausgefallen sind, warten Anfragen und werden erneut versucht, statt dem Aufrufer einen Fehler zurückzugeben.
Weil die GPUs Ihnen gehören, lässt sich ihre Nutzung erfassen, ohne sie zu verrechnen: Markieren Sie einen selbst gehosteten Pool als ausgenommen, und er zählt nie gegen ein Budget, während der Verbrauch weiterhin in den Dashboards erscheint. Öffentliche Modelle bleiben einen Eintrag entfernt, wenn eine Aufgabe sie wirklich braucht.
Der Agent läuft auf der Ebene, also bekommt ihn jeder Client
Wenn das Modell ein Tool aufruft, führt aiplane es aus und gibt das Ergebnis in dieselbe Completion zurück. Die Anwendung, die die Anfrage gestellt hat, erhält eine ganz normale Antwort. Ein curl-Skript, ein IDE-Assistent und die eingebaute Chat-Oberfläche bekommen damit denselben Agenten, ohne Framework, ohne Orchestrierungscode und ohne clientseitige Tool-Schleife, die gepflegt werden müsste. Tools bleiben abgeschaltet, bis das Modell die Gruppe anfordert, die es braucht; das hält die angebotene Liste kurz und die Auswahl treffsicher.
Über 50 eingebaute Tools, plus alles, was Sie anbinden
Websuche und Lesen
Suche über SearXNG oder Brave, eine URL abrufen, ein PDF Seite für Seite lesen
RAG über Ihre Daten
Git, Nextcloud, WebDAV, Google Drive und Mailinglisten, nach Bedeutung und Stichwort zugleich
MCP-Connectors
GitHub, Jira, GitLab, Slack und jeder andere MCP-Server, pro Nutzer authentifiziert
Code in der Sandbox
Python-, Shell- und Daten-Tools in Einweg-gVisor-Containern, standardmäßig ohne Netz
Dokumente
Auf einer versionierten Arbeitsfläche schreiben und bearbeiten, Export als PDF, DOCX oder PPTX
Memory
Was ein Nutzer einmal sagt, ist im nächsten Gespräch da und bleibt in seiner Hand
Läuft von allein
Gespeicherte Prompts, ausgelöst per Zeitplan oder eingehendem Webhook, mit Verlauf und Wiederholung
Bilder und Sprache
Bilder erzeugen und bearbeiten, Audio transkribieren, mit dem Modell sprechen, sobald ein Backend es bedient
Arbeitet mit dem, was Sie schon betreiben
Inferenzserver
vLLM, SGLang, Ollama und llama.cpp werden automatisch erkannt und profiliert. Alles andere, was das OpenAI-Wire-Format spricht, kommt als generisches Backend dazu.
OpenAI-kompatible Clients
Chat Completions, Embeddings, Bilder, Transkription und Sprache auf den Pfaden, die Ihre SDKs ohnehin aufrufen. Ändern Sie die Basis-URL und den Schlüssel, sonst nichts.
Anthropic-API-Clients
aiplane bedient auch die Anthropic Messages API, sodass Claude Code und ähnliche Werkzeuge auf Ihren eigenen GPUs laufen, unter Ihrer Authentifizierung, Ihren Kontingenten und Ihrer Verbrauchserfassung.
MCP-Server
Binden Sie jeden MCP-Server per URL an. Acht Connectors sind im Katalog enthalten, darunter GitHub, Jira und Confluence, GitLab, Slack und Google Workspace, mit OAuth pro Nutzer.
Kontrolle, die im ganzen Unternehmen trägt
Identität
OIDC mit PKCE gegen Keycloak, Authentik, Entra, Okta oder jeden konformen Anbieter
Rollen und Gruppen
Aus Ihren OIDC-Claims gemappte Gruppen steuern Modelle, Tools, Skills, RAG-Sammlungen und Connectors
Eingegrenzte Tokens
API-Tokens pro Nutzer, nur als Hash gespeichert, begrenzt auf eine Auswahl von Modellen und Tools
Kontingente und Budgets
Anfragen, Tokens oder Kosten, über Stunde, Tag, Woche oder Monat, pro Nutzer, Rolle, Token oder Modell
Sichtbarer Verbrauch
Live-Dashboards zu Anfragen, Tokens, Fehlern und Kosten nach Nutzer, Modell, Backend und Quelle
Daten bleiben, wo sie sind
Gespräche, Dokumente und Tool-Ausführung leben alle in Ihrer eigenen Installation
Eine Binary, eine Pflichteinstellung
aiplane kommt als einzelne Rust-Binary mit SQLite für den Zustand, einkompiliertem Vektorindex und der Web-Oberfläche, die derselbe Prozess auf demselben Port ausliefert. Es gibt keine Konfigurationsdatei zu schreiben: Setzen Sie einen Session-Key, geben Sie ihr ein Volume, und schließen Sie im Browser ab, wo der Einrichtungsassistent eine echte Anmeldung verlangt, bevor er Adminrechte übergibt. Betreiben Sie sie unter systemd mit podman-Quadlets, mit Docker Compose oder auf Kubernetes mit dem veröffentlichten Helm-Chart. Die Codeausführung ist das eine Stück außerhalb der Binary, in einem eigenen gehärteten Runner-Dienst.
Vom Pilot in den Betrieb, mit croit an Ihrer Seite
Mit einem Pilot starten, der wirklich Ihrer ist
Wir stellen aiplane gegen Ihre Modelle und Ihren Identity-Provider auf, damit Ihre Teams es auf Ihrer eigenen Infrastruktur beurteilen und nicht auf einer Folie.
An Ihre Daten und Systeme anbinden
RAG-Sammlungen über die Repositories und Dokumentenspeicher, die Ihre Leute wirklich nutzen, MCP-Connectors für die Werkzeuge ihres Alltags, Rollen und Kontingente passend zu Ihrer Organisation.
Wie Produktion betreiben
Dimensionierung, Härtung und Betrieb unter systemd, Docker oder Kubernetes, von einem Team, das seit Jahren Enterprise- und HPC-Infrastruktur betreibt.
Jemanden in der Verantwortung halten
Kommerzielle Lizenzierung, Support und ein direkter Draht zu den Engineers, die aiplane bauen, damit eine Schicht, auf die Ihr Unternehmen setzt, niemandes Nebenprojekt ist.
Lassen Sie uns klären, wie Ihr aiplane aussieht
Sagen Sie uns, welche Modelle Sie heute betreiben und was Ihre Teams können sollen. Wir kommen mit einem konkreten Bild zurück: Aufbau, Aufwand und Betriebskosten.
Fragen, die zuerst kommen
Open Source, getragen von croit
Frei und quelloffen
Veröffentlicht unter AGPL-3.0, mit Routing, Agent-Runtime, Tools, Chat-Oberfläche und Zugriffssteuerung. Lesen Sie den Code, bevor Sie sich festlegen: keine Gebühren pro Platz, keine zurückgehaltene Edition, kein Lock-in.
Getragen von croit
Gebaut von dem Team, das großflächige Infrastruktur in anspruchsvollen Enterprise- und HPC-Umgebungen betreibt. Die Leute, die aiplane schreiben, sind die Leute, die es für Sie in Betrieb nehmen und unterstützen.
