croit aiplane architecture: internal users, the chat UI, API tokens and custom software reach croit aiplane through a single OIDC Auth and RBAC gate; aiplane serves an OpenAI-compatible API and routes to self-hosted GPUs running vLLM, SGLang, Ollama or llama.cpp and to OpenAI- and Anthropic-compatible cloud providers; below it sit skills, MCP, sandbox, scheduled actions, RAG and webhooks, with MCP reaching Atlassian, GitHub, GitLab, Google and more, and RAG reaching git repositories, WebDAV, Google Drive, Nextcloud and more

Selbst gehostete KI-Infrastruktur · OpenAI-kompatibel · Open Source

Eine Ebene für Ihre gesamte KI

croit aiplane ist die Infrastrukturschicht, über die Ihre Unternehmens-KI läuft. Sie verbindet Anwendungen mit Modellen, Agenten, Tools und Unternehmensdaten und hält Identität, Richtlinien und Verbrauch an einem Ort zusammen.

Jedes Modell. Jedes Tool. Ihre Infrastruktur. Die OpenAI-kompatiblen Clients, die Sie bereits betreiben, laufen unverändert weiter.

aiplane bereitstellen

Ein Modell-Endpunkt ist noch keine KI-Infrastruktur

vLLM oder SGLang liefert Ihnen schnelle Inferenz. Es weiß nicht, wer Ihre Nutzer sind, welche Modelle sie erreichen dürfen, was sie letzten Monat ausgegeben haben oder wie ein Modell an Ihr Wiki, Ihr Jira und Ihren Code kommt. aiplane ist die Schicht, die all das zusammenhält: ein Ort, an dem Modelle, Agenten, Tools, Daten, Identität und Richtlinien zusammenkommen, aufgesetzt auf die Inferenz, die Sie bereits betreiben. Es gibt kein Agenten-Framework zu übernehmen und keine Anwendung neu zu schreiben. (aiplane ist das Produkt, das zuvor als croit LLM Gateway veröffentlicht wurde.)

Eine Schicht, vier Dinge, die sie verbindet

Darüber: Ihre Anwendungen

Alles, was bereits die OpenAI- oder Anthropic-API spricht: SDKs, interne Dienste, IDE-Assistenten und CLI-Agenten, dazu eine eingebaute Chat-Oberfläche für alle, die keinen Code schreiben.

Hindurch: Identität und Richtlinien

Jede Anfrage kommt über OIDC-Anmeldung oder ein nutzereigenes Token herein und wird gegen die Modelle, Tools und Budgets geprüft, die diese Person nutzen darf, bevor sie weitergeht.

Darin: die Agent-Runtime

aiplane führt Tools serverseitig aus, innerhalb der Completion: Websuche, RAG, MCP-Connectors, Sandbox-Code, Memory. Ihr Client erhält weiterhin eine ganz normale Antwort.

Darunter: Ihre Modelle

Selbst gehostetes vLLM, SGLang, Ollama oder llama.cpp neben gehosteten Anbietern. aiplane prüft sie laufend, verteilt über Replicas und übersteht einen Ausfall, statt den Aufrufer scheitern zu lassen.

Warum Teams AIplane vor ihre Modelle setzen

Jedes Modell agentisch machen

Ein Modell hinter vLLM beantwortet Prompts. Hinter aiplane sucht es, liest Ihre Dokumente, führt Code aus und erinnert sich an das Gesagte, für jeden Nutzer und jeden OpenAI-kompatiblen Client.

Private KI, auf Ihrer eigenen Hardware

Inferenz, Prompts, Dokumente und Tool-Ausführung bleiben in Ihrem Netz. Sobald es einen freigegebenen Endpunkt gibt, sind öffentliche KI-Dienste nicht mehr der bequeme Weg.

Modelle mit Unternehmens-Tools und -Daten verbinden

RAG über Git, Nextcloud und WebDAV, Google Drive und Mailinglisten-Archive. MCP-Connectors zu GitHub, Jira, GitLab und Slack, jeweils im Namen der einzelnen Person authentifiziert.

Modelle kommen und gehen, Ihr aiplane bleibt

Ein Alias richtet einen Namen wie fast oder smart auf das, was ihn gerade bedient. Tauschen Sie ein Modell, ergänzen Sie ein Replica, ziehen Sie auf neue Hardware: Ihre Anwendungen senden weiter dieselbe Anfrage.

Private KI kommt zuerst

Selbst-Hosting ist hier der Standard, nicht eine Betriebsart unter mehreren. aiplane erkennt, was ein Backend tatsächlich ist, vLLM, SGLang, Ollama oder llama.cpp, und stellt sich darauf ein: Es ermittelt das Kontextfenster, trifft die Schreibweise, in der dieser Server Reasoning-Effort erwartet, und umgeht, was er nicht kann.

Das Routing folgt dem Verhalten der Inferenz. Eine KV-Cache-bewusste Strategie hält ein Gespräch auf dem Replica, das seinen Prefix schon hat; Least-Inflight und gewichtetes Round-Robin stehen bereit, wenn Sie sie lieber möchten. Health-Probes laufen alle paar Sekunden, und wenn alle Replicas belegt oder ausgefallen sind, warten Anfragen und werden erneut versucht, statt dem Aufrufer einen Fehler zurückzugeben.

Weil die GPUs Ihnen gehören, lässt sich ihre Nutzung erfassen, ohne sie zu verrechnen: Markieren Sie einen selbst gehosteten Pool als ausgenommen, und er zählt nie gegen ein Budget, während der Verbrauch weiterhin in den Dashboards erscheint. Öffentliche Modelle bleiben einen Eintrag entfernt, wenn eine Aufgabe sie wirklich braucht.

Der Agent läuft auf der Ebene, also bekommt ihn jeder Client

Wenn das Modell ein Tool aufruft, führt aiplane es aus und gibt das Ergebnis in dieselbe Completion zurück. Die Anwendung, die die Anfrage gestellt hat, erhält eine ganz normale Antwort. Ein curl-Skript, ein IDE-Assistent und die eingebaute Chat-Oberfläche bekommen damit denselben Agenten, ohne Framework, ohne Orchestrierungscode und ohne clientseitige Tool-Schleife, die gepflegt werden müsste. Tools bleiben abgeschaltet, bis das Modell die Gruppe anfordert, die es braucht; das hält die angebotene Liste kurz und die Auswahl treffsicher.

Über 50 eingebaute Tools, plus alles, was Sie anbinden

Websuche und Lesen

Suche über SearXNG oder Brave, eine URL abrufen, ein PDF Seite für Seite lesen

RAG über Ihre Daten

Git, Nextcloud, WebDAV, Google Drive und Mailinglisten, nach Bedeutung und Stichwort zugleich

MCP-Connectors

GitHub, Jira, GitLab, Slack und jeder andere MCP-Server, pro Nutzer authentifiziert

Code in der Sandbox

Python-, Shell- und Daten-Tools in Einweg-gVisor-Containern, standardmäßig ohne Netz

Dokumente

Auf einer versionierten Arbeitsfläche schreiben und bearbeiten, Export als PDF, DOCX oder PPTX

Memory

Was ein Nutzer einmal sagt, ist im nächsten Gespräch da und bleibt in seiner Hand

Läuft von allein

Gespeicherte Prompts, ausgelöst per Zeitplan oder eingehendem Webhook, mit Verlauf und Wiederholung

Bilder und Sprache

Bilder erzeugen und bearbeiten, Audio transkribieren, mit dem Modell sprechen, sobald ein Backend es bedient

Arbeitet mit dem, was Sie schon betreiben

Inferenzserver

vLLM, SGLang, Ollama und llama.cpp werden automatisch erkannt und profiliert. Alles andere, was das OpenAI-Wire-Format spricht, kommt als generisches Backend dazu.

OpenAI-kompatible Clients

Chat Completions, Embeddings, Bilder, Transkription und Sprache auf den Pfaden, die Ihre SDKs ohnehin aufrufen. Ändern Sie die Basis-URL und den Schlüssel, sonst nichts.

Anthropic-API-Clients

aiplane bedient auch die Anthropic Messages API, sodass Claude Code und ähnliche Werkzeuge auf Ihren eigenen GPUs laufen, unter Ihrer Authentifizierung, Ihren Kontingenten und Ihrer Verbrauchserfassung.

MCP-Server

Binden Sie jeden MCP-Server per URL an. Acht Connectors sind im Katalog enthalten, darunter GitHub, Jira und Confluence, GitLab, Slack und Google Workspace, mit OAuth pro Nutzer.

Kontrolle, die im ganzen Unternehmen trägt

Identität

OIDC mit PKCE gegen Keycloak, Authentik, Entra, Okta oder jeden konformen Anbieter

Rollen und Gruppen

Aus Ihren OIDC-Claims gemappte Gruppen steuern Modelle, Tools, Skills, RAG-Sammlungen und Connectors

Eingegrenzte Tokens

API-Tokens pro Nutzer, nur als Hash gespeichert, begrenzt auf eine Auswahl von Modellen und Tools

Kontingente und Budgets

Anfragen, Tokens oder Kosten, über Stunde, Tag, Woche oder Monat, pro Nutzer, Rolle, Token oder Modell

Sichtbarer Verbrauch

Live-Dashboards zu Anfragen, Tokens, Fehlern und Kosten nach Nutzer, Modell, Backend und Quelle

Daten bleiben, wo sie sind

Gespräche, Dokumente und Tool-Ausführung leben alle in Ihrer eigenen Installation

Eine Binary, eine Pflichteinstellung

aiplane kommt als einzelne Rust-Binary mit SQLite für den Zustand, einkompiliertem Vektorindex und der Web-Oberfläche, die derselbe Prozess auf demselben Port ausliefert. Es gibt keine Konfigurationsdatei zu schreiben: Setzen Sie einen Session-Key, geben Sie ihr ein Volume, und schließen Sie im Browser ab, wo der Einrichtungsassistent eine echte Anmeldung verlangt, bevor er Adminrechte übergibt. Betreiben Sie sie unter systemd mit podman-Quadlets, mit Docker Compose oder auf Kubernetes mit dem veröffentlichten Helm-Chart. Die Codeausführung ist das eine Stück außerhalb der Binary, in einem eigenen gehärteten Runner-Dienst.

Vom Pilot in den Betrieb, mit croit an Ihrer Seite

Mit einem Pilot starten, der wirklich Ihrer ist

Wir stellen aiplane gegen Ihre Modelle und Ihren Identity-Provider auf, damit Ihre Teams es auf Ihrer eigenen Infrastruktur beurteilen und nicht auf einer Folie.

An Ihre Daten und Systeme anbinden

RAG-Sammlungen über die Repositories und Dokumentenspeicher, die Ihre Leute wirklich nutzen, MCP-Connectors für die Werkzeuge ihres Alltags, Rollen und Kontingente passend zu Ihrer Organisation.

Wie Produktion betreiben

Dimensionierung, Härtung und Betrieb unter systemd, Docker oder Kubernetes, von einem Team, das seit Jahren Enterprise- und HPC-Infrastruktur betreibt.

Jemanden in der Verantwortung halten

Kommerzielle Lizenzierung, Support und ein direkter Draht zu den Engineers, die aiplane bauen, damit eine Schicht, auf die Ihr Unternehmen setzt, niemandes Nebenprojekt ist.

Lassen Sie uns klären, wie Ihr aiplane aussieht

Sagen Sie uns, welche Modelle Sie heute betreiben und was Ihre Teams können sollen. Wir kommen mit einem konkreten Bild zurück: Aufbau, Aufwand und Betriebskosten.

Fragen, die zuerst kommen

Open Source, getragen von croit

Frei und quelloffen

Veröffentlicht unter AGPL-3.0, mit Routing, Agent-Runtime, Tools, Chat-Oberfläche und Zugriffssteuerung. Lesen Sie den Code, bevor Sie sich festlegen: keine Gebühren pro Platz, keine zurückgehaltene Edition, kein Lock-in.

Getragen von croit

Gebaut von dem Team, das großflächige Infrastruktur in anspruchsvollen Enterprise- und HPC-Umgebungen betreibt. Die Leute, die aiplane schreiben, sind die Leute, die es für Sie in Betrieb nehmen und unterstützen.