
Lokale LLMs im Unternehmen: KI ohne Cloud, ohne Token-Rechnung
Viele Teams wollen die Qualität von ChatGPT. Sie dürfen aber Verträge, Kundendaten und internes Wissen nicht an einen API-Anbieter schicken. Genau deshalb setzen wir lokale LLMs ein.
Ein lokales LLM ist ein Sprachmodell, das auf Hardware im eigenen Netz läuft. Prompts, Dateien und Antworten verlassen das Haus nicht. Es gibt keine Token-Rechnung an OpenAI oder Anthropic. Und das Bauchgefühl bei der DSGVO wird kleiner, weil die Daten erst gar nicht rausgehen.
Wir haben das nicht nur ausprobiert. Wir betreiben es für uns und für Kunden.
Zwei ASUS Ascent GX10. DeepSeek V4 Flash. Eine Oberfläche, die sich anfühlt wie ein Produkt, nicht wie ein Forschungsprojekt.
Zwei Boxen auf dem Schreibtisch. Ein KI-System, das ohne Cloud auskommt.
ASUS Ascent GX10 im Einsatz
Unified Memory pro Gerät
API-Kosten pro Token
Was wir gebaut haben
Die Hardware sind zwei ASUS Ascent GX10. Jede Box bringt den GB10 Grace Blackwell Superchip, 128 GB kohärenten Unified Memory und bis zu 1 PetaFLOP bei FP4 mit. Sie ist 15 mal 15 mal 5 Zentimeter groß und hängt an einer normalen Steckdose. Kein Serverraum, kein Rack. Schreibtisch.
Darauf läuft DeepSeek V4 Flash. Schnell genug für den Alltag, stark genug für Agenten und langes Kontextfenster.
Davor sitzt die Oberfläche, die das Team wirklich benutzt: Chat, Rechte, Wissensbasen, Agenten, Modellwahl. Für den Kunden heißt das nicht Setup-Projekt. Es heißt: ein interner KI-Chat, der auf euer Unternehmenswissen zugreift und vom ersten Tag an funktioniert.
Wir nennen das Ahoi AI.
Was Teams damit tun
- Fragen an Richtlinien, Verträge, Angebote und interne Wikis stellen, mit Quellen statt Bauchgefühl
- Agenten für Vertrieb, Support, HR oder Finance bauen, die nur das dürfen, was ihr festlegt
- Zwischen lokalem Modell und Cloud-Modell wechseln, wenn eine Aufgabe das braucht
- Wissen ablegen, ohne dass es in einem US-Prompt landet
Wie Retrieval und Wissensbasen unter der Haube funktionieren, haben wir in Vom langen Prompt zu RAG aufgeschrieben. Hier geht es um den ganzen Stack: Hardware, Modell, Oberfläche, Betrieb.


So läuft der Stack
- Hardware im Haus. Die zwei ASUS Ascent GX10 stehen bei uns oder im Netz des Kunden. Daten bleiben dort.
- Modell lokal. DeepSeek V4 Flash beantwortet den Alltag. Andere Modelle hängen wir dazu, lokal oder per API, wenn es die Aufgabe verlangt.
- Oberfläche mit Wissen und Agenten. Chat, Dateien, Agenten, Rechte. Fertig für die Leute, die damit arbeiten sollen, nicht nur für uns.
Lokal gegen die Cloud API
Kurz: Cloud ist schnell und stark. Lokal hält die Daten im Haus und streicht die Token-Rechnung. Den Rest zeigt der Vergleich darunter.
Was lokal nicht magisch löst
Ein lokales LLM ist nicht immer das beste Modell der Welt. Manche Aufgaben bleiben in der Cloud besser. Deshalb hängt Ahoi AI auch andere Modelle an, wenn ihr das wollt.
Die Boxen sind auch nicht umsonst. Sie ersetzen die monatliche Token-Rechnung durch eine Investition, die sich rechnet, sobald ein Team wirklich damit arbeitet.
Und "lokal" allein macht noch keine saubere Organisation. Rechte, Logs, Quellen, was ins Modell darf: das setzen wir mit euch auf. Sonst habt ihr nur einen schnellen Chat ohne Halt.

Häufige Fragen zu lokalen LLMs
Ein lokales LLM ist ein Sprachmodell, das auf Hardware im eigenen Netz läuft. Prompts, Dateien und Antworten gehen nicht an einen Cloud-Anbieter. Genau so betreiben wir DeepSeek V4 Flash auf zwei ASUS Ascent GX10.
Sie lösen das Datenthema an der Wurzel: Inhalte verlassen das Haus nicht. Das ersetzt nicht eure restliche Organisation (Rechte, Logs, Auftragsverarbeitung intern). Den Teil setzen wir mit euch auf.
Ihr zahlt Hardware und Setup einmal, danach keine Token-Rechnung. Zwei ASUS Ascent GX10 ersetzen die laufenden API-Kosten, sobald ein Team wirklich damit arbeitet. Betrieb und Wissenspflege gehören dazu, das ist Teil unseres Auftrags.
Ja, für Chat, Agenten und Modelle in der Klasse von DeepSeek V4 Flash. Eine Box hat 128 GB Unified Memory und bis zu 1 PetaFLOP bei FP4. Wir nutzen zwei, damit Last und Reserve stimmen. Zwei GX10 lassen sich koppeln, wenn die Modelle größer werden.
Ja. Ahoi AI hängt auch andere Modelle an. Lokal ist der Default für internes Wissen. Cloud bleibt eine Option, wenn eine Aufgabe das stärkere Modell braucht und die Daten das erlauben.
Wenn ihr KI im Unternehmen wollt, ohne jedes Dokument in eine API zu kippen, ist das der Weg, den wir selbst gehen und für Kunden bauen.
Hardware, Modell, Oberfläche, Wissen, Agenten, Betrieb. Ein System, das im Haus bleibt.