Übersicht

Runtime Local LLM ist ein Plugin, das große Sprachmodelle vollständig auf dem Gerät mit llama.cpp ausführt, ohne dass zur Laufzeit eine Internetverbindung erforderlich ist. Es unterstützt GGUF-Modelldateien und bietet eine vollständige Blueprint-API zum Laden von Modellen, Senden von Nachrichten und Empfangen von Token-für-Token-Antworten, alles auf einem Hintergrundthread mit Callbacks für den Game-Thread.
Das Plugin unterstützt Windows, Mac, Linux, Android (einschließlich Meta Quest und anderer Android-basierter Plattformen) sowie iOS.
Hauptmerkmale
- Vollständige Offline-Inferenz: Keine Cloud-Dienste oder API-Schlüssel zur Laufzeit
- GGUF-Modellunterstützung: Laden Sie beliebige Modelle im GGUF-Format (Llama, Mistral, Phi, Gemma, Qwen usw.)
- Aktuelles llama.cpp: Regelmäßige Updates auf Fab, um mit den llama.cpp-Releases Schritt zu halten, sodass stets die neuesten GGUF-Modellformate unterstützt werden
- GPU-Beschleunigung: Verwendet Vulkan unter Windows und Linux, Metal unter Mac und iOS sowie CPU + Intrinsic-Funktionen unter Android und Meta Quest
- Mehrere Methoden zum Laden von Modellen:
- Aus lokaler Dateipfad laden
- Nach Modellname laden (Dropdown-Auswahl in Blueprints)
- Von URL herunterladen und automatisch laden
- Nur zum Herunterladen für Pre-Caching von Modellen
- Token-für-Token-Streaming: Jedes Token wird in Echtzeit empfangen, sobald es generiert wird, für die Anzeige
- Asynchrone Blueprint-Knoten: Knoten mit Ausgabedelegaten zum Laden, Senden von Nachrichten und Herunterladen
- Konfigurierbare Inferenzparameter: Temperatur, Top-P, Top-K, Wiederholungsstrafe, GPU-Schicht-Auslagerung, Kontextgröße, Seed, Thread-Anzahl und Systemprompt
- Gesprächsmanagement: Mehrstufige Gespräche mit Kontext-Reset, Speichern/Laden auf Festplatte, In-Memory-Snapshots und automatischer Zusammenfassung für langlaufende Chats
- Editor-Modellmanager: Durchsuchen, Herunterladen, Importieren, Löschen und Testen von Modellen direkt in den Projekteinstellungen
- Plattformübergreifendes Packaging: Modelle werden über NonUFS-Staging zusammen mit Ihrem Projekt ausgeliefert
So funktioniert es
- Modelle im Editor verwalten: Verwenden Sie das Plugin-Einstellungsfenster, um einen Katalog vordefinierter Modelle zu durchsuchen, diese herunterzuladen oder Ihre eigenen GGUF-Dateien zu importieren
- Modell zur Laufzeit laden: Rufen Sie eine der Ladefunktionen (nach Datei, nach Name, nach URL oder nach Metadaten) mit Ihren Inferenzparametern auf
- Nachrichten senden: Übergeben Sie eine Benutzernachricht an die LLM-Instanz; Tokens werden über Delegates zurückgestreamt, während das Modell eine Antwort generiert
- Antwort verwenden: Zeigen Sie Tokens in einer Chat-Benutzeroberfläche an, steuern Sie NPC-Dialoge, generieren Sie dynamische Inhalte oder füttern Sie andere Systeme
Alle Inferenzläufe laufen auf einem dedizierten Hintergrundthread. Callbacks (Token-Generierung, Abschluss, Fehler) werden im Game-Thread ausgelöst, sodass Sie UI und Spielzustand sicher daraus aktualisieren können.
Häufige Anwendungsfälle
- In-Game-Chats und Assistenten: Fragen und Antworten, Hilfesysteme, dynamische Tutorials
- NPC-Dialoge: Konversationelle NPCs mit persistenter pro-Person-Gedächtnisfunktion mittels Gesprächs-Snapshots
- Langlaufende Rollenspiel- und Narrativsysteme: Automatische Zusammenfassungen halten mehrstündige Gespräche innerhalb der Kontextgrenzen, ohne wichtige Fakten zu verlieren
- Prozedurale Inhalte: Generierung von Quest-Beschreibungen, Item-Lore und Dialogbäumen in Echtzeit
- Offline-first-Anwendungen: Alles, was LLM-Funktionen ohne Netzwerkverbindung benötigt
Modellspeicherung und -verpackung
Modelle werden als .gguf-Dateien im Verzeichnis Content/RuntimeLocalLLM/Models Ihres Projekts gespeichert. Das Plugin konfiguriert automatisch Zusätzliche Nicht-Asset-Verzeichnisse zum Kopieren (DirectoriesToAlwaysStageAsNonUFS), sodass Modelldateien mit Ihrem verpackten Projekt ausgeliefert werden und zur Laufzeit über die Standard-Datei-E/A zugänglich bleiben.
Jedes Modell verfügt zudem über eine .json-Begleitdatei, die seine Metadaten (Anzeigename, Familie, Variante, Beschreibung, Parameteranzahl) speichert.
Unterstützte Modelle
Das Plugin funktioniert mit jedem Modell im GGUF-Format. Der Editor bietet einen Katalog beliebter vordefinierter Modelle für den Download mit einem Klick, und Sie können jede benutzerdefinierte GGUF-Datei importieren. Zu den gängigen Modelfamilien gehören:
- Llama (Meta) — 1B, 3B, 8B und größer
- Mistral / Mixtral — 7B und größer
- Phi (Microsoft) — 2B, 3B, 4B
- Gemma (Google) — 2B, 7B
- Qwen (Alibaba) — 1.5B, 7B und größer
- TinyLlama — 1.1B
- Und viele weitere Community-Modelle
Quantisierung
Modelle sind in verschiedenen Quantisierungsstufen erhältlich, die Qualität gegen Größe und Geschwindigkeit abwägen:
| Quantisierung | Qualität | Size | Geschwindigkeit |
|---|---|---|---|
| Q2_K | Niedriger | Kleinste | Schnellste |
| Q4_K_M | Good | Mittel | Fast |
| Q5_K_M | Besser | Größer | Moderat |
| Q8_0 | High | Groß | Langsamer |
| F16 / F32 | Höchste | Größte | Langsamste |
Für mobile und VR-Geräte werden kleinere Quantisierungen (Q2_K bis Q4_K_M) mit kompakten Modellen (1B–3B Parameter) empfohlen. Für Desktop-Systeme können je nach verfügbarem RAM und CPU/GPU-Ressourcen größere Modelle und höhere Quantisierungsebenen verwendet werden.
Zusätzliche Ressourcen
- Bei Fab erhalten
- Produkt-Website
- Demo herunterladen (Windows)
- Videotutorial
- Plugin-Support & individuelle Entwicklung: solutions@georgy.dev (maßgeschneiderte Lösungen für Teams und Organisationen)