Zum Hauptinhalt springen

Übersicht

Runtime Local LLM Documentation

Runtime Local LLM ist ein Plugin, das große Sprachmodelle vollständig auf dem Gerät mit llama.cpp ausführt, ohne dass zur Laufzeit eine Internetverbindung erforderlich ist. Es unterstützt GGUF-Modelldateien und bietet eine vollständige Blueprint-API zum Laden von Modellen, Senden von Nachrichten und Empfangen von Token-für-Token-Antworten, alles auf einem Hintergrundthread mit Callbacks für den Game-Thread.

Das Plugin unterstützt Windows, Mac, Linux, Android (einschließlich Meta Quest und anderer Android-basierter Plattformen) sowie iOS.

Hauptmerkmale

  • Vollständige Offline-Inferenz: Keine Cloud-Dienste oder API-Schlüssel zur Laufzeit
  • GGUF-Modellunterstützung: Laden Sie beliebige Modelle im GGUF-Format (Llama, Mistral, Phi, Gemma, Qwen usw.)
  • Aktuelles llama.cpp: Regelmäßige Updates auf Fab, um mit den llama.cpp-Releases Schritt zu halten, sodass stets die neuesten GGUF-Modellformate unterstützt werden
  • GPU-Beschleunigung: Verwendet Vulkan unter Windows und Linux, Metal unter Mac und iOS sowie CPU + Intrinsic-Funktionen unter Android und Meta Quest
  • Mehrere Methoden zum Laden von Modellen:
    • Aus lokaler Dateipfad laden
    • Nach Modellname laden (Dropdown-Auswahl in Blueprints)
    • Von URL herunterladen und automatisch laden
    • Nur zum Herunterladen für Pre-Caching von Modellen
  • Token-für-Token-Streaming: Jedes Token wird in Echtzeit empfangen, sobald es generiert wird, für die Anzeige
  • Asynchrone Blueprint-Knoten: Knoten mit Ausgabedelegaten zum Laden, Senden von Nachrichten und Herunterladen
  • Konfigurierbare Inferenzparameter: Temperatur, Top-P, Top-K, Wiederholungsstrafe, GPU-Schicht-Auslagerung, Kontextgröße, Seed, Thread-Anzahl und Systemprompt
  • Gesprächsmanagement: Mehrstufige Gespräche mit Kontext-Reset, Speichern/Laden auf Festplatte, In-Memory-Snapshots und automatischer Zusammenfassung für langlaufende Chats
  • Editor-Modellmanager: Durchsuchen, Herunterladen, Importieren, Löschen und Testen von Modellen direkt in den Projekteinstellungen
  • Plattformübergreifendes Packaging: Modelle werden über NonUFS-Staging zusammen mit Ihrem Projekt ausgeliefert

So funktioniert es

  1. Modelle im Editor verwalten: Verwenden Sie das Plugin-Einstellungsfenster, um einen Katalog vordefinierter Modelle zu durchsuchen, diese herunterzuladen oder Ihre eigenen GGUF-Dateien zu importieren
  2. Modell zur Laufzeit laden: Rufen Sie eine der Ladefunktionen (nach Datei, nach Name, nach URL oder nach Metadaten) mit Ihren Inferenzparametern auf
  3. Nachrichten senden: Übergeben Sie eine Benutzernachricht an die LLM-Instanz; Tokens werden über Delegates zurückgestreamt, während das Modell eine Antwort generiert
  4. Antwort verwenden: Zeigen Sie Tokens in einer Chat-Benutzeroberfläche an, steuern Sie NPC-Dialoge, generieren Sie dynamische Inhalte oder füttern Sie andere Systeme

Alle Inferenzläufe laufen auf einem dedizierten Hintergrundthread. Callbacks (Token-Generierung, Abschluss, Fehler) werden im Game-Thread ausgelöst, sodass Sie UI und Spielzustand sicher daraus aktualisieren können.

Häufige Anwendungsfälle

  • In-Game-Chats und Assistenten: Fragen und Antworten, Hilfesysteme, dynamische Tutorials
  • NPC-Dialoge: Konversationelle NPCs mit persistenter pro-Person-Gedächtnisfunktion mittels Gesprächs-Snapshots
  • Langlaufende Rollenspiel- und Narrativsysteme: Automatische Zusammenfassungen halten mehrstündige Gespräche innerhalb der Kontextgrenzen, ohne wichtige Fakten zu verlieren
  • Prozedurale Inhalte: Generierung von Quest-Beschreibungen, Item-Lore und Dialogbäumen in Echtzeit
  • Offline-first-Anwendungen: Alles, was LLM-Funktionen ohne Netzwerkverbindung benötigt

Modellspeicherung und -verpackung

Modelle werden als .gguf-Dateien im Verzeichnis Content/RuntimeLocalLLM/Models Ihres Projekts gespeichert. Das Plugin konfiguriert automatisch Zusätzliche Nicht-Asset-Verzeichnisse zum Kopieren (DirectoriesToAlwaysStageAsNonUFS), sodass Modelldateien mit Ihrem verpackten Projekt ausgeliefert werden und zur Laufzeit über die Standard-Datei-E/A zugänglich bleiben.

Jedes Modell verfügt zudem über eine .json-Begleitdatei, die seine Metadaten (Anzeigename, Familie, Variante, Beschreibung, Parameteranzahl) speichert.

Unterstützte Modelle

Das Plugin funktioniert mit jedem Modell im GGUF-Format. Der Editor bietet einen Katalog beliebter vordefinierter Modelle für den Download mit einem Klick, und Sie können jede benutzerdefinierte GGUF-Datei importieren. Zu den gängigen Modelfamilien gehören:

  • Llama (Meta) — 1B, 3B, 8B und größer
  • Mistral / Mixtral — 7B und größer
  • Phi (Microsoft) — 2B, 3B, 4B
  • Gemma (Google) — 2B, 7B
  • Qwen (Alibaba) — 1.5B, 7B und größer
  • TinyLlama — 1.1B
  • Und viele weitere Community-Modelle

Quantisierung

Modelle sind in verschiedenen Quantisierungsstufen erhältlich, die Qualität gegen Größe und Geschwindigkeit abwägen:

QuantisierungQualitätSizeGeschwindigkeit
Q2_KNiedrigerKleinsteSchnellste
Q4_K_MGoodMittelFast
Q5_K_MBesserGrößerModerat
Q8_0HighGroßLangsamer
F16 / F32HöchsteGrößteLangsamste

Für mobile und VR-Geräte werden kleinere Quantisierungen (Q2_K bis Q4_K_M) mit kompakten Modellen (1B–3B Parameter) empfohlen. Für Desktop-Systeme können je nach verfügbarem RAM und CPU/GPU-Ressourcen größere Modelle und höhere Quantisierungsebenen verwendet werden.

Zusätzliche Ressourcen

Join our Discord
online · support