Visión general

Runtime Local LLM es un plugin que ejecuta modelos de lenguaje grandes completamente en el dispositivo utilizando llama.cpp, sin necesidad de conexión a internet en tiempo de ejecución. Soporta archivos de modelo GGUF y proporciona una API completa de Blueprint para cargar modelos, enviar mensajes y recibir respuestas token por token, todo en un hilo de fondo con callbacks del hilo del juego.
El plugin es compatible con Windows, Mac, Linux, Android (incluidas las plataformas basadas en Android como Meta Quest) e iOS.
Características principales
- Inferencia completamente offline: Sin servicios en la nube ni claves de API en tiempo de ejecución
- Soporte para modelos GGUF: Carga cualquier modelo en formato GGUF (Llama, Mistral, Phi, Gemma, Qwen, etc.)
- llama.cpp actualizado: Se actualiza regularmente en Fab para mantenerse al día con los lanzamientos de llama.cpp, por lo que siempre se admiten los últimos formatos de modelos GGUF
- Aceleración GPU: Utiliza Vulkan en Windows y Linux, Metal en Mac e iOS, y CPU + intrínsecos en Android y Meta Quest
- Múltiples métodos de carga de modelos:
- Cargar desde una ruta de archivo local
- Cargar por nombre de modelo (selección desplegable en Blueprints)
- Descargar desde URL y cargar automáticamente
- Solo descarga para precaché de modelos
- Transmisión token por token: Reciba cada token a medida que se genera para visualización en tiempo real
- Nodos de Blueprint asíncronos: Nodos con delegados de salida para cargar, enviar mensajes y descargar
- Parámetros de inferencia configurables: Temperatura, Top-P, Top-K, penalización de repetición, descarga de capas GPU, tamaño del contexto, semilla, número de hilos y prompt del sistema
- Gestión de conversaciones: Conversaciones multironda con reinicio de contexto, guardar/cargar en disco, instantáneas en memoria y resumen automático para chats de larga duración
- Administrador de modelos del editor: Explorar, descargar, importar, eliminar y probar modelos directamente en la configuración del proyecto
- Empaquetado multiplataforma: Los modelos se envían junto con su proyecto mediante staging NonUFS
Cómo funciona
- Gestionar modelos en el editor: Utilice el panel de configuración del plugin para navegar por un catálogo de modelos predefinidos, descargarlos o importar sus propios archivos GGUF
- Cargar un modelo en tiempo de ejecución: Llame a una de las funciones de carga (por archivo, por nombre, por URL o por metadatos) con sus parámetros de inferencia
- Enviar mensajes: Pase un mensaje de usuario a la instancia del LLM; los tokens fluyen a través de delegados mientras el modelo genera una respuesta
- Utilizar la respuesta: Muestre los tokens en una interfaz de chat, impulse diálogos de NPC, genere contenido dinámico o alimente otros sistemas
Todas las ejecuciones de inferencia se realizan en un hilo secundario dedicado. Los callbacks (generación de tokens, finalización, errores) se activan en el hilo del juego, por lo que puede actualizar la interfaz de usuario y el estado del juego de forma segura desde ellos.
Casos de uso comunes
- Chatbots y asistentes en el juego: preguntas y respuestas, sistemas de ayuda, tutoriales dinámicos
- Diálogo de NPCs: NPCs conversacionales con memoria persistente por personaje utilizando instantáneas de conversación
- Sistemas de rol y narrativa de larga duración: La resumen automático mantiene las conversaciones de varias horas dentro de los límites del contexto sin perder hechos clave
- Contenido procedural: Generar descripciones de misiones, lore de objetos y árboles de diálogo sobre la marcha
- Aplicaciones offline-first: Cualquier cosa que necesite capacidades de LLM sin conexión a red
Almacenamiento y empaquetado de modelos
Los modelos se almacenan como archivos .gguf en el directorio Content/RuntimeLocalLLM/Models de tu proyecto. El plugin configura automáticamente Directorios No Activos Adicionales para Copiar (DirectoriesToAlwaysStageAsNonUFS) para que los archivos de modelo se incluyan en tu proyecto empaquetado y permanezcan accesibles mediante E/S de archivo estándar en tiempo de ejecución.
Cada modelo también tiene un archivo secundario .json que almacena sus metadatos (nombre para mostrar, familia, variante, descripción y cantidad de parámetros).
Modelos compatibles
El plugin funciona con cualquier modelo en formato GGUF. El editor proporciona un catálogo de modelos predefinidos populares para descarga con un solo clic, y puedes importar cualquier archivo GGUF personalizado. Las familias de modelos comunes incluyen:
- Llama (Meta) — 1B, 3B, 8B y más grandes
- Mistral / Mixtral — 7B y más grandes
- Phi (Microsoft) — 2B, 3B, 4B
- Gemma (Google) — 2B, 7B
- Qwen (Alibaba) — 1.5B, 7B y más grandes
- TinyLlama — 1.1B
- Y muchos más modelos de la comunidad
Cuantización
Los modelos vienen en varios niveles de cuantización que equilibran la calidad con el tamaño y la velocidad:
| Cuantificación | Calidad | Size | Velocidad |
|---|---|---|---|
| Q2_K | Baja | Más pequeña | Más rápida |
| Q4_K_M | Good | Media | Fast |
| Q5_K_M | Mejor | Más grande | Moderada |
| Q8_0 | High | Grande | Más lenta |
| F16 / F32 | Máxima | La más grande | La más lenta |
Para dispositivos móviles y de realidad virtual, se recomiendan cuantizaciones más pequeñas (Q2_K a Q4_K_M) con modelos compactos (1B–3B parámetros). Para escritorio, puede utilizar modelos más grandes y niveles de cuantización más altos según la RAM y los recursos de CPU/GPU disponibles.
Recursos adicionales
- Consíguelo en Fab
- Sitio web del producto
- Descargar demo (Windows)
- Tutorial en video
- Soporte de plugin y desarrollo personalizado: solutions@georgy.dev (soluciones a medida para equipos y organizaciones)