Обзор

Runtime Local LLM — это плагин, который запускает большие языковые модели полностью на устройстве с помощью llama.cpp, без необходимости подключения к интернету во время выполнения. Он поддерживает файлы моделей в формате GGUF и предоставляет полный API Blueprint для загрузки моделей, отправки сообщений и получения ответов по токенам, всё это выполняется в фоновом потоке с обратными вызовами игрового потока.
Плагин поддерживает Windows, Mac, Linux, Android (включая Meta Quest и другие платформы на базе Android), а также iOS.
Ключевые особенности
- Полностью автономный вывод: Не требует облачных сервисов или ключей API во время выполнения
- Поддержка моделей GGUF: Загрузка любых моделей в формате GGUF (Llama, Mistral, Phi, Gemma, Qwen и др.)
- Актуальная версия llama.cpp: Регулярно обновляется на Fab для соответствия релизам llama.cpp, обеспечивая поддержку новейших форматов моделей GGUF
- Ускорение на GPU: Использование Vulkan на Windows и Linux, Metal на Mac и iOS, а также CPU + интринсики на Android и Meta Quest
- Несколько методов загрузки моделей:
- Загрузка из локального пути к файлу
- Загрузка по имени модели (выпадающий список в Blueprints)
- Скачивание по URL и автоматическая загрузка
- Только скачивание для предварительного кэширования моделей
- Потоковая выдача токенов поштучно: Получение каждого токена в момент его генерации для отображения в реальном времени
- Асинхронные узлы Blueprint: Узлы с делегатами вывода для загрузки, отправки сообщений и скачивания
- Настраиваемые параметры инференса: Температура, Top-P, Top-K, штраф за повторения, выгрузка слоёв на GPU, размер контекста, seed, количество потоков и системный промпт
- Управление диалогами: Многоходовые диалоги со сбросом контекста, сохранением/загрузкой на диск, снимками в памяти и автоматическим суммированием для длительных чатов
- Менеджер моделей редактора: Просмотр, скачивание, импорт, удаление и тестирование моделей непосредственно в настройках проекта
- Кроссплатформенная упаковка: Модели поставляются вместе с проектом через стадию NonUFS
Как это работает
- Управление моделями в редакторе: используйте панель настроек плагина для просмотра каталога предопределённых моделей, их загрузки или импорта собственных файлов GGUF
- Загрузка модели во время выполнения: вызовите одну из функций загрузки (по файлу, по имени, по URL или по метаданным) с параметрами инференса
- Отправка сообщений: передайте сообщение пользователя экземпляру LLM; токены поступают обратно через делегаты по мере генерации ответа моделью
- Использование ответа: отображайте токены в чат-интерфейсе, управляйте диалогом NPC, генерируйте динамический контент или передавайте данные в другие системы
Все вычисления выполняются в отдельном фоновом потоке. Обратные вызовы (генерация токенов, завершение, ошибки) срабатывают в игровом потоке, поэтому вы можете безопасно обновлять интерфейс и состояние игры на их основе.
Типичные сценарии использования
- Внутриигровые чат-боты и помощники: вопросы и ответы, системы помощи, динамические обучающие материалы
- Диалоги NPC: разговорные персонажи с устойчивой памятью на каждого персонажа с использованием снимков диалогов
- Долгие ролевые игры и нарративные системы: автоматическое суммирование удерживает многочасовые диалоги в пределах лимитов контекста без потери ключевых фактов
- Процедурный контент: генерация описаний квестов, лора предметов и деревьев диалогов в реальном времени
- Приложения с приоритетом офлайн-режима: всё, что требует возможностей LLM без сетевого соединения
Хранение и упаковка моделей
Модели хранятся в виде файлов .gguf в директории Content/RuntimeLocalLLM/Models вашего проекта. Плагин автоматически настраивает Дополнительные каталоги не-активов для копирования (DirectoriesToAlwaysStageAsNonUFS), чтобы файлы моделей поставлялись с упакованным проектом и оставались доступными через стандартный ввод-вывод файлов во время выполнения.
Каждая модель также имеет сопутствующий файл .json, в котором хранятся её метаданные (отображаемое имя, семейство, вариант, описание, количество параметров).
Поддерживаемые модели
Плагин работает с любой моделью в формате GGUF. Редактор предоставляет каталог популярных предопределённых моделей для скачивания в один клик, и вы можете импортировать любой пользовательский файл GGUF. К основным семействам моделей относятся:
- Llama (Meta) — 1B, 3B, 8B и более крупные
- Mistral / Mixtral — 7B и более крупные
- Phi (Microsoft) — 2B, 3B, 4B
- Gemma (Google) — 2B, 7B
- Qwen (Alibaba) — 1.5B, 7B и более крупные
- TinyLlama — 1.1B
- И многие другие модели сообщества
Квантование
Модели доступны на различных уровнях квантования, которые представляют собой компромисс между качеством, размером и скоростью:
| Квантование | Качество | Size | Скорость |
|---|---|---|---|
| Q2_K | Низкое | Наименьшее | Наиболее быстрое |
| Q4_K_M | Good | Среднее | Fast |
| Q5_K_M | Лучшее | Большее | Умеренное |
| Q8_0 | High | Большое | Медленное |
| F16 / F32 | Наивысшее | Наибольшее | Наиболее медленное |
Для мобильных и VR-устройств рекомендуются меньшие квантования (Q2_K через Q4_K_M) с компактными моделями (1B–3B параметров). Для десктопов можно использовать более крупные модели и уровни квантования в зависимости от доступной оперативной памяти и ресурсов CPU/GPU.
Дополнительные ресурсы
- Получить на Fab
- Сайт продукта
- Скачать демо (Windows)
- Видеоурок
- Поддержка плагина и кастомная разработка: solutions@georgy.dev (индивидуальные решения для команд и организаций)