Genel Bakış

Runtime Local LLM, llama.cpp kullanarak büyük dil modellerini tamamen cihaz üzerinde çalıştıran ve çalışma zamanında internet bağlantısı gerektirmeyen bir eklentidir. GGUF model dosyalarını destekler ve arka plan iş parçacığında, oyun iş parçacığı geri çağrılarıyla birlikte modelleri yükleme, mesaj gönderme ve token token yanıtlar alma için tam bir Blueprint API'si sağlar.
Eklenti Windows, Mac, Linux, Android (diğer Android tabanlı platformlar dahil Meta Quest dahil) ve iOS'u destekler.
Ana Özellikler
- Tam çevrimdışı çıkarım: Runtime'da bulut hizmetleri veya API anahtarı gerektirmez
- GGUF model desteği: Herhangi bir GGUF formatlı modeli yükleyin (Llama, Mistral, Phi, Gemma, Qwen vb.)
- Güncel llama.cpp: Fab üzerinde düzenli olarak güncellenir ve llama.cpp sürümlerini takip eder, böylece en yeni GGUF model formatları her zaman desteklenir
- GPU hızlandırma: Windows ve Linux'ta Vulkan, Mac ve iOS'ta Metal, Android ve Meta Quest'te CPU + intrinsics kullanır
- Çoklu model yükleme yöntemleri:
- Yerel dosya yolundan yükle
- Model adıyla yükle (Blueprints içinde açılır menü seçimi)
- URL'den indir ve otomatik olarak yükle
- Önbelleğe almak için yalnızca indir
- Token bazlı akış: Gerçek zamanlı gösterim için her token oluşturulduğu anda alınır
- Asenkron Blueprint düğümleri: Yükleme, mesaj gönderme ve indirme için çıktı delege'leri içeren düğümler
- Yapılandırılabilir çıkarım parametreleri: Sıcaklık, Top-P, Top-K, tekrar cezası, GPU katman devretme, bağlam boyutu, tohum, iş parçacığı sayısı ve sistem komutu
- Sohbet yönetimi: Bağlam sıfırlama ile çok adımlı sohbetler, diske kaydetme/yükleme, bellek içinde anlık görüntüler ve uzun süreli sohbetler için otomatik özetleme
- Editör model yöneticisi: Modelleri proje ayarları içinde doğrudan gezinme, indirme, içe aktarma, silme ve test etme
- Çoklu platform paketleme: Modeller NonUFS ön hazırlama yoluyla projenizle birlikte dağıtılır
Nasıl Çalışır
- Editörde modelleri yönetin: Eklenti ayarları panelini kullanarak önceden tanımlı modellerin bir kataloğunu gezinin, indirin veya kendi GGUF dosyalarınızı içe aktarın
- Çalışma zamanında model yükleyin: Çıkarım parametrelerinizle dosya, ad, URL veya meta veri yoluyla yükleme işlevlerinden birini çağırın
- Mesaj gönderin: Kullanıcı mesajını LLM örneğine iletin; model yanıt oluştururken tokenlar delege aracılığıyla akarak geri döner
- Yanıtı kullanın: Tokenları bir sohbet arayüzünde görüntüleyin, NPC diyaloglarını yönlendirin, dinamik içerik oluşturun veya diğer sistemlere besleyin
Tüm çıkarım işlemleri ayrı bir arka plan iş parçacığında yürütülür. Geri çağrılar (token üretimi, tamamlanma, hatalar) oyun iş parçacığında tetiklenir; böylece bunlardan güvenli bir şekilde UI ve oyun durumunu güncelleyebilirsiniz.
Yaygın Kullanım Senaryoları
- Oyun içi sohbet botları ve asistanlar: Soru-cevap, yardım sistemleri, dinamik eğitimler
- NPC diyalogları: Karakter başına kalıcı hafıza ile konuşma anılarına dayalı konuşmacı NPC'ler
- Uzun süreli rol yapma ve anlatı sistemleri: Otomatik özetleme, çok saatlik konuşmaları anahtar gerçekler kaybolmadan bağlam sınırları içinde tutar
- Prosedürel içerik: Görev açıklamaları, eşya hikayeleri ve diyalog ağaçlarını anında oluşturur
- Çevrimdışı öncelikli uygulamalar: Ağ bağlantısı olmadan LLM yeteneklerine ihtiyaç duyan her şey
Model Depolama ve Paketleme
Modeller, projenizin Content/RuntimeLocalLLM/Models dizininde .gguf dosyaları olarak saklanır. Eklenti, model dosyalarının paketlenmiş projenizle birlikte gönderilmesini ve çalışma zamanında standart dosya I/O yoluyla erişilebilir kalmasını sağlamak için Kopyalanacak Ek Varlık Olmayan Dizinleri (DirectoriesToAlwaysStageAsNonUFS) otomatik olarak yapılandırır.
Her model, ayrıca metadata'sını (görüntülenen ad, aile, varyant, açıklama, parametre sayısı) saklayan bir .json yan dosyasına sahiptir.
Desteklenen Modeller
Eklenti, GGUF formatındaki herhangi bir model ile çalışır. Editör, tek tıklamayla indirme için popüler önceden tanımlı modellerin bir kataloğu sağlar ve herhangi bir özel GGUF dosyasını içe aktarabilirsiniz. Yaygın model aileleri şunlardır:
- Llama (Meta) — 1B, 3B, 8B ve daha büyük
- Mistral / Mixtral — 7B ve daha büyük
- Phi (Microsoft) — 2B, 3B, 4B
- Gemma (Google) — 2B, 7B
- Qwen (Alibaba) — 1.5B, 7B ve daha büyük
- TinyLlama — 1.1B
- Ve birçok daha fazla topluluk modeli
Kantilezasyon
Modeller, kalite ile boyut ve hız arasında denge kuran çeşitli nicemleme seviyelerinde gelir:
| Kantilezasyon | Kalite | Size | Hız |
|---|---|---|---|
| Q2_K | Düşük | En küçük | En hızlı |
| Q4_K_M | Good | Orta | Fast |
| Q5_K_M | Daha iyi | Daha büyük | Orta düzey |
| Q8_0 | High | Büyük | Daha yavaş |
| F16 / F32 | En yüksek | En büyük | En yavaş |
Mobil ve VR cihazlar için, kompakt modeller (1B–3B parametre) ile daha küçük nicemlemeler (Q2_K'den Q4_K_M'ye kadar) önerilir. Masaüstü için ise mevcut RAM ve CPU/GPU kaynaklarına bağlı olarak daha büyük modeller ve daha yüksek nicemleme seviyeleri kullanılabilir.
Ek Kaynaklar
- Fab'da Edinin
- Ürün web sitesi
- Demosu İndir (Windows)
- Video eğitim
- Eklenti Desteği ve Özel Geliştirme: solutions@georgy.dev (ekipler ve kuruluşlar için özelleştirilmiş çözümler)