Beyefendi GGUF

Bu depo, Türkçe Beyefendi modelinin llama.cpp uyumlu F16 ve Q4_K_M GGUF dosyalarını hedefler. Modelin eğitim kartı ve veri zinciri için ibrahimsait/Beyefendi ile bu depodaki PROVENANCE.md okunmalıdır. Birleştirilmiş modelin upstream foundation checkpoint'i Qwen/Qwen3.5-2B'dir.

Dosyalar

Dosya Nicemleme Byte SHA-256
Beyefendi-F16.gguf F16 3.775.708.544 5759535ae4e2e33f9c88396f1f190fa5133f6edb7d2f5ad2acf7b688b10b2528
Beyefendi-Q4_K_M.gguf Q4_K_M 1.274.396.032 48aa960010119b04ef8d77f6fd8bc63349ca1fc39f052b92325ad7bbf28792d2

GGUF dönüşümü, Qwen3.5 desteği bulunan llama.cpp 298219f985b09d93df515ca708736665468ca827 revizyonuyla hazırlandı. Eski llama.cpp/Ollama sürümleri qwen3_5 mimarisini tanımayabilir.

llama.cpp

llama-cli \
  -m Beyefendi-Q4_K_M.gguf \
  -ngl 99 \
  -c 4096 \
  -p "Türkiye'nin başkenti neresidir? Kısa yanıtla."

GPU offload kullanılamıyorsa -ngl 0 ile CPU yolu seçilebilir. Gerçek VRAM tüketimi; context, batch, KV cache türü, llama.cpp derlemesi ve GPU'ya aktarılan katman sayısına bağlıdır.

İndirme

Depo herkese açıktır; dosya doğrudan indirilebilir:

hf download Ibrahimsait/Beyefendi-GGUF Beyefendi-F16.gguf \
  --local-dir ./Beyefendi-GGUF

Ollama

Q4'e göre tercih edilen F16 sürümü (deneysel):

FROM ./Beyefendi-F16.gguf
PARAMETER num_ctx 4096
PARAMETER temperature 0.2
ollama create beyefendi-f16 -f Modelfile
ollama run beyefendi-f16 --think=false

Q4_K_M aynı yöntemle FROM ./Beyefendi-Q4_K_M.gguf kullanılarak kurulabilir, ancak aşağıdaki kalite regresyonu nedeniyle yalnızca deneysel seçenektir.

Canlı kontrol uyarısı — 24 Temmuz 2026: F16, temperature=0 ve seed=42 ile yinelenen “Türkiye'nin başkenti nedir?” kontrolünde yanlış biçimde “İstanbul” yanıtını verdi. Aşağıdaki kayıtlı context smoke testleri geçmiş olsa da bu yeni bulgu nedeniyle F16 da olgusal olarak güvenilir veya kalite onaylı sayılmamalıdır.

Doğrulama durumu

Her iki dosyanın GGUF magic başlığı, byte boyutu ve SHA-256 değeri yayın manifestiyle doğrulandı. Q4_K_M, llama.cpp CPU smoke testinde “Türkiye'nin başkenti Ankara'dır.” yanıtını verdi. 8 thread CPU benchmark ortalaması 512-token prompt için 136,75 token/s, 128-token generation için 20,34 token/s oldu.

Ollama F16 yolunda 2K, 4K ve 8K context runtime ile üç semantik smoke testinin tamamı geçti. 24 GB kartta model yüklenmeden önceki toplam kullanım çıkarılarak ölçülen ek tepe GPU kullanımı 4.059 MiB'dı; 8 GiB bütçeye 4.133 MiB pay kaldı.

Q4_K_M yolunda aynı üç context runtime testi çalıştı. Ek tepe GPU kullanımı 1.661 MiB, bütçe payı 6.531 MiB oldu. Her iki yöntem de 24 GB karttaki artımsal ölçümdür; fiziksel 8 GB kart testi değildir.

Q4 kalite smoke'u geçmedi. Ollama kısa testte Ankara yerine yanlış biçimde İstanbul dedi; multi-turn testinde de istenen sıralı biçimi tam karşılamadı. Uzun 4K test geçti, fakat Q4 raporunun quality_smoke_passed ve genel passed alanları false değerindedir. F16 aynı üç kayıtlı context testini geçti; ancak yukarıdaki daha yeni deterministik kontrolü geçmedi. Bu nedenle iki GGUF da kök neden ayrıştırılana kadar “yayına hazır kalite” olarak değerlendirilmemelidir.

Makinece okunabilir sonuçlar ve kaynak rapor karmaları EVALUATION_SUMMARY.json dosyasındadır.

Sınırlamalar

  • Q4_K_M, BF16/F16 modele göre kalite kaybı oluşturabilir; kapsamlı eşlenik quant kalite koşusu belgelenmemişse kaybın büyüklüğü bilinmez.
  • Ollama semantik smoke başarısızlıkları; chat template/runtime farkı, nicemleme veya model davranışı ayrıştırılana kadar her iki GGUF için de olgusal güvenilirlik bloğudur.
  • Model olgusal hata, halüsinasyon, önyargı ve güvensiz öneri üretebilir.
  • 262K config sınırı, bu GGUF dosyalarının o context'te pratik olarak doğrulandığı anlamına gelmez; önerilen başlangıç 4K'dır.
  • Tıp, hukuk, finans veya diğer yüksek riskli kararlar için kullanılmamalıdır.
  • Upstream Qwen config'leri 15852e8c16360a2fea060d615a32b45270f8a8fc revizyonuna sabittir; final eğitim özeti bu SHA'yı ayrıca tekrarlamaz.

Lisans ve atıf durumu

license: other bir lisans hibesi değildir. Qwen temel modeli Apache-2.0, SFT verisi Apache-2.0, Wikipedia CPT verisi CC-BY-SA-3.0/GFDL soyundadır. Nihai Beyefendi dağıtım şartları proje sahibi/hukuk incelemesi bekler. Public erişim, ağırlıkların yeniden kullanımı veya yeniden dağıtımı için ek bir lisans hakkı verildiği anlamına gelmez. LICENSE-APACHE-2.0-BASE.txt yalnız temel modelin lisans metnidir.

Downloads last month
23
GGUF
Model size
2B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

4-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support