Instructions to use Ibrahimsait/Beyefendi-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use Ibrahimsait/Beyefendi-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf Ibrahimsait/Beyefendi-GGUF:F16 # Run inference directly in the terminal: llama cli -hf Ibrahimsait/Beyefendi-GGUF:F16
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf Ibrahimsait/Beyefendi-GGUF:F16 # Run inference directly in the terminal: llama cli -hf Ibrahimsait/Beyefendi-GGUF:F16
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf Ibrahimsait/Beyefendi-GGUF:F16 # Run inference directly in the terminal: ./llama-cli -hf Ibrahimsait/Beyefendi-GGUF:F16
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf Ibrahimsait/Beyefendi-GGUF:F16 # Run inference directly in the terminal: ./build/bin/llama-cli -hf Ibrahimsait/Beyefendi-GGUF:F16
Use Docker
docker model run hf.co/Ibrahimsait/Beyefendi-GGUF:F16
- LM Studio
- Jan
- vLLM
How to use Ibrahimsait/Beyefendi-GGUF with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Ibrahimsait/Beyefendi-GGUF" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Ibrahimsait/Beyefendi-GGUF", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Ibrahimsait/Beyefendi-GGUF:F16
- Ollama
How to use Ibrahimsait/Beyefendi-GGUF with Ollama:
ollama run hf.co/Ibrahimsait/Beyefendi-GGUF:F16
- Unsloth Desktop
- Pi
How to use Ibrahimsait/Beyefendi-GGUF with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Ibrahimsait/Beyefendi-GGUF:F16
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "Ibrahimsait/Beyefendi-GGUF:F16" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use Ibrahimsait/Beyefendi-GGUF with Docker Model Runner:
docker model run hf.co/Ibrahimsait/Beyefendi-GGUF:F16
- Lemonade
How to use Ibrahimsait/Beyefendi-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull Ibrahimsait/Beyefendi-GGUF:F16
Run and chat with the model
lemonade run user.Beyefendi-GGUF-F16
List all available models
lemonade list
- Hermes Agent
How to use Ibrahimsait/Beyefendi-GGUF with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Ibrahimsait/Beyefendi-GGUF:F16
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default Ibrahimsait/Beyefendi-GGUF:F16
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use Ibrahimsait/Beyefendi-GGUF with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf Ibrahimsait/Beyefendi-GGUF:F16
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "Ibrahimsait/Beyefendi-GGUF:F16" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Beyefendi GGUF
Bu depo, Türkçe Beyefendi modelinin llama.cpp uyumlu F16 ve Q4_K_M GGUF
dosyalarını hedefler. Modelin eğitim kartı ve veri zinciri için
ibrahimsait/Beyefendi ile bu depodaki PROVENANCE.md okunmalıdır.
Birleştirilmiş modelin upstream foundation checkpoint'i
Qwen/Qwen3.5-2B'dir.
Dosyalar
| Dosya | Nicemleme | Byte | SHA-256 |
|---|---|---|---|
Beyefendi-F16.gguf |
F16 | 3.775.708.544 | 5759535ae4e2e33f9c88396f1f190fa5133f6edb7d2f5ad2acf7b688b10b2528 |
Beyefendi-Q4_K_M.gguf |
Q4_K_M | 1.274.396.032 | 48aa960010119b04ef8d77f6fd8bc63349ca1fc39f052b92325ad7bbf28792d2 |
GGUF dönüşümü, Qwen3.5 desteği bulunan llama.cpp
298219f985b09d93df515ca708736665468ca827 revizyonuyla hazırlandı.
Eski llama.cpp/Ollama sürümleri qwen3_5 mimarisini tanımayabilir.
llama.cpp
llama-cli \
-m Beyefendi-Q4_K_M.gguf \
-ngl 99 \
-c 4096 \
-p "Türkiye'nin başkenti neresidir? Kısa yanıtla."
GPU offload kullanılamıyorsa -ngl 0 ile CPU yolu seçilebilir. Gerçek VRAM
tüketimi; context, batch, KV cache türü, llama.cpp derlemesi ve GPU'ya
aktarılan katman sayısına bağlıdır.
İndirme
Depo herkese açıktır; dosya doğrudan indirilebilir:
hf download Ibrahimsait/Beyefendi-GGUF Beyefendi-F16.gguf \
--local-dir ./Beyefendi-GGUF
Ollama
Q4'e göre tercih edilen F16 sürümü (deneysel):
FROM ./Beyefendi-F16.gguf
PARAMETER num_ctx 4096
PARAMETER temperature 0.2
ollama create beyefendi-f16 -f Modelfile
ollama run beyefendi-f16 --think=false
Q4_K_M aynı yöntemle FROM ./Beyefendi-Q4_K_M.gguf kullanılarak kurulabilir,
ancak aşağıdaki kalite regresyonu nedeniyle yalnızca deneysel seçenektir.
Canlı kontrol uyarısı — 24 Temmuz 2026: F16,
temperature=0veseed=42ile yinelenen “Türkiye'nin başkenti nedir?” kontrolünde yanlış biçimde “İstanbul” yanıtını verdi. Aşağıdaki kayıtlı context smoke testleri geçmiş olsa da bu yeni bulgu nedeniyle F16 da olgusal olarak güvenilir veya kalite onaylı sayılmamalıdır.
Doğrulama durumu
Her iki dosyanın GGUF magic başlığı, byte boyutu ve SHA-256 değeri yayın manifestiyle doğrulandı. Q4_K_M, llama.cpp CPU smoke testinde “Türkiye'nin başkenti Ankara'dır.” yanıtını verdi. 8 thread CPU benchmark ortalaması 512-token prompt için 136,75 token/s, 128-token generation için 20,34 token/s oldu.
Ollama F16 yolunda 2K, 4K ve 8K context runtime ile üç semantik smoke testinin tamamı geçti. 24 GB kartta model yüklenmeden önceki toplam kullanım çıkarılarak ölçülen ek tepe GPU kullanımı 4.059 MiB'dı; 8 GiB bütçeye 4.133 MiB pay kaldı.
Q4_K_M yolunda aynı üç context runtime testi çalıştı. Ek tepe GPU kullanımı 1.661 MiB, bütçe payı 6.531 MiB oldu. Her iki yöntem de 24 GB karttaki artımsal ölçümdür; fiziksel 8 GB kart testi değildir.
Q4 kalite smoke'u geçmedi. Ollama kısa testte Ankara yerine yanlış
biçimde İstanbul dedi; multi-turn testinde de istenen sıralı biçimi tam
karşılamadı. Uzun 4K test geçti, fakat Q4 raporunun
quality_smoke_passed ve genel passed alanları false değerindedir.
F16 aynı üç kayıtlı context testini geçti; ancak yukarıdaki daha yeni
deterministik kontrolü geçmedi. Bu nedenle iki GGUF da kök neden
ayrıştırılana kadar “yayına hazır kalite” olarak değerlendirilmemelidir.
Makinece okunabilir sonuçlar ve kaynak rapor karmaları
EVALUATION_SUMMARY.json dosyasındadır.
Sınırlamalar
- Q4_K_M, BF16/F16 modele göre kalite kaybı oluşturabilir; kapsamlı eşlenik quant kalite koşusu belgelenmemişse kaybın büyüklüğü bilinmez.
- Ollama semantik smoke başarısızlıkları; chat template/runtime farkı, nicemleme veya model davranışı ayrıştırılana kadar her iki GGUF için de olgusal güvenilirlik bloğudur.
- Model olgusal hata, halüsinasyon, önyargı ve güvensiz öneri üretebilir.
- 262K config sınırı, bu GGUF dosyalarının o context'te pratik olarak doğrulandığı anlamına gelmez; önerilen başlangıç 4K'dır.
- Tıp, hukuk, finans veya diğer yüksek riskli kararlar için kullanılmamalıdır.
- Upstream Qwen config'leri
15852e8c16360a2fea060d615a32b45270f8a8fcrevizyonuna sabittir; final eğitim özeti bu SHA'yı ayrıca tekrarlamaz.
Lisans ve atıf durumu
license: other bir lisans hibesi değildir. Qwen temel modeli Apache-2.0,
SFT verisi Apache-2.0, Wikipedia CPT verisi CC-BY-SA-3.0/GFDL soyundadır.
Nihai Beyefendi dağıtım şartları proje sahibi/hukuk incelemesi bekler. Public
erişim, ağırlıkların yeniden kullanımı veya yeniden dağıtımı için ek bir lisans
hakkı verildiği anlamına gelmez.
LICENSE-APACHE-2.0-BASE.txt yalnız temel modelin lisans metnidir.
- Downloads last month
- 23
4-bit
16-bit