Kısa cevap: Evet, Llama, DeepSeek, Mistral ve Qwen gibi açık kaynak LLM'leri kendi GPU sunucunuzda Ollama ile tek komutla çalıştırabilirsiniz. Gereken temel şey yeterli VRAM'e (7B modeller için 6-8 GB, 30B için 24 GB) sahip bir ekran kartlı sunucudur.

Yapay zeka modellerini kullanmak için tek yol OpenAI veya benzeri bulut API''ları değil. Llama, DeepSeek, Mistral ve Qwen gibi açık kaynak büyük dil modellerini (LLM) kendi sunucunuzda çalıştırabilir; verilerinizi dışarı çıkarmadan, token başına ücret ödemeden ve tam kontrolle kullanabilirsiniz. Bu rehberde Ollama ile bir GPU sunucusuna adım adım LLM kurulumunu ve gereken donanımı anlatıyoruz.

Neden LLM''i Kendi Sunucunuzda Çalıştırmalısınız?

  • Veri gizliliği: İstemleriniz ve verileriniz üçüncü taraf bir bulut servisine gitmez, kendi sunucunuzda kalır. KVKK ve kurumsal gizlilik açısından kritik avantaj.
  • Maliyet: Bulut API''lar token başına ücretlendirir; yoğun kullanımda fatura hızla büyür. Kendi sunucunuzda sabit aylık maliyetle sınırsız istek yaparsınız.
  • Kontrol ve özelleştirme: Model seçimi, ince ayar (fine-tuning) ve sistem entegrasyonu tamamen sizin elinizde.
  • Kesintisiz erişim: Dış servis limitlerine veya kesintilerine bağlı kalmazsınız.

LLM Çalıştırmak İçin Hangi Donanım Gerekir?

LLM performansında belirleyici olan GPU''nun VRAM (ekran kartı belleği) miktarıdır. Kaba bir rehber:

  • 7B parametreli modeller (Llama 3 8B, Mistral 7B, DeepSeek 7B): 4-bit nicelenmiş halde 6-8 GB VRAM yeterli. Başlangıç için ideal.
  • 13B-14B modeller: 10-16 GB VRAM önerilir.
  • 30B-34B modeller: 24 GB VRAM''li bir kartla (RTX serisi) rahatça çalışır.
  • 70B ve üzeri: 40 GB+ VRAM veya çoklu GPU gerekir.

Ayrıca modeli diskten belleğe hızlı yüklemek için NVMe SSD ve yeterli sistem RAM''i (16 GB ve üzeri) önemlidir. Vulut''un ekran kartlı (GPU) sunucuları RTX serisi ekran kartları, NVMe disk ve yüksek frekanslı AMD Ryzen işlemcilerle bu iş yükleri için hazırdır.

Ollama ile Adım Adım LLM Kurulumu

Ollama, açık kaynak LLM''leri tek komutla indirip çalıştıran en pratik araçtır. Ubuntu tabanlı bir GPU sunucusunda kurulum:

  1. Ollama''yı kurun:
    curl -fsSL https://ollama.com/install.sh | sh
  2. NVIDIA sürücüsü ve CUDA''nın kurulu olduğundan emin olun (GPU sunucularımızda hazır gelir).
  3. Bir model indirip çalıştırın:
    ollama run llama3  veya  ollama run deepseek-r1
  4. API olarak kullanmak için Ollama varsayılan olarak http://localhost:11434 üzerinde bir REST API sunar; uygulamanızı buraya bağlarsınız.
  5. Dışarıdan güvenli erişim için bir reverse proxy (Nginx) + SSL ve IP kısıtlaması ekleyin.

Hangi Modeli Seçmelisiniz?

  • Llama 3 (8B): Genel amaçlı, dengeli, Türkçe dahil çok dilli. Başlangıç için en güvenli tercih.
  • DeepSeek-R1: Akıl yürütme ve kod için güçlü; matematik ve programlama görevlerinde öne çıkar.
  • Mistral / Mixtral: Hız ve verimlilik odaklı.
  • Qwen: Çok dilli ve uzun bağlam desteği güçlü.

Sunucu türü seçiminde kararsızsanız yapay zeka ve render için GPU sunucu rehberimize göz atabilir, ihtiyacınıza uygun yapılandırma için yapay zeka sunucusu sayfamızı inceleyebilirsiniz.

Sık Sorulan Sorular

LLM çalıştırmak için mutlaka GPU gerekir mi?

Küçük modeller CPU''da da çalışır ama çok yavaştır. Gerçek zamanlı ve verimli kullanım için GPU şarttır; özellikle VRAM miktarı, çalıştırabileceğiniz model boyutunu belirler.

Kendi sunucumda LLM çalıştırmak bulut API''dan ucuz mu?

Düşük kullanımda bulut API''lar pratik olabilir, ancak yoğun ve sürekli kullanımda kendi GPU sunucunuz sabit aylık maliyetle sınırsız istek imkanı sunarak genellikle çok daha ekonomik olur.

Verilerim kendi sunucumda gerçekten güvende mi?

Evet. Self-hosted bir LLM''de istemler ve veriler sunucunuzdan dışarı çıkmaz. Vulut GPU sunucuları Türkiye''de barındırıldığı için veri KVKK kapsamında yurt içinde kalır.

Türkçe için en iyi açık model hangisi?

Llama 3 ve Qwen serisi Türkçede güçlü sonuç verir. Kullanım senaryonuza göre birkaç modeli test edip karşılaştırmanız en doğrusudur; kendi sunucunuzda bunu ücretsiz ve sınırsız yapabilirsiniz.