TR EN RU
Teknik Görüşme
İş yükü ve model GPU ve VRAM Kurulum ve test LLM

GPU Sunucu ve LLM Sunucusu: Şirket İçi Yapay Zeka Altyapısı

Büyük dil modellerini (LLM) ve yapay zeka iş yüklerini kendi veri merkezinizde çalıştırmak için GPU sunucuyu doğru boyutlandırıyor, kuruyor ve işletiyoruz.

Kapsam

LLM inference, RAG uygulamaları, fine-tuning ve görüntü işleme gibi yapay zeka iş yükleri için GPU sunucu seçimi, tedariki, kurulumu ve işletimi. Model boyutundan başlayıp VRAM, sunucu mimarisi, ağ, güç-soğutma ve yazılım katmanına kadar her şeyi tek planda ele alıyoruz.

Öne Çıkan Başlıklar

  • Model boyutuna göre VRAM ve GPU hesabı
  • NVIDIA L4, L40S, H100, H200 ve Blackwell seçenekleri
  • vLLM ve TensorRT-LLM ile yüksek verimli inference
  • RAG için vektör veritabanı ve kurum içi API
  • Güç, soğutma ve kabin planlaması

Neden Şirket İçi LLM Sunucusu?

Genel yapay zeka servislerine gönderilen her istem (prompt) ve belge kurum dışına çıkar. Müşteri verisi, sözleşme, kaynak kod veya ticari sır içeren iş yüklerinde bu, KVKK ve gizlilik açısından kabul edilemeyebilir. Kendi GPU sunucunuzda çalışan bir LLM ile veri kurum içinde kalır.

  • Veri kontrolü: istemler, belgeler ve çıktılar kendi altyapınızda kalır; kayıt ve saklama politikasını siz belirlersiniz.
  • Öngörülebilir maliyet: sürekli ve yüksek kullanımda, token başına ödemeye göre birim maliyet düşebilir.
  • Düşük gecikme: iç sistemlerle aynı ağda çalışan model, harici API çağrısına bağlı kalmaz.
  • Özelleştirme: açık ağırlıklı modeller kurum verisiyle RAG veya fine-tuning ile uyarlanabilir.

Karşılığında donanım yatırımı ve işletim sorumluluğu sizdedir. Kullanım dönemselse veya henüz pilot aşamasındaysanız GPU Cloud ile başlamak daha mantıklı olabilir.

Model Boyutu ve VRAM Hesabı

LLM sunucusu boyutlandırmanın ilk adımı modelin GPU belleğine (VRAM) sığmasıdır. Model ağırlıkları için kaba hesap: parametre sayısı × parametre başına bayt. FP16/BF16'da 2 bayt, 8-bit kuantizasyonda 1 bayt, 4-bit'te yaklaşık 0,5 bayt.

Model boyutuFP16 / BF168-bit4-bit
7–8B~16 GB~8 GB~4–5 GB
13–14B~28 GB~14 GB~7–8 GB
32–34B~64–68 GB~32–34 GB~16–18 GB
70B~140 GB~70 GB~35–40 GB

Tablo yalnızca model ağırlıklarını gösterir. Eşzamanlı kullanıcı sayısı ve bağlam uzunluğu arttıkça KV önbelleği için ek bellek gerekir; pratikte en az %20–30 pay bırakılır. Örneğin 70B bir model FP16'da tek 80 GB GPU'ya sığmaz, birden fazla GPU'ya bölünür.

GPU Seçimi

Doğru GPU, model boyutuna, eşzamanlı kullanıcı sayısına ve inference mı eğitim mi yapılacağına göre seçilir. Yaygın NVIDIA veri merkezi GPU'ları:

  • NVIDIA L4 (24 GB): düşük güç tüketimiyle küçük modeller, görüntü işleme ve video analitiği.
  • NVIDIA L40S (48 GB): orta boy modellerde inference, fine-tuning ve görsel iş yükleri.
  • NVIDIA H100 (80 GB): büyük modeller, yüksek verimli inference ve eğitim.
  • NVIDIA H200 (141 GB HBM3e): daha büyük modeller ve uzun bağlam için daha fazla bellek.
  • Blackwell nesli (B200, RTX PRO 6000 Blackwell Server Edition 96 GB): yeni nesil eğitim ve inference.

Güncel bulunabilirlik, teslim süresi ve fiyat hızla değiştiği için GPU modeli teklif aşamasında birlikte netleştirilir.

Sunucu Mimarisi, Ağ ve Enerji

  • PCIe veya SXM (HGX): PCIe kartlar esnek ve ekonomiktir; SXM tabanlı HGX platformları GPU'lar arasında NVLink ile çok daha yüksek bant genişliği sunar ve büyük modellerde fark yaratır.
  • CPU, RAM ve depolama: veri hazırlığı ve model yükleme için yeterli CPU çekirdeği, sistem belleği ve hızlı NVMe depolama.
  • Ağ: tek sunucuda 25/100 GbE yeterli olabilir; çok sunuculu eğitimde InfiniBand veya RoCE ile 200–400 Gb/s bağlantılar gerekir.
  • Güç ve soğutma: 8 GPU'lu bir sunucu 10 kW civarında güç çekebilir. Kabin başına güç kapasitesi, soğutma ve UPS kurulumdan önce doğrulanmalıdır.
  • Yerleşim: sunucu kendi sistem odanızda veya colocation ortamında barındırılabilir.

Yazılım Katmanı: Inference, RAG ve İzleme

  • Temel katman: Linux (Ubuntu veya RHEL), NVIDIA sürücüleri ve CUDA; Docker veya Kubernetes üzerinde NVIDIA GPU Operator.
  • Inference motoru: yüksek eşzamanlılık için vLLM, NVIDIA ortamlarında en yüksek performans için TensorRT-LLM ve Triton; küçük kurulumlarda Ollama.
  • Kurum içi API: uygulamaların değişiklik yapmadan bağlanabilmesi için OpenAI uyumlu API uç noktası, kimlik doğrulama ve kota.
  • RAG: belgelerinizi modele bağlamak için pgvector, Qdrant veya Milvus gibi vektör veritabanı ve erişim yetkisine uyan arama.
  • GPU paylaşımı: H100 gibi GPU'larda MIG (Multi-Instance GPU) ile tek GPU birden fazla izole örneğe bölünebilir.
  • İzleme: NVIDIA DCGM ile GPU kullanımı, sıcaklık, bellek ve hata takibi.

Bu Hizmet Kimler İçin?

Verisini dışarıya göndermeden LLM kullanmak isteyen kurumlar, belge ve bilgi tabanı üzerinde kurum içi asistan (RAG) kuracak ekipler, kendi modelini eğitmek veya ince ayar yapmak isteyen AR-GE birimleri ve görüntü işleme projeleri yürüten üretim ve güvenlik şirketleri için uygundur.

Kapsam ve Teslimatlar

  • İş yükü, model ve kullanıcı sayısı analizi
  • VRAM, GPU ve sunucu boyutlandırma raporu
  • Güç, soğutma ve ağ ön kontrolü
  • Donanım tedariki, kurulum ve yazılım katmanı
  • Performans testi (token/saniye, eşzamanlılık)
  • İşletim dokümantasyonu ve devir

Örnek Senaryo

Hipotetik bir hukuk bürosu, sözleşme arşivinde arama ve özetleme için LLM kullanmak istiyor ancak belgelerin dışarı çıkmaması gerekiyor. 4-bit kuantize edilmiş 70B bir model, iki adet 48 GB GPU'lu sunucuda vLLM ile çalıştırılıyor; belgeler RAG ile kullanıcı yetkisine göre aranıyor.

Fiyatı Belirleyen Faktörler

  • GPU modeli ve adedi
  • Model boyutu ve eşzamanlı kullanıcı
  • PCIe veya HGX platform
  • Depolama ve ağ ihtiyacı
  • Güç, soğutma ve barındırma
  • Yazılım ve destek kapsamı

Satın Alma Öncesi Kontrol Listesi

  • Hangi model veya model ailesi kullanılacak, kaç parametre?
  • Aynı anda kaç kullanıcı veya istek bekleniyor?
  • Sadece inference mı, yoksa fine-tuning ve eğitim de yapılacak mı?
  • Sistem odası veya kabinde yeterli güç ve soğutma var mı?
  • Kullanılacak açık modelin lisansı ticari kullanıma uygun mu?
  • İstem ve çıktıların kayıt ve saklama politikası belirlendi mi?

Sık Sorulan Sorular

LLM sunucusu için hangi GPU'yu seçmeliyim?

Model boyutu, eşzamanlı kullanıcı sayısı ve iş yükü tipine bağlıdır. Küçük ve orta modellerde L4 veya L40S, büyük modellerde ve yüksek verimde H100 veya H200, yeni nesil ve en büyük iş yüklerinde Blackwell platformları değerlendirilir.

70B parametreli bir model için ne kadar VRAM gerekir?

Yalnızca ağırlıklar için FP16'da yaklaşık 140 GB, 8-bit'te 70 GB, 4-bit'te 35–40 GB gerekir. Buna eşzamanlı kullanıcı ve bağlam uzunluğuna göre KV önbelleği eklenir; bu yüzden en az %20–30 pay bırakılır.

Kendi GPU sunucumuz mu, GPU Cloud mu?

Kullanım sürekli ve yüksekse ve verinin kurum içinde kalması gerekiyorsa kendi sunucunuz uzun vadede daha ekonomik olabilir. Pilot, dönemsel eğitim veya belirsiz talep için GPU Cloud yatırım yapmadan başlamayı sağlar.

Şirket içi LLM KVKK açısından avantaj sağlar mı?

Veri kurum altyapısında kaldığı için yurt dışı aktarım ve üçüncü taraf işleme riskini azaltır. Yine de erişim yetkisi, kayıt, saklama ve silme politikaları KVKK teknik tedbirleriyle birlikte tasarlanmalıdır.

Hangi açık modeller kullanılabilir?

Llama, Qwen, Mistral, Gemma gibi açık ağırlıklı model aileleri yaygın kullanılır. Her modelin lisans koşulları farklıdır; ticari kullanım ve kullanıcı sayısı sınırları kurulumdan önce kontrol edilmelidir.

RAG mı, fine-tuning mi?

Kurum belgelerine dayalı soru-cevap için çoğu zaman RAG yeterlidir ve belgeler güncellendikçe yeniden eğitim gerektirmez. Fine-tuning ise modelin üslubunu, formatını veya belirli bir görevdeki davranışını değiştirmek için kullanılır.

GPU sunucu ne kadar elektrik tüketir?

GPU sayısına ve modeline göre değişir; 8 GPU'lu yüksek performanslı bir sunucu 10 kW civarında güç çekebilir. Kurulumdan önce kabin güç kapasitesi, soğutma ve UPS planı yapılmalıdır.