TR EN RU
Teknik Görüşme
İhtiyaç GPU kaynağı Ölçekleme GPU Cloud

GPU Cloud: Yapay Zeka ve LLM İş Yükleri İçin GPU Kapasitesi

Donanım yatırımı yapmadan GPU kapasitesine erişin; LLM inference, fine-tuning ve model eğitimi için kaynağı ihtiyaca göre büyütün veya küçültün.

Kapsam

Yapay zeka projeleriniz için ihtiyaç duyduğunuz GPU kapasitesini bulut modeliyle sağlıyoruz: GPU'lu sanal sunucular veya size ayrılmış GPU sunucular, depolama, ağ ve erişim yapılandırmasıyla birlikte. GPU modeli, kapasite, veri konumu ve faturalama modeli teklif aşamasında ihtiyacınıza göre netleştirilir.

Öne Çıkan Başlıklar

  • Yatırım yapmadan hızlı başlangıç
  • İhtiyaca göre büyüyen ve küçülen GPU kapasitesi
  • LLM inference, fine-tuning ve eğitim ortamları
  • İzole ağ ve güvenli erişim
  • Daha sonra kendi sunucunuza taşınabilir yapı

GPU Cloud mu, Kendi GPU Sunucunuz mu?

İki model de aynı GPU'ları kullanır; fark yatırımın, işletimin ve esnekliğin kimde olduğundadır.

KriterGPU CloudKendi GPU sunucunuz
Başlangıç yatırımıYok, kullanım kadar ödemeDonanım satın alımı
Başlangıç süresiKapasite uygunsa kısa süredeTedarik ve kurulum süresi
Ölçeklemeİhtiyaca göre artırılıp azaltılırYeni donanım alımı gerekir
Uzun vadeli maliyetDönemsel kullanımda avantajlıSürekli yüksek kullanımda avantajlı
Veri konumuTeklif aşamasında netleştirilirTamamen kurum içinde
İşletimAltyapı sağlayıcıdaSizin ekibinizde

Pratik kural: GPU'lar günün büyük bölümünde ve uzun süre dolu çalışacaksa kendi sunucunuz, kullanım dönemsel veya henüz belirsizse GPU Cloud daha ekonomik olur. Detaylı karşılaştırma için GPU ve LLM sunucu sayfamıza bakabilirsiniz.

Kullanım Senaryoları

  • LLM pilotu: donanım almadan önce modelin iş ihtiyacını karşılayıp karşılamadığını test etmek.
  • Fine-tuning: LoRA veya QLoRA ile açık ağırlıklı modelleri kurum verisine uyarlamak.
  • Model eğitimi: belirli süreli, yoğun hesaplama gerektiren eğitim işleri.
  • Toplu inference: belge sınıflandırma, özetleme ve veri çıkarımı gibi büyük hacimli işler.
  • RAG uygulamaları: kurum içi asistan ve arama çözümleri için inference uç noktası.
  • Görüntü işleme ve render: bilgisayarlı görü, simülasyon ve 3B render iş yükleri.

Doğru GPU Kaynağını Seçmek

Kaynak seçimi modelin belleğe sığmasıyla başlar. Model ağırlıkları için kaba hesap: parametre sayısı × parametre başına bayt (FP16'da 2, 8-bit'te 1, 4-bit'te yaklaşık 0,5). Örneğin 7–8B bir model FP16'da yaklaşık 16 GB, 70B bir model ise yaklaşık 140 GB VRAM ister; buna KV önbelleği için pay eklenir.

  • Paylaşımlı mı, ayrılmış mı: MIG ile bölünmüş GPU küçük iş yükleri için ekonomiktir; büyük modeller ve eğitim için tam GPU veya ayrılmış sunucu gerekir.
  • Tek GPU mu, çoklu GPU mu: büyük modeller birden fazla GPU'ya bölünür; GPU'lar arası bağlantı (NVLink) verimi belirler.
  • Depolama ve veri aktarımı: veri setlerinin yüklenmesi, model dosyaları ve kontrol noktaları (checkpoint) için kapasite ve hız.
  • Ağ: uygulamalarınızla GPU ortamı arasında VPN veya özel bağlantı.

Güvenlik, Veri ve KVKK

  • İzolasyon: her müşterinin ortamı ağ ve erişim düzeyinde ayrılır.
  • Erişim: SSH anahtarı veya kimlik tabanlı erişim, MFA ve VPN ile güvenli bağlantı.
  • Şifreleme: veri aktarımında ve depolamada şifreleme.
  • Veri yaşam döngüsü: iş bitiminde verinin ve modellerin silinmesi, gerekirse silme kaydı.
  • KVKK: kişisel veri içeren iş yüklerinde veri konumu, alt işleyenler ve aktarım koşulları sözleşme öncesinde netleştirilir.

GPU Maliyetini Kontrol Altında Tutmak

  • Kullanılmayan GPU kaynaklarını kapatmak veya küçültmek
  • Modeli kuantize ederek (8-bit, 4-bit) daha küçük GPU ile çalıştırmak
  • Eğitimde düzenli checkpoint alarak kesintiden sonra kaldığı yerden devam etmek
  • Küçük iş yüklerinde tam GPU yerine paylaşımlı GPU kullanmak
  • Kullanım raporlarıyla hangi projenin ne kadar GPU tükettiğini izlemek

Bu Hizmet Kimler İçin?

Yapay zeka projesine donanım yatırımı yapmadan başlamak isteyen kurumlar, dönemsel olarak yoğun GPU ihtiyacı olan AR-GE ekipleri, kendi GPU sunucusunu almadan önce boyutlandırmayı test etmek isteyenler ve yazılım şirketleri için uygundur.

Kapsam ve Teslimatlar

  • İş yükü ve GPU ihtiyacı analizi
  • GPU ortamının kurulumu: sürücü, CUDA, container ve inference motoru
  • Ağ, erişim ve güvenlik yapılandırması
  • Performans ve maliyet testi
  • Kullanım ve maliyet raporlaması
  • Gerekirse kendi sunucunuza geçiş planı

Örnek Senaryo

Hipotetik bir e-ticaret şirketi, ürün açıklamalarını otomatik üreten bir LLM'i denemek istiyor. İki hafta boyunca GPU Cloud üzerinde farklı model boyutları test ediliyor; 8-bit kuantize edilmiş orta boy bir modelin yeterli olduğu görülünce sürekli kullanım için uygun kapasite belirleniyor.

Fiyatı Belirleyen Faktörler

  • GPU modeli ve adedi
  • Kullanım süresi ve sürekliliği
  • Paylaşımlı veya ayrılmış kaynak
  • Depolama ve veri aktarımı
  • Ağ ve güvenlik gereksinimleri
  • Yönetim ve destek kapsamı

Başlamadan Önce Kontrol Listesi

  • Hangi model kullanılacak ve kaç parametreli?
  • İş yükü sürekli mi, belirli bir süreyle mi sınırlı?
  • Kişisel veri veya ticari sır içeren veri işlenecek mi?
  • Veri seti boyutu ve yükleme yöntemi belli mi?
  • Uygulamalar GPU ortamına nasıl bağlanacak?
  • Başarı ölçütü ne: yanıt süresi, doğruluk, maliyet?

Sık Sorulan Sorular

GPU Cloud nedir?

GPU Cloud, yapay zeka ve yüksek performanslı hesaplama iş yükleri için GPU'lu sunucu kapasitesinin satın almak yerine hizmet olarak kullanılmasıdır. Donanım, enerji ve altyapı işletimi sağlayıcı tarafında kalır.

Hangi GPU modelleri sunuluyor?

GPU modeli ve kapasite, iş yükünüze ve güncel bulunabilirliğe göre teklif aşamasında belirlenir. İnference için L4 ve L40S sınıfı, büyük modeller ve eğitim için H100 ve üstü sınıf GPU'lar değerlendirilir.

Faturalama nasıl yapılıyor?

Faturalama modeli kullanım süresine ve kaynağın paylaşımlı veya ayrılmış olmasına göre teklif aşamasında belirlenir. Dönemsel işler ile sürekli kapasite ihtiyacı farklı modellerle fiyatlanır.

Verilerimiz nerede tutuluyor?

Veri konumu, alt işleyenler ve aktarım koşulları sözleşme öncesinde yazılı olarak netleştirilir. Kişisel veri içeren iş yüklerinde KVKK gereklilikleri bu aşamada birlikte değerlendirilir.

Kendi modelimizi ve uygulamamızı çalıştırabilir miyiz?

Evet. Ortam container tabanlı kurulduğu için kendi modelinizi, açık ağırlıklı modelleri ve kendi uygulama kodunuzu çalıştırabilirsiniz.

Daha sonra kendi GPU sunucumuza geçebilir miyiz?

Evet. Container tabanlı yapı ve standart inference motorları sayesinde iş yükü kendi GPU sunucunuza taşınabilir; GPU Cloud'da ölçülen kullanım verisi sunucu boyutlandırmasında kullanılır.