Özet: GPU server hosting, NVIDIA L40S, A100 veya H100 gibi yüksek bellekli grafik işlemcilerine saatlik veya aylık abonelikle erişim sağlayan bir bulut hizmetidir. Yapay zeka eğitimi, inference, 3D render ve bilimsel hesaplama iş yüklerini doğrudan satın alma maliyeti olmadan üretime taşımanın en hızlı yoludur; doğru GPU seçimi modelin parametre sayısına, kullanılan precision'a ve eş zamanlı kullanıcı sayısına göre yapılır.
Ana noktalar:
- 7B-13B model inference için L40S, 30B-70B için A100 80GB, 70B+ eğitim için H100 önerilir.
- Saatlik GPU kiralama, kısa süreli eğitim ve PoC için sürekli üretime göre dramatik şekilde daha ekonomiktir.
- vGPU çoğu workload için dedicated GPU'ya kıyasla yalnızca %5-10 overhead getirir.
- Docker konteynerleri farklı CUDA sürümlerini izole çalıştırarak uyumluluk sorunlarını çözer.
- Bir L40S GPU, INT4 quantize 8B model ile saniyede 80-100 token üretip 20-30 eş zamanlı kullanıcıya hizmet verir.
Yapay zeka modellerinin eğitiminden 3D render farmlarına, gerçek zamanlı inference servislerinden bilimsel hesaplamaya kadar pek çok modern iş yükü artık CPU değil GPU gerektiriyor. Ancak NVIDIA H100 veya A100 gibi üst seviye GPU'lara doğrudan yatırım yapmak yüz binlerce dolara mal oluyor, lisanslama ve elektrik gibi gizli maliyetlere eklemek gerekiyor; sonuçta küçük ve orta ölçekli şirketlerin büyük bölümü için ekonomik değil. GPU server hosting tam bu noktada devreye giriyor: ihtiyaç duyduğunuz GPU gücüne saatlik veya aylık abonelikle erişim.
Bu rehber, AI projelerini planlayan veri bilimciler, 3D ve görsel efekt stüdyoları, mühendislik şirketleri ve BT yöneticileri için yazıldı. Hangi GPU'nun hangi iş yüküne uygun olduğunu, dedicated GPU server ile vGPU farkını, doğru CPU/RAM/disk oranını, saatlik kiralama avantajlarını ve İstanbul DC'de hosting almanın KVKK avantajlarını net şekilde aktarıyoruz.
Sonunda, on-premise satın alma ile bulutta GPU kiralamanın 12 aylık TCO karşılaştırmasını yapacak ve sizin senaryonuza uygun konfigürasyonu seçebilecek bilgiye sahip olacaksınız.
IDC raporları, yapay zeka altyapısı için kurumsal GPU harcamalarının küresel ölçekte hızla büyüdüğünü gösteriyor (kaynak).
GPU server hosting nedir?
GPU server hosting, içinde bir veya birden fazla NVIDIA (nadiren AMD) GPU bulunan fiziksel ya da sanal sunucuların bir bulut sağlayıcıdan kiralandığı modeldir. Donanıma yatırım yapmak yerine kullandığınız kadar ödersiniz.
Dedicated GPU server, vGPU ve cloud GPU farkı
Dedicated GPU server, fiziksel sunucunun (ve içindeki tüm GPU'ların) tamamen size tahsis edildiği bare-metal modeldir; en yüksek performansı sunar. vGPU (virtual GPU), bir fiziksel GPU'nun NVIDIA'nın vGPU yazılımı ile birden fazla sanal makineye paylaştırıldığı modeldir; daha ekonomiktir, daha esnektir. Cloud GPU ise sanal makinede çalışan, otomasyon ve API ile yönetilen GPU instance'ıdır.
Eğitim yükü için dedicated, paylaşımlı CAD/VDI senaryosu için vGPU, esnek inference iş yükü için cloud GPU genellikle doğru seçimdir.
Hangi iş yükleri için GPU gerekir?
GPU paralel hesaplama için tasarlandığından, binlerce küçük işin aynı anda yapıldığı her iş yükünde CPU'dan dramatik şekilde hızlıdır: derin öğrenme (matris çarpımı), 3D render (ray tracing), video transkodlama, kriptografik hesaplama, bilimsel simülasyon, görüntü işleme.
Web sunucusu, veritabanı veya genel iş uygulamaları için GPU gereksizdir; bu iş yükleri sequential ağırlıklıdır.
CPU-only vs. GPU karşılaştırması
| İş Yükü | CPU (örnek süre) | GPU (örnek süre) | Hız farkı |
|---|---|---|---|
| Llama 3 8B inference (1k token) | ~30 saniye | ~1 saniye | 30x |
| 1080p video transkod (1 dk) | ~3 dakika | ~10 saniye | 18x |
| Stable Diffusion 1024x1024 görsel | ~5 dakika | ~5 saniye | 60x |
| Genel web uygulaması | hızlı | gereksiz | n/a |
Tablo örnek niteliğindedir; gerçek performans donanıma, modele ve optimizasyona göre değişir.
GPU sunucularının kullanım alanları
GPU'nun en çok talep gördüğü beş senaryo aşağıda.
Yapay zeka model eğitimi (LLM, CV, NLP)
Büyük dil modeli (LLM) eğitimi, GPU server hosting pazarının en hızlı büyüyen dilimi. 7B-13B parametreli modellerin LoRA ile fine-tune'u tek bir A100 üzerinde yapılabilirken, 70B model tam eğitimi 4-8 H100 ister. Computer Vision ve NLP modelleri de benzer GPU gereksinimleri gösterir.
AI inference ve gerçek zamanlı tahmin
Eğitilen modeli üretimde çalıştırmak (inference), eğitime kıyasla daha az GPU bellek ister; ancak gecikme kritiktir. Müşteri sohbet botu, anomali tespiti, ürün öneri sistemi gibi gerçek zamanlı senaryolarda L4 ve L40S GPU'lar tipik tercihtir.
3D rendering (Blender, Octane, V-Ray)
Mimarlık görselleştirme, mobilya kataloğu render'ı, animasyon stüdyoları ve VFX işleri için RTX 6000 Ada veya A6000 GPU'lar idealdir. Saatlik kiralama, sezonluk yoğun render farmı senaryolarında klasik on-premise iş istasyonundan kat kat ekonomiktir.
Bilimsel hesaplama ve simülasyon
Hesaplamalı akışkanlar dinamiği (CFD), moleküler dinamik simülasyonu, sismik analiz gibi araştırma iş yükleri için A100 ve H100 GPU'lar tercih edilir. Üniversite araştırma grupları ve mühendislik firmaları proje bazlı GPU kiralamayı satın almaya tercih ediyor.
Sanal iş istasyonları (CAD, CAM)
vGPU teknolojisi sayesinde tek bir A40 veya RTX 6000 Ada GPU, 4-8 CAD tasarımcısına aynı anda yüksek performanslı sanal iş istasyonu sunar. SolidWorks, AutoCAD, Catia ve Revit için yaygın bir mimari haline geldi.
Mimari, mühendislik ve VFX şirketleri için bu modelin değeri, kişi başı 40-80 bin TL'lik fiziksel iş istasyonu yatırımını ortadan kaldırmasıdır. Yeni proje başladığında ek tasarımcı saatlik veya aylık olarak eklenir, proje bittiğinde kullanım sonlandırılır; klasik donanım modelinde aylar süren satın alma süreci dakikalara iner.
GPU modelleri ve hangi senaryo için uygun?
NVIDIA'nın ürün ailesi geniştir; doğru seçim kritik.
NVIDIA H100 / A100 — büyük model eğitimi
H100, transformer mimari iş yükleri için tasarlanan TensorFloat-32 ve FP8 desteğiyle A100'e kıyasla 3-9 kata kadar daha yüksek throughput (veri aktarım kapasitesi) verir. 70B+ LLM eğitimi ve hyperscale inference için tek doğru seçenektir. 80 GB HBM3 bellek ile büyük modellerin tek GPU'ya sığmasını mümkün kılar.
A100 (40 GB veya 80 GB), bir önceki nesil olarak hâlâ kurumsal AI ortamlarında çok yaygın kullanılıyor. Eğitim ve orta-büyük ölçek inference için fiyat/performans dengesi açısından öne çıkar.
NVIDIA L4 / T4 — inference ve video
L4, modern inference iş yükleri (LLM, CV, video transkod) için tasarlanmış, düşük güç tüketimli (72W) bir GPU'dur. T4 ise daha eski ama hâlâ etkin; özellikle Tesla T4 üzerinden yıllardır video platformları milyarlarca akışı transkod ediyor.
NVIDIA RTX 6000 Ada / A6000 — rendering ve grafik
48 GB VRAM ile büyük 3D sahneleri tek seferde yükleyebilen iş istasyonu sınıfı GPU'lar. Blender Cycles, Octane Render, V-Ray ve Unreal Engine workflow'ları için tipik tercih.
NVIDIA vGPU profilleri — paylaşımlı kullanım
vGPU yazılımı, fiziksel GPU'yu Q1 (1 GB), Q2 (2 GB), Q4 (4 GB), Q8 (8 GB) gibi profillere böler. Aynı GPU'yu 4-16 sanal masaüstüne paylaştırmak, kişi başı maliyeti dramatik şekilde düşürür.
GPU server hosting alırken dikkat edilmesi gerekenler
GPU markası ve modeli kadar önemli, çevre bileşenler.
GPU bellek (VRAM) ve NVLink
Modelinizin VRAM ihtiyacı GPU seçimini birinci derecede belirler. Llama 3 8B FP16 olarak 16 GB VRAM ister, INT4 quantization ile 5 GB'a iner. Birden fazla GPU'yu birleştirip büyük model yüklemek için NVLink (NVIDIA'nın yüksek bant genişlikli interconnect'i) şarttır; A100 ve H100 platformlarında standart olarak gelir.
CPU, RAM ve NVMe oranı
GPU'nun arkasında yetersiz CPU veya yavaş disk varsa GPU bekleyişte kalır. Tipik bir öneri: her bir GPU için 8-16 CPU çekirdek, 64-128 GB RAM ve veri seti büyüklüğüne göre 1-4 TB NVMe SSD. Eğitim veri setleri için NVMe veri okuma hızı sıklıkla darboğaz oluşturur.
Ağ bant genişliği ve InfiniBand
Tek sunucu senaryosunda 10-25 Gbps standart ağ yeterlidir. Çok düğümlü dağıtık eğitim senaryolarında 200 Gbps InfiniBand veya RoCE düşünülmelidir; aksi halde GPU'lar birbirini bekleyerek zaman kaybeder.
SLA, uptime ve destek seviyesi
GPU sunucusu eğitim sırasında düşerse, gün veya hafta süren bir iş kaybolur (checkpoint yoksa). %99,9+ SLA, redundant güç ve soğutma, ve 7/24 yerel teknik destek bu senaryoyu engellemek için gereklidir.
Saatlik vs. aylık GPU kiralama
Doğru faturalama modeli, iş yükünün karakterine göre seçilir.
Eğitim için saatlik kiralama avantajı
Bir model eğitimi 6 saat sürüyorsa, eğitim bittikten sonra GPU'yu kapatıp saatlik faturadan tasarruf edebilirsiniz. Bir aylık plan satın almak, kullanmadığınız 700+ saati boşa ödemek anlamına gelir.
Üretim ortamı için sabit aylık plan
Production inference servisi 7/24 ayakta olmak zorundadır; bu senaryoda aylık veya yıllık plan, saatlik faturadan %30-50 daha düşük birim maliyet sunar.
Spot ve rezerve GPU fiyatlandırması
Bazı sağlayıcılar atıl kapasiteyi indirimli "spot" olarak satar. Kesintilere dayanıklı (checkpoint'leyen) eğitim iş yükleri için %60-80 indirim sağlayabilir. Rezerve plan ise 1-3 yıllık taahhüt karşılığında benzer indirim sağlar; production iş yükleri için daha uygundur.
GPU server kurulumu ve yazılım yığını
Donanım kadar yazılım yığını da kritik.
CUDA, cuDNN ve NVIDIA Driver
NVIDIA driver, CUDA toolkit ve cuDNN sürümleri arasındaki uyumluluk matrisi önemlidir. Sağlayıcınızın hazır image'ler sunması (Ubuntu + NVIDIA driver + CUDA 12 + cuDNN 8) ilk gün üretkenliği büyük ölçüde artırır.
Docker, nvidia-container-toolkit, Kubernetes
GPU iş yüklerini konteynerize etmek standart pratik haline geldi. nvidia-container-toolkit ile Docker container'ları GPU'ya erişebilir; Kubernetes ortamlarında ise NVIDIA GPU Operator ile cluster genelinde otomatik GPU schedule edilir.
PyTorch, TensorFlow ve JupyterHub
PyTorch günümüzde AI araştırmasında baskın framework; TensorFlow ise production deployment'larda hâlâ güçlü. JupyterHub, veri bilimcilerin notebook'ları paylaşımlı GPU sunucusunda çalıştırmasını sağlar.
Model izleme: Prometheus + DCGM
NVIDIA DCGM (Data Center GPU Manager), GPU sıcaklığı, VRAM kullanımı, throughput (veri aktarım kapasitesi) ve hata sayılarını metrik olarak yayar. Prometheus + Grafana ile görselleştirildiğinde, üretim ortamı sorunlarını proaktif olarak yakalarsınız.
Yurt içi vs. yurt dışı GPU hosting
Lokasyon, performansı ve uyumu doğrudan etkiler.
Latency (gecikme süresi): İstanbul vs. Frankfurt karşılaştırması
İstanbul'daki bir kullanıcı için aynı şehirdeki GPU sunucusuna 5-10 ms tipik ping ile bağlanır; Frankfurt'taki bir sunucu 40-60 ms ister. Sesli AI asistan veya gerçek zamanlı tahmin gibi senaryolarda bu fark belirleyici olabilir.
Veri transfer maliyeti ve hızı
Eğitim veri setleri TB'lar boyutunda olabilir. Yurt dışı sunucuya yüklemek hem saat hem de egress trafik ücreti ile maliyet üretir. Yurt içi sunucuda veri lokal kaldığı için bu maliyetler ortadan kalkar.
KVKK uyumu ve veri yerelleştirme
Eğitim verisi kişisel veri içeriyorsa, yurt dışı sağlayıcıda işlemek KVKK kapsamında yurt dışına aktarım hükmüne tabidir; açık rıza veya bağlayıcı kurumsal kurallar gerekir. Yurt içi GPU hosting, bu yükümlülüğü büyük ölçüde basitleştirir.
GPU hosting fiyatlandırması ve TCO
Karar verirken matematik yapmak şart.
Cloud GPU vs. on-premise satın alma
Bir NVIDIA H100 SXM5 GPU'nun satın alma maliyeti 30.000+ USD seviyesindedir; sunucu (CPU, RAM, ağ), elektrik, soğutma ve operasyon maliyetleri eklendiğinde 80.000+ USD ilk yatırım çıkar. Aynı kapasiteyi 12 ay bulutta kiralamak, yaklaşık %40-60 oranında daha düşük toplam maliyet üretir; üstelik amortisman riski sağlayıcıda kalır.
12 aylık toplam sahip olma maliyeti örneği
Aşağıdaki tablo örnek bir senaryodur; gerçek rakamlar tedarikçi, indirim ve hacme göre değişir.
| Kalem | On-Premise (örnek) | Bulutta Kiralama (örnek) |
|---|---|---|
| İlk donanım yatırımı | Yüksek | Yok |
| Elektrik (12 ay) | Önemli | Sağlayıcıda |
| Soğutma | Önemli | Sağlayıcıda |
| Veri merkezi alanı | Var | Yok |
| Operasyon personeli | 0,5 FTE | Minimum |
| 3 yıl sonra değer kaybı | %50-70 | n/a |
Lisans ve elektrik gizli maliyetleri
On-premise senaryoda NVIDIA AI Enterprise lisansı, hipervizör lisansı, kurumsal Linux desteği ve enterprise kurumsal yazılım maliyetleri eklenir. Elektrik tek başına bir H100 sunucu için aylık 1.500-3.000 TL eklenebilir. Bulut kiralamada bu kalemlerin hepsi tek fatura içinde toplanmıştır.
CNCF ekosistem raporları, GPU iş yüklerinin Kubernetes üzerinde konteynerleştirilmesinin endüstri standardı haline geldiğini ortaya koyuyor (kaynak).
Sıkça sorulan sorular (SSS)
Hangi GPU benim AI modelim için uygundur?
7B-13B model orta hacim inference için L40S, 30B-70B için A100 80GB, 70B+ eğitim için H100 önerilir. Seçim modelin parametre sayısı, kullanılan precision (FP16, INT8, INT4) ve eş zamanlı kullanıcı sayısının kombinasyonuyla belirlenir.
Saatlik kiralama gerçekten daha ucuza mı geliyor?
Saatlik kiralama yalnızca kısa süreli iş yükleri için daha ucuzdur; 7/24 sürekli üretim ortamlarında aylık plan daha ekonomiktir. Eğitim, batch işleme veya geçici PoC senaryoları için saatlik fiyatlandırma dramatik tasarruf sağlar.
vGPU performansı dedicated GPU'ya göre nasıl?
vGPU çoğu workload için dedicated GPU'ya kıyasla yalnızca %5-10 overhead getirir ve performans farkı pratikte fark edilemez. Tek istisna, tek bir iş yükünün GPU bant genişliğini tamamen kullandığı extreme HPC senaryolarıdır.
Veri setlerimi yüklerken trafik ücreti var mı?
Çoğu sağlayıcıda gelen trafik (ingress) ücretsizdir; giden trafik (egress) belirli bir kotanın üzerinde ücretlendirilir. Yurt içi sağlayıcılar genellikle Türkiye içi trafiği ücretsiz veya çok düşük tutar; bu, büyük veri setleri için önemli bir maliyet avantajıdır.
CUDA sürüm uyumluluğu nasıl yönetilir?
Docker konteynerleri kullanarak farklı CUDA sürümlerini aynı sunucuda izole biçimde çalıştırabilirsiniz. PyTorch ve TensorFlow için NVIDIA resmi CUDA temel imajları yayınlar; bu imajlar üzerinde yeniden üretilebilir build pipeline'ı kurmak best practice'tir.
GPU sunucumda kaç eş zamanlı kullanıcı destekleyebilirim?
Bir L40S GPU, INT4 quantize edilmiş 8B model ile saniyede 80-100 token üretip 20-30 eş zamanlı sohbet kullanıcısına hizmet verebilir. Inference framework (vLLM, TGI) ve batching stratejisi bu rakamı doğrudan etkiler; doğru framework seçimi throughput (veri aktarım kapasitesi)'u 2-3 katına çıkarabilir.
Cloud4U Türkiye GPU Server Hosting ile yapay zeka projelerinizi hızlandırın
GPU pazarındaki dalgalı arz ve yüksek satın alma maliyetleri göz önüne alındığında, bulutta GPU kiralamak çoğu ekip için en akıllı strateji haline geldi. Cloud4U Türkiye GPU Server Hosting, İstanbul veri merkezinde NVIDIA A100 ve H100 sınıfı GPU'larla, KVKK uyumlu ve Türkçe destekli bir altyapı sunar.
- İstanbul veri merkezinde NVIDIA A100 / H100 GPU sunucuları, %99,9 SLA
- KVKK uyumlu private inference ve yönetilen ML yazılım yığını (CUDA, PyTorch, vLLM)
- Saatlik veya aylık fiyat seçenekleri, TRY ile faturalama ve 7/24 Türkçe destek
AI projelerinizi prototipten production'a taşımak için doğru GPU konfigürasyonunu seçmek üzere Cloud4U Türkiye GPU Server Hosting sayfasını ziyaret edin ve mimari önerisi için ekibimizle iletişime geçin.