Özet: Online yapay zeka, modellerin uzak bir bulut altyapısında çalıştırıldığı ve internet üzerinden erişildiği AI hizmetlerinin bütünüdür; kurumlar SaaS API, self-hosted GPU sunucusu veya hibrit modeller arasında seçim yapar. Doğru yaklaşım veri hassasiyetine, kullanım hacmine ve KVKK gereksinimlerine göre belirlenir; düşük hacim için SaaS API, yüksek hacim veya regüle veriler için Türkiye lokasyonunda self-hosted GPU sunucusu çoğu zaman en uygun seçenektir.
Ana noktalar:
- SaaS API hızlı başlangıç sağlar; self-hosted çözüm KVKK uyumu ve veri egemenliği için kritik avantaj sunar.
- 7B-13B parametreli model için L40S, 70B+ için A100 80GB veya H100 GPU önerilir.
- vLLM ve TGI gibi inference framework'leri token üretim hızını 3-5 katına çıkarabilir.
- İstanbul veri merkezinde private inference, KVKK denetiminde 'veri Türkiye'de işleniyor' yanıtını mümkün kılar.
- Saatlik GPU kiralama, sürekli üretim için aylık plana göre genelde daha pahalıdır; PoC ve eğitim için daha ekonomiktir.
Yapay zeka artık araştırma laboratuvarlarının dışına çıktı; bugün her ölçekten Türk şirketi müşteri hizmetlerini, pazarlama operasyonlarını ve geliştirici verimliliğini büyük dil modelleriyle yeniden tasarlıyor. Ancak "online yapay zeka" ifadesi tek bir teknolojiyi değil, birbirinden çok farklı dağıtım modellerini kapsıyor: hazır SaaS sohbet robotlarından kendi GPU sunucunuzda çalıştırdığınız özel modellere kadar geniş bir yelpaze söz konusu.
Bu rehber, BT yöneticileri, CTO'lar ve veri sorumluları için yazıldı. Hangi senaryoda hangi yaklaşımın daha doğru olduğunu, KVKK çerçevesinde verilerinizi nasıl koruyacağınızı ve bulutta kendi modelinizi çalıştırırken hangi GPU'ları, hangi araçları seçeceğinizi somut örneklerle aktarıyoruz. Amaç pazarlama broşürü değil; karar verirken kullanabileceğiniz teknik bir referans.
Sonunda, GPU saatlik kiralama ile token bazlı SaaS arasındaki gerçek toplam maliyeti karşılaştıracak ve İstanbul veri merkezinde private inference yapmanın hangi durumlarda mantıklı olduğunu göreceksiniz.
Stanford AI Index 2024 raporuna göre kurumsal AI benimsenmesi son iki yılda hızla artmış (kaynak).
Online yapay zeka nedir?
Online yapay zeka, modelin sizin cihazınızda değil, uzak bir altyapıda çalıştığı ve internet üzerinden erişildiği her türlü yapay zeka hizmetini kapsar. Bu mimari, ağır hesaplamayı kullanıcıdan sunucuya taşıyarak tarayıcıdan bile karmaşık modelleri kullanmanıza olanak verir.
SaaS yapay zeka araçları
Hazır SaaS araçları, kullanıcının altyapıyla hiç ilgilenmediği modeldir. ChatGPT, Microsoft Copilot, Google Workspace AI veya Notion AI gibi ürünlerde abone olur, hesap açar ve dakikalar içinde üretmeye başlarsınız. Geliştirme süresi yok, DevOps yok, fatura sabit ya da kullanım bazlı.
Bu modelin gücü hız ve maliyettir; zayıf yanı ise verinin sağlayıcının altyapısında işlenmesidir. Hassas müşteri sözleşmeleri, finansal raporlar veya sağlık kayıtları SaaS arayüzlerine girildiğinde KVKK yükümlülükleri devreye girer. Bu nedenle pek çok şirket SaaS araçlarını yalnızca kamuya açık veriler için kullanıyor.
Bulut tabanlı kendi modelinizi çalıştırma
İkinci yaklaşımda model ağırlıklarını (örneğin Llama 3, Mistral, Qwen) bir bulut GPU sunucusuna kurar ve inference servisini kendiniz yönetirsiniz. Bu, kontrolün büyük kısmını size verir: hangi model sürümü, hangi quantization, hangi sistem promptu, hangi log politikası.
İstanbul'daki bir GPU sunucusuna kurulu vLLM servisi, müşteri sohbet geçmişini sağlayıcıya değil yalnızca size gönderir. KVKK denetiminde "veri Türkiye'de işleniyor" cevabı verebilmek, regüle sektörlerde rakipler arasındaki belirleyici fark olabiliyor.
API ve self-hosted yaklaşımların farkları
API tabanlı kullanım, hazır bir endpoint'e HTTPS isteği gönderip yanıt almaktır; token başına ödersiniz. Self-hosted yaklaşımda ise GPU sunucusunu siz işletir, sunucunun açık olduğu her saat için ödeme yaparsınız. Düşük hacimde API ekonomiktir; gün boyu sabit trafik varsa self-hosted çoğu zaman daha ucuza gelir.
İkinci kritik fark soğuk başlatma süresidir. SaaS API'larda gecikme sabittir; kendi modelinizde, modeli VRAM'e ilk yüklemenin maliyetini siz karşılarsınız. Bu nedenle production self-hosted senaryolarında modeli sürekli ayakta tutmak, sabit aylık plan ile birlikte değerlendirilir.
Popüler online yapay zeka araçları
Piyasada onlarca SaaS yapay zeka ürünü var; aşağıdaki kategoriler en yaygın kullanım alanlarını özetliyor.
Metin üretimi (ChatGPT, Claude, Gemini)
OpenAI ChatGPT, Anthropic Claude ve Google Gemini, kurumsal kullanımda en çok tercih edilen üç sohbet temelli platform. Üçü de sözleşme analizi, e-posta taslakları, çağrı merkezi özetleri ve içerik üretiminde benzer kabiliyetler sunar; farklar bağlam penceresi büyüklüğü, fiyatlandırma ve Türkçe gramer kalitesinde belirginleşir.
Kurumsal sürümler (ChatGPT Enterprise, Claude for Work, Gemini for Workspace) verilerin eğitime kullanılmamasını sözleşmeyle garanti eder; bireysel ücretsiz planlarda bu garanti yoktur. KVKK perspektifinden, kurumsal plana geçmeden hassas veriyle çalışmamak temel kuraldır.
Görsel üretimi (Midjourney, Stable Diffusion, DALL-E)
Midjourney ve DALL-E pazarlama görseli, sosyal medya içeriği ve konsept tasarımlar için tarayıcıdan kullanılır. Stable Diffusion ise hem SaaS olarak hem de açık kaynak olarak self-hosted çalıştırılabilir; bu, model üzerinde LoRA ile özelleştirme yapmak isteyen ajanslar ve e-ticaret ekipleri için önemlidir.
Bir e-ticaret katalog üretimi senaryosunda 50.000 ürün görselini SaaS API üzerinden üretmek hızla pahalıya çıkar; aynı iş yükünü L40S GPU sunucusunda Stable Diffusion ile çalıştırmak çoğu zaman onda bir maliyetle tamamlanır.
Kod yazımı (GitHub Copilot, Cursor)
Yazılım geliştiriciler için online yapay zeka, en somut verimlilik artışını burada veriyor. GitHub Copilot ve Cursor, IDE içinden çağırılan, milyonlarca açık kaynak repodan eğitilmiş yardımcı asistanlar. Pull request açıklamasından unit test üretimine kadar günlük rutinin önemli bölümünü kısaltıyorlar.
Kapalı kaynaklı kod tabanına sahip şirketler, kodun sağlayıcı sunucusuna gönderilmesi ihtimaline karşı self-hosted Llama Code veya DeepSeek Coder gibi modelleri kendi GPU altyapılarında çalıştırmayı tercih ediyor.
Ses ve video (ElevenLabs, Synthesia)
ElevenLabs gerçekçi seslendirme, Synthesia ise avatar tabanlı video üretimi sunar. Eğitim modülleri, ürün tanıtım videoları ve çağrı merkezi IVR ses kayıtları artık dakikalar içinde üretiliyor. KVKK açısından dikkat: müşteri sesinin klonlanması için açık rıza şarttır.
Kurumsal AI kullanım senaryoları
Yapay zekayı işe almak demek, doğru senaryoyu doğru modelle eşleştirmek demektir. En yaygın dört iş yükü aşağıda.
Müşteri hizmetleri ve chatbot
L1 destek seviyesindeki tekrarlayan soruların büyük bölümü bugün LLM tabanlı chatbot'lar tarafından, doğru sistem promptu ve şirket bilgi tabanı ile çözülebiliyor. Bir telekom operatörünün fatura sorgu hattında çağrı süresini yarıya indiren senaryolar mevcut.
İyi tasarlanmış bir kurumsal chatbot, asla "halüsine etmeyen" değil; bilmediğinde insana devreden bir chatbot'tur. Bu nedenle fallback ve insan operatör entegrasyonu ilk günden planlanmalıdır.
Pazarlama ve içerik üretimi
Pazarlama ekipleri ürün açıklamalarını, blog taslaklarını, sosyal medya planlarını ve e-posta kampanyalarını LLM'lerle hızlandırıyor. Kritik olan, marka tonu için iyi tasarlanmış bir sistem promptu ve mutlaka insan editörlüğü adımıdır.
Belge analizi ve RAG
Retrieval (geri alma süresi) Augmented Generation (RAG) yaklaşımı, modelin sözleşmelerden, teknik kılavuzlardan veya iç wiki'den yanıt üretmesini sağlar. Modelin bilmediği kurumsal bilgiyi vector veritabanından çekip prompt'a ekleyerek çalışır. Hukuk, satın alma ve insan kaynakları departmanlarında devrim niteliğinde bir verimlilik artışı sağlıyor.
Veri analitiği ve karar destek
Satış tahminleri, müşteri segmentasyonu ve operasyonel KPI özetleri için LLM'ler artık SQL üretip BI panellerine entegre oluyor. "Bu çeyrek hangi ürün kategorisinde en yüksek iade oranını yaşadık?" sorusu, doğal dilde yazılıp arka planda otomatik SQL'e çevriliyor.
SaaS API vs Self-Hosted Model: hangisi size uygun?
Doğru cevap iş yüküne, hacme ve veri hassasiyetine göre değişir. Aşağıdaki dört boyut, kararı netleştirir.
Maliyet karşılaştırması (token bazlı vs GPU saatlik)
| Boyut | SaaS API | Self-Hosted (GPU) |
|---|---|---|
| Birim fiyat | Token başına | GPU saati başına |
| Düşük hacim | Çok uygun | Pahalı |
| Sabit yüksek hacim | Pahalılaşır | Çok ekonomik |
| Soğuk başlatma maliyeti | Yok | Var |
| Yönetim eforu | Minimum | Yüksek |
Veri gizliliği ve uyumluluk
KVKK kapsamındaki kişisel verileri yurt dışındaki SaaS sağlayıcıya göndermek, "yurt dışına veri aktarımı" hükmüne tabidir ve genelde açık rıza veya bağlayıcı şirket kuralları gerektirir. Self-hosted senaryoda veri sizin altyapınızda kaldığı için bu yükümlülüğün büyük bölümü ortadan kalkar.
Performans ve gecikme
Aynı bölgedeki kullanıcılar için İstanbul DC'de çalışan bir self-hosted model, ABD merkezli SaaS API'lardan çoğu zaman 100-200 ms daha düşük gecikmeyle yanıt verir. Bu fark, sesli asistan veya gerçek zamanlı kod tamamlama senaryolarında belirleyicidir.
Özelleştirme ve fine-tuning
SaaS API'ları fine-tuning sunsa da seçenekler sınırlıdır. Self-hosted modelde LoRA, QLoRA veya tam fine-tuning ile model davranışını şirket sözlüğüne, marka tonuna veya teknik jargonunuza uyarlayabilirsiniz.
Bulutta kendi yapay zeka modelinizi çalıştırma
Self-hosted yola karar verdiyseniz, üretim seviyesinde stabil çalışan bir yığın kurmak gerekir.
GPU sanal sunucusu seçimi (L40S, A100, H100)
Üç GPU sınıfı, üç tipik kullanım için tasarlanmıştır:
- L40S / L4: 7B-13B parametreli modellerin inference'ı, görsel üretim
- A100 (40/80 GB): 30B-70B model inference, orta ölçek eğitim
- H100: Büyük dil modeli eğitim, yüksek throughput (veri aktarım kapasitesi) inference, ileri seviye fine-tuning
Bir Llama 3 8B modeli L40S üzerinde rahatlıkla saniyede 80-100 token üretir; aynı sunucu 30+ eş zamanlı kullanıcıyı destekler.
Açık kaynak modeller (Llama, Mistral, Qwen)
Meta Llama 3, Mistral ve Qwen 2.5 ailesi bugün açık kaynak LLM ekosisteminin omurgasını oluşturuyor. Apache 2.0 veya benzeri ticari dostu lisansları sayesinde Türkçe içerik üretimi, kod yardımı ve müşteri hizmetleri senaryolarında doğrudan ticari kullanıma uygunlar. Türkçe gramer ve özel ad varlığı için Mistral ve Qwen genellikle Llama'ya kıyasla daha doğal sonuçlar veriyor.
vLLM ve Triton Inference Server
vLLM, PagedAttention algoritması sayesinde token üretiminde 3-5 kata kadar daha yüksek verim sağlar; aynı GPU üzerinde daha çok eş zamanlı kullanıcıya hizmet verirsiniz. NVIDIA Triton ise birden fazla modeli (LLM + embedding + reranker) tek bir endpoint altında birleştirip mikroservis mimarisini sadeleştirir.
LoRA ile düşük maliyetli fine-tuning
Tam fine-tuning yerine LoRA (Low-Rank Adaptation) tekniği, modelin yalnızca küçük bir adaptör katmanını eğitir. Bu sayede 70B modeli bile tek bir A100 üzerinde, GB'lar yerine MB'larla saklanan bir adaptör çıktısı ile kurum diline uyarlayabilirsiniz. Eğitim süresi ve maliyet on kat düşer.
AI altyapısı için MLOps ekosistemi
Üretime alınmış AI sistemi, modelden çok daha fazlasıdır.
Kubeflow ve Ray ile orkestrasyon
Kubeflow, Kubernetes üzerinde tipik ML pipeline'larını (veri hazırlama → eğitim → değerlendirme → dağıtım) standartlaştırır. Ray ise dağıtık eğitim ve hyperparameter tuning için sektör standardı haline geldi; özellikle birden fazla GPU sunucusu üzerinde paralel eğitim yapan ekipler için vazgeçilmez.
MLflow ile model versiyonlama
MLflow, "hangi model sürümü hangi veriyle eğitildi, hangi metrik aldı, üretimde hangi sürüm var?" sorularını sistematik şekilde cevaplar. Audit gerektiren sektörlerde (sağlık, finans) bu izlenebilirlik regülatör için zorunludur.
Vector veritabanları (pgvector, Qdrant)
RAG mimarileri vector veritabanı olmadan çalışmaz. pgvector mevcut PostgreSQL altyapısını ekstra bir bileşene gerek kalmadan kullanmak isteyenler için ideal; Qdrant ise milyarlarca vektörlü ölçeklerde daha hızlı bir alternatif sunar.
Yapay zeka ve KVKK: kurumsal verileri koruma
Yapay zeka kullanımının yasal boyutu, teknik boyutu kadar kritik.
Kişisel verilerin SaaS AI'a verilmesi riskleri
Çağrı merkezi konuşmaları, müşteri e-postaları, CRM notları çoğunlukla kişisel veri içerir. Bunları yurt dışı SaaS API'larına göndermek KVKK kapsamında yurt dışına aktarım hükmüne tabidir; ihlal halinde kayda değer idari para cezaları söz konusudur.
Private deployment ile veri egemenliği
Modelin sizin altyapınızda çalıştığı senaryoda veri Türkiye sınırlarında kalır. Bu, hem müşteriye verilen "veriniz yurt dışına çıkmıyor" güvencesini hem de denetimde göstereceğiniz dokümantasyonu basitleştirir.
Audit log ve erişim politikası
Hangi kullanıcının, hangi prompt'u, hangi modele, hangi zamanda gönderdiği loglanmalıdır. Bu, hem KVKK 12. madde gereği "veri güvenliği önlemleri" kapsamında değerlendirilir hem de model kötüye kullanımını tespit etmek için gereklidir.
GPU bulut maliyetleri ve TCO
Karar verirken matematik şart.
Saatlik GPU kiralama avantajı
GPU sunucusu satın almak yerine saatlik kiralamak, deneme aşamasındaki ekiplere büyük esneklik sağlar. Hafta sonu eğitim çalıştırıp Pazartesi kapatabildiğiniz bir model, kullanılmayan donanım maliyetinden tasarruf ettirir.
Reserved vs on-demand fiyatlandırma
Production iş yükleri için reserve (1 ay / 3 ay / 12 ay) modellerde indirim oranı genelde %30-50 bandındadır. On-demand kullanım ise PoC, eğitim ve geçici batch işlerinde tercih edilir.
1M token örnek karşılaştırması
Aşağıdaki tablo, 1 milyon çıkış token üretmenin yaklaşık (örnek) maliyet karşılaştırmasıdır. Gerçek rakamlar sağlayıcıya göre değişir.
| Yaklaşım | Model | Yaklaşık birim | Yorum |
|---|---|---|---|
| SaaS API | GPT-4 sınıfı | Yüksek | Hızlı başlangıç, sabit kalite |
| SaaS API | GPT-3.5 sınıfı | Orta-düşük | İyi denge |
| Self-hosted | Llama 3 8B / L40S | Düşük (sabit yük altında) | Tam kontrol, ek operasyon |
| Self-hosted | Llama 3 70B / A100 x2 | Orta | Yüksek kalite, daha fazla VRAM |
ENISA Tehdit Görünümü raporları, AI destekli sistemlerde veri sızıntısının kritik risklerden biri olarak öne çıktığını belirtiyor (kaynak).
Sıkça sorulan sorular (SSS)
Türkiye'den ChatGPT kullanmak yasal mı?
Evet, Türkiye'den ChatGPT kullanmak bireysel ve kurumsal düzeyde yasaldır; ancak kişisel veri girildiği anda KVKK yükümlülükleri devreye girer. Özellikle yurt dışına aktarım, açık rıza ve veri minimizasyonu kuralları dikkate alınmalıdır. Kurumsal sözleşmeli planlar bu riski belirgin biçimde azaltır.
Kendi modelimi eğitmek için kaç GPU gerekir?
LoRA ile 7B-13B parametreli bir modeli tek bir NVIDIA A100 GPU üzerinde eğitebilirsiniz; 70B modelin tam fine-tune'u için 4-8 A100 veya 2-4 H100 gerekir. Çoğu Türk şirketi LoRA ile yetiniyor; bu yaklaşım maliyet/fayda açısından en yüksek getiriyi sağladığı için tercih ediliyor.
Verilerim eğitim için kullanılır mı?
SaaS API kurumsal planlarında 'eğitime kullanılmaz' garantisi sözleşmeli olarak verilir; ücretsiz veya bireysel planlarda bu garanti yoktur. Self-hosted senaryoda veriler hiçbir şekilde üçüncü tarafa aktarılmaz; bu, regüle sektörler için en güvenli seçenektir.
Cloud4U Türkiye AI/ML platformu ile yapay zekayı bulutta çalıştırın
Yapay zeka projenizi pilot aşamadan üretime taşırken hem performansı hem de regülasyon uyumunu aynı anda yönetmek zorundasınız. Cloud4U Türkiye, İstanbul veri merkezinde NVIDIA GPU'lar üzerine kurulu bir AI/ML platformu sunarak ekiplerin altyapı yerine model kalitesine odaklanmasını sağlar.
- İstanbul'da NVIDIA L40S, A100 ve H100 GPU sunucuları
- KVKK uyumlu private inference: veriniz Türkiye sınırlarında kalır
- TRY ile saatlik faturalama, 7/24 Türkçe destek ve PoC için ücretsiz demo
Hangi GPU'nun, hangi modelin sizin iş yükünüz için doğru olduğunu konuşmak için Cloud4U Türkiye AI & ML çözümleri sayfasını ziyaret edin ve ekibimizden mimari önerisi talep edin.