Özet: Yapay zeka ile resim üretmek, text-to-image diffusion modellerinin (Stable Diffusion, Midjourney, DALL·E 3, Flux) yazılı bir prompt'u gürültüden adım adım görsele dönüştürdüğü bir süreçtir. Profesyonel kullanım için doğru araç seçimi, prompt mühendisliği, ControlNet/inpainting gibi ileri teknikler ve KVKK uyumlu bir üretim akışı gerekir.
Ana noktalar:
- SaaS araçlarla (Midjourney, DALL·E 3) ilk profesyonel görsel bir saat içinde üretilir.
- SDXL/Flux için 25-30 adım ve CFG 5-12 bandı çoğu kullanım için optimaldir.
- ControlNet, IP-Adapter ve inpainting marka tutarlılığı için kritik tekniklerdir.
- Aylık binlerce görsel hacminde self-hosted ComfyUI + GPU sunucu maliyet avantajlıdır.
- Gerçek kişi yüzü içeren üretim KVKK kapsamında rıza ve aydınlatma gerektirir.
İlk yapay zeka resmini üretmek ile gerçekten kullanılabilir, marka kimliğine uyan, üretim akışınıza entegre edilmiş bir görsel pipeline kurmak arasında ciddi bir mesafe var. Birkaç prompt denedikten sonra "yapay zeka harika ama benim ihtiyacımı tam karşılamıyor" hissi, hemen herkesin geçtiği eşik. Bu rehber tam o eşikten sonrasını anlatıyor: prompt'tan post-prodüksiyona, image-to-image'den ControlNet'e, self-hosted kuruluma ve KVKK'ya kadar pratik adımlar.
Hedef kitle: pazarlama, e-ticaret, içerik veya yaratıcı operasyon yürüten Türk B2B ekipleri. Hem hızlı başlangıç ipuçları (Midjourney/DALL·E ile aynı gün üretime başlamak) hem de orta-uzun vadede kendi GPU sunucunuzda ComfyUI workflow'ları GPU bulut sunucuda çalıştırmaya geçişin nasıl yapıldığını birlikte ele alıyoruz. Hangi aracı seçeceğinizden çok hangi tekniği ne zaman uygulayacağınız, prompt yazma disiplininizin nasıl olgunlaşacağı ve KVKK çerçevesinde marka güvenli üretimin nasıl kurulacağı önceliğimiz.
Yazının sonunda, sıfırdan ilk üretim görselinizi çıkarmak ile aylık yüzlerce-binlerce tutarlı görsel üreten bir iş akışına geçmek arasındaki tüm adımlara ve seçim noktalarına hakim olacaksınız.
Yapay zeka ile resim üretmek nasıl çalışır?
Text-to-image temel mantığı
Text-to-image modeli, yazılı bir tarifi alıp onu görsel bir çıktıya dönüştüren bir sinir ağıdır. Modelin eğitiminde milyonlarca görsel-metin çifti gösterilir; model bu eşleşmelerden hem dilin hem görselin gizli temsiline (latent space) hakim olur. Üretim sırasında prompt'unuz bu uzaya çevrilir ve modelden o noktaya yakın yeni bir görsel "örneklenir".
Pratik anlamı şu: aynı prompt, aynı modelde, aynı seed (rastgele başlangıç değeri) ile her zaman aynı görseli üretir. Seed'i değiştirerek aynı prompt'tan farklı varyantlar elde edersiniz; prompt'u değiştirerek görselin içeriğini, stilini, ışığını yönlendirirsiniz.
Diffusion modeli adım adım (noise → image)
Modern modellerin neredeyse tamamı diffusion mimarisini kullanır (Stable Diffusion teknik dokümantasyonu bu mimariyi açık biçimde tanımlar). Süreç tersine çevrilmiş gibi düşünülebilir: model eğitiminde, görsellere yavaş yavaş gürültü eklenir ve ağa "bir adım geriye, gürültüyü nasıl azaltabilirsin?" diye sorulur. Eğitim tamamlandığında ağ, saf gürültüden başlayıp adım adım anlamlı bir görsele "geri yürüyebilir" hale gelir.
Üretim parametrelerinden "steps" (adım sayısı) bu süreçteki yürüyüş aralığını belirler. SDXL için tipik 25-30 adım yeterlidir; daha azı kaba sonuç verir, daha fazlası gözle algılanan iyileşme yaratmaz ama maliyet katlanır. "CFG scale" (Classifier Free Guidance) modelin prompt'a ne kadar sıkı uyacağını belirler — düşük değer (5-7) yaratıcı, yüksek değer (12+) prompt'a sıkı bağlı ama bazen yapay.
Promptun rolü ve model seçimi
Aynı prompt farklı modellerde farklı sonuç verir: Midjourney estetik tutarlılığa, Flux prompt sadakatine, DALL·E 3 doğal dil anlama derinliğine eğilimlidir. Model seçimi prompt yazma stratejinizi de değiştirir. Midjourney'de stil anahtar kelimeleri (cinematic, photorealistic, --ar 16:9), Flux'ta daha doğal cümle yapısı, DALL·E 3'te paragraf uzunluğunda brief işe yarar.
Doğru AI/ML sağlayıcısı ve model + doğru prompt kombinasyonunu bulmak deneyim işidir. İlk hafta birkaç araç denenip ekibin estetik beklentisine en yakın olanı belirlenmelidir.
Hangi aracı seçmeli? Hızlı kıyaslama
Midjourney (creative, kapalı)
Midjourney, "ilk kez deneyen herkesi etkileyen" estetik kaliteyle öne çıkar. Discord ve web arayüzü üzerinden erişilir; v6 ve v7 sürümleri prompt sadakatinde büyük ilerleme sağladı. Style Reference ve Character Reference özellikleri marka tutarlılığı için kullanışlı. Ticari kullanım Standard plan ve üzeri için izinli; resmi API yok, otomasyon zor.
DALL·E 3 (ChatGPT entegrasyonu)
ChatGPT içinden veya OpenAI API üzerinden erişilir. En güçlü tarafı uzun, doğal dil prompt'ları doğru yorumlamasıdır; pazarlama metni yazan ekiplerin aynı arayüzde hem brief hem görsel üretmesi büyük zaman tasarrufu sağlar. API üzerinden kurumsal entegrasyon kolay.
Stable Diffusion / Flux (açık kaynak, self-hosted)
Hugging Face model deposundan indirilebilen, kendi GPU sunucunuzda çalıştırılabilen modeller. Tam kontrol, gizlilik, özel LoRA eğitimi imkanı. Flux modelleri (FLUX.1 dev, FLUX.1 pro) Midjourney ile yarışır prompt sadakati sunar. Üretim çalıştırması için GPU altyapısı ve teknik kapasite gerektirir; bedeli karşılığında özellik genişliği maksimumdur.
Adobe Firefly (ticari lisans güvencesi)
Adobe Firefly, yalnızca lisanslı Adobe Stock ve kamu domain içerikleriyle eğitildi; bu, telif riskini düşürmek isteyen kurumlar için önemli bir tercih sebebi. Photoshop ve Illustrator içine yerleşik. Stil çeşitliliği Midjourney veya Flux kadar geniş değil ama "marka güvenli" iş akışında öne çıkıyor.
İlk resmi üretme: adım adım
Hesap açma ve arayüze giriş
Midjourney için: midjourney.com → hesap aç → Standard plan veya Pro abonelik → web arayüzünden ilk prompt. DALL·E 3 için: chatgpt.com → ChatGPT Plus → "DALL·E ile resim çiz" iste. Stable Diffusion / Flux için: kendi GPU sunucunuza ComfyUI kurmak ya da Replicate / RunPod gibi hızlı API platformlarını denemek. İlk gün için bir SaaS aracı seçmek mantıklı; öğrenme eğrisi düşer.
Etkili prompt yazma kuralları
İyi bir prompt üç katmandan oluşur: ne (özne ve sahne), nasıl (stil ve teknik), atmosfer (ışık, ruh hali, kompozisyon). Örnek: "Bir İstanbul kafesinde laptop başında çalışan genç Türk girişimci kadın, yumuşak doğal pencere ışığı, sıcak renk paleti, sığ derinlik alanı, gerçekçi fotoğraf stili, 35mm lens hissi, 4K".
Kaçınılacaklar: aşırı uzun ve çelişen sıfatlar (model kafası karışır), sadece "güzel bir resim" gibi belirsiz brief'ler, çok özel marka adları (bazı modellerde filtre tetikler). Adım adım iyileşmek için her denemenin prompt'unu kaydedin; "ne işe yaradı, ne yaramadı" log'u prompt mühendisliğinizi hızla geliştirir.
Çözünürlük, oran ve stil seçimi
Sosyal medya için tipik en-boy oranları: Instagram kare 1:1, Story 9:16, LinkedIn yatay 16:9, Pinterest dikey 2:3. Web banner için 16:9 veya 4:1 (geniş şerit). Çözünürlük: 1024×1024 model varsayılanıdır; sonradan upscaler (Real-ESRGAN, SwinIR) ile 4K'ya çıkarılabilir. Çok yüksek çözünürlüğü tek geçişte üretmeye çalışmak hem yavaş hem kalite kaybeder.
Stil seçimi prompt'a anahtar kelime olarak eklenir veya Midjourney'de --style raw, Flux'ta LoRA seçimi ile yapılır. Marka kimliği gerektiren işlerde özel LoRA eğitimine geçmek doğru adımdır.
Sonucu değerlendirme ve yeniden iterasyon
İlk üretim nadiren mükemmeldir. Pratik iterasyon disiplini:
1. 4 varyant üret, en yakın olanı seç
2. Aynı prompt + farklı seed ile 4 varyant daha
3. En iyi sonucu image-to-image referansı olarak kullanıp ince ayar yap
4. Inpainting ile bozuk bölgeleri (el, yüz detayı) düzelt
5. Upscaler ile final çözünürlüğe çıkar
Bu döngü ortalama bir görsel için 5-15 dakika sürer. Profesyonel pipeline'larda otomatize edilir.
İleri teknikler: sadece prompt yazmaktan fazlası
Image-to-image — mevcut görseli dönüştürme
Image-to-image, var olan bir görseli başlangıç noktası alıp prompt'la dönüştürür. Bir ürün fotoğrafının arka planını yatak odasına çevirmek, bir taslağı renklendirmek, bir karakterin kıyafetini değiştirmek tipik kullanımlardır. "Denoising strength" parametresi orijinale ne kadar bağlı kalınacağını belirler — düşük değer (0.3) orijinali korur, yüksek değer (0.8) çoğu pikseli yeniden üretir.
E-ticaret ekipleri için en pratik kullanım: stüdyoda sade arka planda çekilmiş bir ürün fotoğrafını farklı yaşam alanı sahnelerine dönüştürmek. Her sahne için ayrı çekim yapmak yerine tek çekim + onlarca sahne varyantı.
Inpainting — görsel düzenleme ve obje değiştirme
Inpainting, bir görselin maske ile işaretlediğiniz bölgesini yeniden üretir. Bir kişiyi sahneden çıkarmak, bir logoyu silmek, bir nesneyi başkasıyla değiştirmek (sandalye yerine berjer) inpainting iş akışlarıdır. Doğru maske çizimi sonucu doğrudan etkiler; otomatik maske araçları (Segment Anything Model) bu süreci hızlandırır.
ControlNet ile kompozisyon kontrolü
ControlNet, üretim sürecine ek "kılavuz" girdileri ekler: bir taslak (sketch), bir derinlik haritası (depth map), bir pose iskeleti, bir Canny kenar haritası. Bu sayede üretilen görselin kompozisyonunu, karakterin pozunu, mimari perspektifi tam kontrol edebilirsiniz. Mimari görselleştirme, ürün fotoğrafçılığı ve karakter tutarlılığı için kritik araçtır.
IP-Adapter ve referans stil aktarımı
IP-Adapter, bir referans görseli "stil esini" olarak kullanmanızı sağlar. Marka kimliğine uygun bir referans görsel verirsiniz, yeni üretimleriniz onun stilini taşır. Tek seferlik LoRA eğitimine alternatif, hafif bir stil aktarım yoludur — özellikle az sayıda referans görselle hızlı sonuç gerektiğinde tercih edilir.
Türkçe prompt mühendisliği
İngilizce prompt vs Türkçe prompt — hangi modelle hangisi?
Pratik gerçek: hemen hemen tüm modellerin eğitim verisi büyük ağırlıkla İngilizce. Midjourney ve Stable Diffusion İngilizce prompt'larla en iyi sonucu verir. DALL·E 3 Türkçe prompt'ları da iyi anlar (GPT-4 tabanlı dil anlama sayesinde) ama yine de İngilizce daha tutarlı.
Pratik yaklaşım: brief'i Türkçe düşünün, anahtar kelimeleri (stil, kompozisyon, ışık) İngilizce yazın. Örneğin "Boğaz manzaralı, lüks rezidans iç mekanı, modern minimalist tasarım, cinematic lighting, photorealistic, 4K" karışık prompt çoğu modelde iyi çalışır.
Negative prompt kullanımı
Negative prompt, modelin "olmamasını istediğiniz" şeyleri belirtmenizi sağlar (Stable Diffusion, Flux'ta var; Midjourney --no ile, DALL·E 3'te direkt destek yok). Tipik negative prompt'lar: "blurry, low quality, deformed hands, extra fingers, watermark, text". Doğru negative prompt görsel kalitesini gözle görülür biçimde artırır.
Stil, ışık, kamera parametreleri için anahtar kelimeler
Tutarlı stil için kullanışlı anahtar kelimeler kategorize edilebilir:
- Stil: cinematic, photorealistic, oil painting, watercolor, anime, low poly
- Işık: golden hour, soft natural light, studio lighting, backlit, dramatic shadows
- Kamera: 35mm lens, shallow depth of field, wide angle, top-down view, macro
- Atmosfer: moody, vibrant, minimalist, dreamy, retro
Bunları kombinleyerek tutarlı bir marka görsel dilini kurabilirsiniz. Bir kez çalışan prompt şablonunu kaydedip varyantlarda yeniden kullanmak prodüksiyon verimliliği için kritiktir.
İşletmenize göre kullanım senaryoları
E-ticaret ürün fotoğrafı ve arka plan değişimi
En yaygın ve hemen değer üreten senaryo. Ürünün sade arka planlı tek çekimi alınır, image-to-image + inpainting ile farklı yaşam alanı sahnelerine yerleştirilir. Yatak odası, oturma odası, ofis, açık hava — her ürün için 10+ sahne varyantı saatlerle değil dakikalarla ölçülür. Türk e-ticaret satıcılarının operasyonel rekabet avantajı bu pipeline'a sahip olmaktan geçiyor.
Sosyal medya görselleri ve kampanya banner'ları
Bir kampanya temasından onlarca varyasyon üretme ihtiyacı sosyal medya operasyonunun rutin işidir. A/B test için 20 farklı header görseli üretmek, hikaye dizisi için 7 günlük seri tasarlamak — AI ile gün sayısı saat sayısına döner. ComfyUI'da kurulan template workflow, prompt'un sadece bir kısmını değiştirerek yüzlerce tutarlı varyant üretir.
Eski fotoğraf restorasyonu ve upscaling
GFPGAN, CodeFormer ve Real-ESRGAN gibi modeller eski, bulanık veya düşük çözünürlüklü fotoğrafları onarır. Aile arşivi dijitalleştirme servisleri, kurumsal tarih kitapları, müze koleksiyonları için pratik bir uygulama. KVKK çerçevesinde gerçek kişi yüzleri için rıza süreçleri özenle yönetilmelidir.
AI avatar ve marka illüstrasyonu
Marka kişiliğine uygun bir avatar ya da illüstrasyon sistemi kurmak isteyen ekipler için LoRA eğitimi en güçlü yoldur. 30-50 marka illüstrasyonu ile bir LoRA eğitilir; sonrasında sınırsız tutarlı varyant üretilir. Bu, freelance illüstratör maliyetinin önemli bölümünü içeriye alma ve aynı zamanda hızı çarpıtma sonucu verir.
Kendi sunucunuzda çalıştırmak: ComfyUI + GPU bulut
Neden self-hosted? (gizlilik, hacim, özelleştirme)
Üç temel sebep: gizlilik (marka prompt'ları ve referans görseller dış sağlayıcıya gitmesin), hacim (aylık binlerce üretim için SaaS aboneliği maliyet eşiğini geçer), özelleştirme (kendi LoRA, ControlNet workflow'ları). KVKK kapsamlı veya rekabet açısından hassas içerik üreten ekipler için self-hosted neredeyse zorunluluktur.
GPU sunucu seçimi (L40S, A100, RTX 6000 Ada)
GPU sunucuların temel mimarisi ve görsel üretim iş yüklerine etkisi için GPU sunucu nasıl çalışır yazımız iyi bir başlangıçtır.
| GPU | VRAM | İdeal kullanım |
|---|---|---|
| RTX 6000 Ada | 48 GB | KOBİ üretim, ComfyUI günlük workflow |
| L40S | 48 GB | Inference-optimized, en iyi fiyat-performans |
| A100 (80 GB) | 80 GB | LoRA eğitimi, büyük batch üretim |
Çoğu pazarlama ekibi için L40S iyi başlangıç. Eğitim ihtiyacı doğduğunda A100'e geçilir.
ComfyUI kurulumu — 15 dakikalık kurulum
Ön yüklü ComfyUI image'i olan bir GPU bulut sunucu seçildiğinde kurulum: 1) Sunucu sipariş, 2) SSH ile giriş ve comfy launch komutu, 3) tarayıcıdan IP:8188 adresine bağlantı, 4) ilk workflow yüklemesi (template'ten). Sıfırdan kurulum yapılırsa Python ortamı, sürücüler ve checkpoint indirme ekleyince 1-2 saat. Hazır image bu süreyi 15 dakikaya indirir.
KVKK ve telif: yapay zeka görsellerinde Türkiye perspektifi
Gerçek kişi yüzü içeren görsellerde KVKK
KVKK mevzuatı çerçevesinde tanınabilir gerçek kişi yüzü kişisel veri sayılır. Bir AI modeli ile bir çalışanınızın fotoğrafından LoRA eğitirseniz veya bir müşterinizin yüzünden varyant üretirseniz rıza ve aydınlatma yükümlülükleri devreye girer. Pratik kural: gerçek kişi içerikli üretim için yazılı rıza, anonimleştirilmiş referans verisi tercihi, üretim log'larının kayıt altına alınması.
Üretilen görselin ticari kullanım hakkı
Aracın kullanım koşulları belirleyici. Midjourney Standard plan ve üzeri ticari kullanıma izin verir. DALL·E 3 OpenAI API kullanımında ticari kullanım izinli. Adobe Firefly tasarım gereği ticari güvenli. Stable Diffusion / Flux gibi açık kaynak modeller lisanslarına göre değişir; çoğu CreativeML Open RAIL-M lisansı altında ticari izin verir ancak kötüye kullanım sınırlamaları içerir.
Stok görseller ve eğitim verisi etiği
Bazı modeller telif korumalı görsellerle eğitildi; bu, davaların ana konusu. Marka güvenli iş akışı kuruyorsanız ya Adobe Firefly gibi lisanslı veri seti modellerini, ya da kendi lisanslı verilerinizle eğittiğiniz modelleri tercih edin. Müşterinize teslim ettiğiniz görselin kaynak modelinin neyle eğitildiği soru olarak gelirse cevabınız hazır olmalı.
Sıkça sorulan sorular (SSS)
Hiç teknik bilgim yok, bugün başlayabilir miyim?
Evet, Midjourney veya ChatGPT Plus aboneliği ile bir saat içinde ilk profesyonel görselinizi üretebilirsiniz. Bu araçlar tarayıcı üzerinden çalışır, kurulum gerektirmez ve doğal dil prompt'larla yönetilir. Prompt yazma alışkanlığı bir-iki hafta içinde oturur.
El ve yüz detayları neden bozuk çıkıyor?
Eller ve yüzler diffusion modellerinin tarihsel zayıflığıdır; modern SDXL ve Flux modellerde belirgin biçimde iyileşmiştir. Sorunlu bölgeleri inpainting ile yeniden üreterek düzeltebilirsiniz. Adobe Firefly ve DALL·E 3 bu konuda daha tutarlı çıktılar verir.
Aylık ne kadar harcamayı beklemeliyim?
Düşük hacim için SaaS aboneliği aylık 30-100 USD bandında, orta-yüksek hacim için self-hosted GPU sunucu birkaç yüz USD bandındadır. Self-hosted seçenekte sabit maliyet daha yüksek ama görsel başına maliyet dramatik biçimde düşer ve ölçek arttıkça avantaj büyür.
Cloud4U Türkiye GPU sunucularıyla kendi AI resim üreticinizi çalıştırın
SaaS araçlarla başlamak hızlı bir öğrenme adımı; gerçek üretim ölçeğine geldiğinizde kendi GPU sunucunuza geçmek hem maliyet hem kontrol açısından doğal sonuçtur. Cloud4U Türkiye, AI görsel üretimine özel GPU sunucular sunar ve sizi karmaşık altyapı yönetiminden kurtarır.
Türkiye veri merkezi, KVKK uyumlu altyapı
- İstanbul veri merkezi — prompt ve üretim verileri yurt içinde kalır
- KVKK ve veri yerelleştirme uyumu — marka ve müşteri verileri sınır aşmaz
- TL bazlı şeffaf fiyatlandırma — kur sürprizi olmadan bütçeleme
ComfyUI / Automatic1111 ön yüklü hazır image
Sunucu siparişinden 15 dakika sonra üretime başlarsınız. Popüler SDXL ve Flux checkpoint'leri, ControlNet modelleri, upscaler'lar ön yüklü gelir. Kurulum, sürücü, Python ortamı sorunlarıyla zaman kaybetmezsiniz.
Saatlik fiyatlandırma ve ücretsiz teknik destek
Saatlik veya aylık GPU kiralama, ihtiyaç pikinizde ölçeklendirme imkanı, gerçek mühendislerden Türkçe teknik destek. Workflow tasarımı, LoRA eğitimi ve maliyet optimizasyonu danışmanlığı dahil eksiksiz hizmet için Cloud4U Türkiye GPU bulut sayfasını ziyaret edin.