AI Router (yapay zeka yönlendiricisi), bir yapay zeka sisteminde her gelen isteği hangi büyük dil modelinin (LLM) işleyeceğine karar veren bileşendir; böylece basit görevler küçük ve ucuz modellere gider, yalnızca gerçekten zor olanlar premium bir modele ulaşır. Modern yapay zeka uygulamaları artık nadiren tek bir modele dayanır. Farklı istekler farklı karmaşıklık düzeyleri ve farklı performans gereksinimleri taşır; yine de her isteği en güçlü modelinize göndermek hem yavaş hem de pahalıdır. Genellikle bir LLM Gateway'in parçası olarak konumlandırılan bir AI Router, her isteği otomatik olarak uygun bir modelle eşleştirir. Amaç en ucuz modeli bulmak değildir — amaç, isteği gerçekten karşılayabilecek en maliyet-etkin modeli bulmaktır.
Yapay Zeka Uygulamaları Neden Çok Modelli Yönlendirmeye İhtiyaç Duyar?
Tek modelli bir mimari kurması basittir, ancak iş yükleri büyüyüp çeşitlendikçe verimsiz hale gelir. Her istek aynı sınır (frontier) modele gittiğinde, çok daha küçük bir modelin sorunsuz tamamlayabileceği görevler için premium token ücretleri ödersiniz ve önemsiz çağrılarda bile o modelin gecikmesini üstlenirsiniz.
Gerçek iş yükleri geniş bir zorluk yelpazesine yayılır. Belirli bir model sürümü yerine yetenek katmanıyla tanımlandığında, tipik bir uygulama şunları bir arada barındırır:
- Sınıflandırma ve moderasyon — genellikle küçük, hızlı bir model yeterlidir.
- Basit soru-cevap ve biçimlendirme — düşük maliyetli, genel amaçlı bir model.
- Kodlama — kod üretimi ve incelemesi için özelleşmiş bir model.
- Karmaşık, çok adımlı akıl yürütme — premium bir sınır modeli.
- Uzun bağlamlı görevler — çok büyük bağlam pencereleri için optimize edilmiş bir model.
Çok modelli yönlendirme, model seçimini her iş yükünü yetenekleri ve fiyatı en uygun modelle eşleştirmenin bir yolu olarak ele alır.
Farklı isteklerin farklı gerçek çıkarım (inference) maliyetleri vardır; bu nedenle model seçimi, tek seferlik bir mimari karardan çok, bir altyapı optimizasyonu problemine dönüşür.
AI Router ile LLM Gateway Arasındaki Fark Nedir?
Günlük kullanımda AI Router, LLM Gateway ve model gateway terimleri çoğu zaman birbirinin yerine kullanılır; istek başına model seçen araçlar için "smart router" (akıllı yönlendirici) ifadesini de görürsünüz. Piyasa bu ayrımı bulanıklaştırsa da, iki kavramı net biçimde ayırmak faydalıdır.
Bir LLM Gateway, uygulamanız ile bir veya daha fazla LLM sağlayıcısı ya da modeli arasındaki kontrol katmanıdır. Tipik olarak şunları sağlar:
- Birleşik, sağlayıcıdan bağımsız bir API
- Kimlik doğrulama ve anahtar yönetimi
- Hız sınırlama (rate limiting) ve kotalar
- Loglama, izleme (monitoring) ve trace
- Yedekleme ve fallback (yük devretme)
- Yönlendirme (routing)
- Maliyet kontrolleri ve bütçeler
Bir AI Router ise, belirli bir isteği hangi modelin işleyeceğine karar veren daha dar bir bileşendir. Kısacası: bir AI Router bir LLM Gateway'in içinde yer alabilir, ancak bir LLM Gateway yönlendirmeden çok daha fazlasını yapar. Yönlendirme, daha geniş bir kontrol düzleminin yalnızca bir işlevidir.
LLM İstek Yönlendirmesi Nasıl Çalışır?
Bir istek doğrudan modele gitmez. Önce gateway ve onun yönlendiricisinden geçer; bu katman isteği değerlendirir, bir model seçer, çağrıyı iletir ve yanıtı geri döndürür. Akış şöyledir:
- Uygulama, kullanıcı isteğini LLM Gateway'e gönderir.
- AI Router, isteği ve bağlamını inceler.
- Yönlendirici bir hedef seçer — örneğin küçük bir model, genel amaçlı bir model veya bir akıl yürütme modeli.
- Gateway çağrıyı iletir, yeniden denemeleri veya fallback'i yönetir ve uygulamaya tek bir yanıt döndürür.
Bu kararı verirken bir yönlendirici üç grup faktörü tartar.
İstek özellikleri
- Görev türü
- Prompt ve bağlam uzunluğu
- Tahmini karmaşıklık
- Beklenen çıktı boyutu
- Gerekli yetenekler (görü, kod, araç kullanımı, uzun bağlam)
Model özellikleri
- İlgili görevdeki kalite
- Gecikme (latency)
- Bağlam penceresi
- İşlem hacmi (throughput)
- Kullanılabilirlik
- Fiyat
İş kısıtları
- Bütçe ve maliyet tavanları
- Bölge ve veri ikametgâhı (data residency)
- Uyumluluk (compliance) gereksinimleri
- Sağlayıcı hız sınırları ve sözleşmeler
Model Seçim Stratejileri
Yönlendirme stratejileri, giderek karmaşıklaşan bir merdiven oluşturur. Her basamak, kendi başına benimsenmek yerine ölçülmüş bir faydayla gerekçelendirilmelidir; pratikte bu stratejiler birbirini dışlamaz — çoğu üretim sistemi birkaçını üst üste katmanlar.
- Kural tabanlı yönlendirme — "istek X ise Y modelini kullan." Öngörülebilir, iyi etiketlenmiş iş yükleri için idealdir.
- Yetenek tabanlı yönlendirme — modeli gerçekten yapabildiği işe göre seçer: kodlama, görü, akıl yürütme veya uzun bağlam.
- Maliyet tabanlı yönlendirme — tanımlı bir kalite eşiğini karşılayan en düşük maliyetli modeli seçer.
- Gecikme tabanlı yönlendirme — gereken yanıt süresi hedefini karşılayabilecek model veya sağlayıcıyı seçer.
- Yük dengeleme ve fallback yönlendirmesi — işlem hacmi ve güvenilirlik için trafiği sağlayıcılar ve anahtarlar arasında dağıtır, bir sağlayıcı bozulduğunda otomatik olarak devreye alır.
- Anlamsal (semantic) yönlendirme — isteği bir vektör olarak embed eder ve çıkarsanan niyet ve karmaşıklığa göre, genellikle hafif bir sınıflandırıcı kullanarak yönlendirir. Bu, yelpazenin dinamik ucudur ve çoğu "akıllı" yönlendiricinin temelini oluşturur.
Anlamsal ve karmaşıklık tabanlı yönlendirme, dinamik kararların verildiği yerdir: yönlendirici, çağıran tarafın sağladığı bir etikete güvenmek yerine zorluğu kendisi çıkarsar ve buna göre bir model seçer.
Model Kademelendirme (Cascading): Ucuzdan Başla, Gerektiğinde Yükselt
Kademelendirme, en sezgisel maliyet tasarrufu desenidir. İstek önce ucuz bir modele gider; yalnızca o yanıt yetersiz kalırsa premium bir modele yükseltilir.
- İsteği düşük maliyetli bir modele gönder.
- Yanıtı değerlendir — yeterince iyi mi?
- Evetse, döndür.
- Hayırsa, premium bir modele yükselt ve onun sonucunu döndür.
Yükseltip yükseltmeyeceğine karar vermek için yönlendirici güven skorlarını, doğrulama kurallarını, bir yanıt değerlendiricisini veya bir karmaşıklık tahminini kullanabilir. İyi yapıldığında uygulama kaliteyi maliyetle takas etmek zorunda kalmaz — pahalı modeller yalnızca gerçekten ihtiyaç duyulan istekleri işler. Stanford'un FrugalGPT araştırması, ucuz modellerin çoğu sorguyu çözmesine izin vererek kademeli yönlendirmenin çok büyük maliyet düşüşlerine, bazı durumlarda %98'e varan oranlara ulaşabildiğini göstermiştir.
Önemli bir uyarı var. Yükseltilen her istek, hem ucuz hem de pahalı çağrının ödendiği anlamına gelir; dolayısıyla kademelendirme yalnızca ucuz katman trafiğin çoğunluğunu çözdüğünde kazandırır. Yükseltme oranı canlı bir maliyet değişkenidir: kötü kalibre edilmiş bir değerlendirici neredeyse her şeyi sessizce yükseltebilir ve tasarrufunuzu farkında olmadan yok edebilir. Bu oranı sürekli izleyin.
Pahalı modeller, varsayılan olarak her isteği değil, gerçekten ihtiyaç duyan istekleri işlemelidir.
AI Yönlendirmesi Çıkarım Maliyetlerini Nasıl Düşürür?
Maliyet optimizasyonu, birlikte çalışan çeşitli mekanizmalardan gelir:
- Basit istekler için daha küçük modeller kullanmak
- Gereksiz premium model çağrılarını azaltmak
- Daha iyi fiyat-performansa sahip modellere yönlendirmek
- Benzer isteklerin yeniden hesaplanmasını önlemek için prompt önbellekleme veya anlamsal önbellekleme kullanmak
- Fallback yoluyla başarısız istekleri ve gereksiz yeniden denemeleri önlemek
- Trafiği sağlayıcılar ve modeller arasında dengelemek
Kilit fikir şudur: bir isteğin maliyeti yalnızca modelin liste fiyatı değildir. Gerçek maliyet; girdi tokenlarına, çıktı tokenlarına, önbelleklenmiş tokenlara, bağlam uzunluğuna, yeniden denemelere, gecikmeye ve — kendi barındırdığınız modeller için — altta yatan altyapıya bağlıdır. Kötü yanıtlar üreten ve yeniden deneme ya da yükseltme tetikleyen "daha ucuz" bir model, işi ilk seferde doğru yapan daha pahalı bir modelden daha maliyetli hale gelebilir.
Peki tasarruf pratikte ne kadar? UC Berkeley'in RouteLLM çerçevesi, standart bir kıyaslamada maliyetleri %85'in üzerinde düşürürken güçlü modelin performansının yaklaşık %95'ini koruduğunu ve sorguların yalnızca yaklaşık %14'ünü premium modele gönderdiğini bildirdi. Bu tür sonuçlar, trafiğinizin basit görevlere ne kadar eğilimli olduğuna büyük ölçüde bağlıdır; bu nedenle yayımlanan rakamları garanti değil, örnek olarak değerlendirin — dürüst yanıt şudur: yönlendirme maliyetleri önemli ölçüde düşürebilir, ancak bunu otomatik olarak yapmaz.
Son olarak, yönlendirme bedava değildir. Karar katmanının kendisi gecikme ekler ve bazı tasarımlarda fazladan bir model çağrısı getirir: bir embedding veya sınıflandırıcı adımı küçüktür, ancak LLM tabanlı bir sınıflandırıcı tam bir ek çıkarımdır. Bu ek yük, tasarruf etmesi beklenen katmanın içine gizlenmek yerine toplam maliyetin bir parçası olarak sayılmalıdır.
Bir AI Router için Üretim Mimarisi
Gerçek bir ortamda yönlendirici, bir API veya LLM Gateway'in arkasında yer alır ve çeşitli model arka uçlarına dağıtır:
- Uygulamalar tek bir gateway uç noktasını çağırır.
- Gateway; kimlik doğrulama, loglama, hız sınırlama ve bütçeleri yönetir.
- AI Router her istek için bir arka uç seçer.
- Arka uçlar, bir GPU kümesinde vLLM ile sunulan kendi barındırdığınız modelleri ve bir veya daha fazla harici bulut LLM sağlayıcısını içerebilir.
Bu hibrit yapı, mimarinin pratik hale geldiği yerdir. Bir kuruluş, altyapıya sahip olmanın karşılığını verdiği öngörülebilir ve yüksek hacimli iş yükleri için kendi barındırdığı modelleri özel GPU bulut altyapısında çalıştırabilir; dedike kapasiteyi haklı çıkarmayan özelleşmiş veya ara sıra gelen iş yükleri için ise harici API'ler kullanabilir. Her isteğin hangi yoldan geçeceğine yönlendirici karar verir; gateway ise modelin nerede çalıştığından bağımsız olarak arayüzü tekdüze tutar.
Yönlendirmenin Gerçekten Para Tasarrufu Sağladığı Nasıl Ölçülür?
Yönlendirme maliyetleri otomatik olarak düşürmez; bu yüzden bilmenin tek yolu ölçmektir. En azından şunları izleyin:
- İstek başına maliyet ve 1M token başına maliyet
- Her modelin işlediği istek payı
- Gecikme (yönlendirici ek yükü dâhil)
- Hata oranı
- Yükseltme (escalation) oranı
- Önbellek isabet oranı (cache hit rate)
- İşlem hacmi
- Kalite veya görev başarı oranı
En kullanışlı tek metrik, token başına maliyet değil, başarılı görev başına maliyettir. Token başına maliyet, aşırı ucuz bir modeli, yeniden deneme veya yükseltme gerektiren kötü sonuçlar üretse bile verimli gösterir; başarılı görev başına maliyet ise ekonomik tabloyu bütünüyle yakalar.
Gözden kaçması kolay bir ön koşul var: "kaliteye göre" yönlendirme yapmak, kaliteyi ölçmenin bir yolunu gerektirir. Bu da çevrimdışı değerlendirme setleri, çevrimiçi LLM-as-judge (yargıç olarak LLM) puanlaması veya gerçek iş metriklerine karşı A/B testleri anlamına gelir. Kalite sinyali olmadan "başarılı görev başına maliyet" hesaplanamaz — "başarılı"nın bir tanımı olmaz.
AI Router + vLLM + Karpenter: Üç Optimizasyon Katmanı
AI altyapısında maliyet verimliliği, her biri farklı bir problemi çözen üç ayrı katmandan gelir:
| Katman | Teknoloji | Neyi optimize eder |
|---|---|---|
| Model seçimi | AI Router | İsteği hangi modelin işleyeceğini |
| Çıkarım | vLLM | Modelin ne kadar verimli çalıştığını |
| Altyapı | Karpenter | Ne kadar GPU kapasitesi sağlanacağını |
Bir araya getirildiğinde: AI Router neyin çalışacağına karar verir, vLLM her çıkarımı daha verimli hale getirir ve Karpenter altta yatan GPU altyapısını esnek tutar. Bu katmanlar birbirini güçlendirir. vLLM ekosisteminde, model seçimini doğrudan sunum (serving) katmanında hafif bir sınıflandırıcıyla gerçekleştiren bir anlamsal yönlendirme projesi bile bulunur; bu da kendi barındırdığınız bir yığında yönlendirme katmanı ile çıkarım katmanı arasındaki sınırı özellikle sıkılaştırır.