Yapay zeka uygulamalarının ilk aşamasında mimari genellikle oldukça basittir. Uygulama bir modele doğrudan bağlanır, ortam değişkeninden API anahtarını okur ve modelden cevabı alır.
Application
│
▼
LLM APIBir prototip veya PoC için bu yaklaşım yeterlidir. Ancak sistem büyüdükçe aynı uygulamanın birden fazla model, farklı sağlayıcılar, farklı ekipler ve onlarca farklı kullanım senaryosuyla çalışması gerekir. Bir noktadan sonra problem artık yalnızca “Hangi modeli kullanıyoruz?” sorusu olmaktan çıkar.
Üretim (Production) AI Sistemlerinde Asıl Sorular
- 1Hangi istek hangi modele, hangi gecikme ve maliyet kriteriyle yönlendirilmeli?
- 2Bir model sağlayıcısı 429 (Rate Limit) veya 5xx kesintisi verdiğinde sistem nasıl ayakta kalacak?
- 3İstek sayısı değil, faturayı katlayan token tüketimi ve kullanıcı kotaları nasıl sınırlandırılacak?
- 4API anahtarları (credentials) istemcilerin ve mikroservislerin içinden nasıl tamamen soyutlanacak?
- 5Hassas kurumsal veriler (PII) ve prompt injection saldırıları modele ulaşmadan nasıl taranacak?
- 6Otonom AI ajanlarının bağlandığı Model Context Protocol (MCP) araçları nasıl merkezi olarak denetlenecek?
Bu soruların tamamının bulut-yerel (cloud-native) mimaride ortak bir karşılığı vardır:
AI Gateway'i yalnızca basit bir proxy olarak görmek eksik bir yaklaşımdır. Production AI sistemlerinde gateway; trafik yönetimi, model sanallaştırma, güvenlik, token bütçeleme, dayanıklılık, streaming yönetişimi ve gözlemlenebilirlik için merkezi bir kontrol düzlemine (control point) dönüşür.
— Kozmoz Mimari Çalışma Grubu
1. AI Gateway Nedir?#
En yalın tanımıyla AI Gateway, kurumsal uygulamalar ile yapay zeka modelleri arasındaki tüm trafik için merkezi bir geçit ve politika katmanıdır.
Bu yapı sayesinde uygulamalar belirli bir model sağlayıcısına (OpenAI, Anthropic, Google Gemini veya yerel vLLM) doğrudan bağımlı olmak yerine, gateway üzerinden soyut bir sözleşmeyle AI altyapısına erişir.
Örneğin bir uygulamanın standart bir sohbet tamamlama isteği gönderdiğini düşünelim:
POST /v1/chat/completions
Authorization: Bearer <application-token>
Content-Type: application/json
{
"model": "kozmoz-reasoning",
"messages": [{ "role": "user", "content": "Mimari analiz yap" }]
}Uygulama açısından model kozmoz-reasoning olarak tanımlıdır. Gateway ise bu sanal modelin arkasında hangi gerçek modelin çalışacağına gerçek zamanlı metriklerle karar verir. Bu yaklaşım Model Virtualization (Model Sanallaştırma) olarak adlandırılır.
2. API Gateway ile AI Gateway Arasındaki Fark#
AI Gateway, klasik API Gateway mimarisinin doğal bir uzantısı gibi görünse de çalışma dinamikleri ve kaynak yönetimi açısından köklü farklılıklar barındırır.
Klasik bir API Gateway (Kong, Envoy, Nginx); kimlik doğrulama, rate limiting, yük dengeleme ve TLS sonlandırma işlemlerini sabit HTTP request/second (örneğin 100 req/dakika) mantığıyla yönetir. Ancak AI sistemlerinde istek sayısı kaynak tüketimini temsil etmez:
Klasik API Gateway
Token-Aware AI Gateway
3. Neden AI Gateway'e İhtiyaç Duyulur?#
Bir sistem küçükken tek bir modele doğrudan bağlanmak makuldür. Fakat zaman içerisinde sistem onlarca servise, farklı bulut sağlayıcılarına ve yerel GPU kümelerine yayılır:
// KÖTÜ PRATİK: Uygulama koduna sızmış sağlayıcı bağımlılığı (Tight Coupling)
if (provider == "openai") {
var client = new OpenAIClient(apiKey);
} else if (provider == "anthropic") {
var client = new AnthropicClient(anthropicKey);
} else if (provider == "gemini") {
// Sağlayıcı SDK değişince tüm mikroservisleri baştan derlemek gerekir
}AI Gateway bu bağımlılığı uygulama kodundan tamamen koparır. Uygulama yalnızca tek bir standart OpenAI uyumlu veya gRPC sözleşmesini bilir; sağlayıcı seçimi altyapının sorumluluğuna geçer.
4. AI Gateway'in Temel Mimarisi (Control Plane & Data Plane)#
Production seviyesinde bir AI Gateway'i iki temel düzlem üzerinden tasarlamak, özellikle Kubernetes ve bulut-yerel ortamlarda ölçeklenebilirlik için zorunludur:
Haziran 2026'da 1.0 sürümüne ulaşan Envoy AI Gateway mimarisinde olduğu gibi; Control Plane rota politikalarını ve kotaları yönetirken, Rust veya C++ tabanlı yüksek performanslı Data Plane gerçek zamanlı AI trafiğini mikro-saniye seviyesinde yönlendirir.
5. Uçtan Uca İstek Yaşam Döngüsü (Request Lifecycle)#
Bir AI isteği gateway'e ulaştığında arkada pasif bir proxy gibi davranılmaz; istek hakkında onlarca güvenlik, politika ve kaynak kararı verilir:
6. Akıllı Model Yönlendirme (Intelligent Model Routing)#
Her isteği en pahalı veya en büyük akıl yürütme (reasoning) modeline göndermek sürdürülemez bir maliyet ve gecikme yaratır. Gateway gelen promptun niteliğine göre dinamik karar verir:
- 01Basit Sınıflandırma ve Özetleme: Hızlı ve düşük maliyetli modellere (ör. Gemini 2.5 Flash, GPT-4o-mini).
- 02Derin Mantık ve Kod Üretimi: Gelişmiş akıl yürütme modellerine (ör. Claude 3.7 Sonnet Thinking, OpenAI o3-mini).
- 03Hassas Veri / On-Prem Gereksinimi: Kurum içi GPU sunucularında koşan self-hosted modellere (ör. vLLM üzerinde DeepSeek R1 / Llama 3).
7. Fallback ve Dağıtık Sistem Dayanıklılığı#
Model sağlayıcıları sıklıkla bölgesel arızalar, kapasite krizleri ve 429 kota aşım hataları verir. Gateway katmanı klasik bir try-catch yerine dağıtık sistem prensipleriyle çalışır:
Burada Circuit Breaker (Devre Kesici), Exponential Backoff ve Hedef Önceliklendirme (Priority Pool) algoritmaları devreye girerek istemci hiçbir kesinti hissetmeden saniyeler içinde yedek sağlayıcıya geçer.
8. Rate Limiting ve Maliyet Yönetişimi (FinOps)#
AI sistemlerinde maliyet altyapının doğrudan bir parametresidir. Gateway her istek için metadata üretir:
{
"trace_id": "tr-8941-a9f",
"tenant_id": "kurumsal-musteri-a",
"app_id": "crm-ai-agent",
"virtual_model": "kozmoz-reasoning",
"selected_provider": "anthropic-claude-3-7",
"input_tokens": 1420,
"output_tokens": 890,
"reasoning_tokens": 310,
"ttft_ms": 340,
"cost_usd": 0.0184
}Bu veriler sayesinde LiteLLM Proxy veya Envoy AI Gateway gibi çözümlerle şirketler departman, müşteri ve ajan bazında aylık bütçe kotaları belirleyip aşım durumunda trafiği otomatik sınırlayabilir.
10. Güvenlik, PII Maskeleme ve Guardrails#
API anahtarlarını mobil uygulamalardan veya yüzlerce mikroservisten çıkarıp gateway'de izole etmek ilk adımdır. Ancak ikinci ve daha kritik adım veri güvenliğidir:
- PII (Kişisel Veri) Filtreleme: T.C. Kimlik No, kredi kartı veya müşteri telefon bilgileri modele iletilmeden önce gateway katmanında regex/NER modelleriyle maskelenir.
- Model Allowlist / Denylist: Belirli bir departmanın yalnızca kurum içi onaylı modelleri kullanabilmesi garanti altına alınır.
- Streaming Guardrails: Cevap akarken parça parça zararlı içerik veya yetkisiz veri sızıntısı kontrol edilir; ihlal anında akış kesilir.
12. GenAI Gözlemlenebilirliği (OpenTelemetry & OpenInference)#
Klasik HTTP 200 / 120ms metrikleri yapay zeka operasyonlarında yetersizdir. Dağıtık bir AI çağrısında izlenmesi gereken temel göstergeler:
Envoy AI Gateway 1.0, OpenTelemetry ve OpenInference standartlarını doğrudan destekleyerek bu metrikleri Prometheus ve Grafana panellerine aktarır.
13. Semantik Önbellekleme (Semantic Caching)#
Kullanıcılar kelimesi kelimesine aynı soruyu sormasalar bile anlamsal olarak özdeş sorular sorabilirler:
14. AI Gateway ve Agentic Sistemler: MCP Gateway#
Önceki yazılarımızda incelediğimiz Otonom AI Ajanlarında Çoklu-Ajan Orkestrasyonu ve Agentic DevOps mimarilerinde ajanların harici dünyaya bağlanması gerekir.
Model Context Protocol (MCP) ile ajanlar veritabanlarına, GitHub repolarına ve kurumsal API'lara erişir. Burada asıl soru şudur: “Ajan hangi araçları, hangi yetkiyle ve hangi güvenlik filtresiyle kullanabilir?”
MCP Gateway; tüm MCP sunucularını tek bir güvenli uç nokta altında toplar, OAuth 2.0 ile yetkilendirir ve tehlikeli veritabanı silme (DROP/DELETE) komutlarını ajan henüz çalıştırmadan engeller.
16. Kubernetes ve Örnek Rota Politikası#
Kubernetes ortamında bir AI Gateway Custom Resource Definition (CRD) veya YAML rota konfigürasyonu şu şekilde tanımlanır:
apiVersion: gateway.envoyproxy.io/v1alpha1
kind: AIGatewayRoute
metadata:
name: kozmoz-intelligent-routing
spec:
rules:
- matches:
- headers:
x-task-type: "reasoning"
backends:
- name: anthropic-claude-3-7-sonnet
weight: 80
- name: openai-o3-mini
weight: 20
fallback:
- name: local-vllm-deepseek-r1
timeout: 3000ms19. AI Gateway Her Sistem İçin Gerekli mi?#
Hayır. Küçük bir prototipte veya tek bir model kullanan basit bir chatbotta gateway eklemek gereksiz operasyonel karmaşıklık yaratır.
Ancak çoklu model, çoklu tenant, otonom ajanlar, yüksek token tüketimi, regülasyon ve maliyet denetimi gereken her kurumsal platformda AI Gateway bir lüks değil, kaçınılmaz bir mimari omurgadır.
20. Sonuç ve Kozmoz Perspektifi#
Yapay zeka sistemleri olgunlaştıkça model seçimi tek başına bir mimari karar olmaktan çıkıyor. Geleceğin üretim seviyesi altyapılarında asıl soru yalnızca:
“Hangi modeli kullanıyoruz?” değil; “Sistemimizin hangi koşullarda, hangi modeli, hangi veriye, hangi yetkiyle ve hangi maliyet sınırları içinde kullanmasına izin veriyoruz?” sorusudur.
Kozmoz İnovasyon olarak sunduğumuz Yapay Zeka Sistemleri ve İş Süreçleri Otomasyonu çözümlerimizde AI Gateway katmanını, kurumların yapay zeka operasyonlarını güvenli, ölçülebilir ve kesintisiz şekilde ölçekleyebilmeleri için standart bir mimari katman olarak konumlandırıyoruz.