Kurumsal yazılım, güvenlik ve mühendislik notları

AI Ops Katmanı ve LLM Router: Çoklu Model, Maliyet ve KVKK Uyumu

Yapay Zeka ve Ajanlar ·

LLM router ve AI Ops katmanı — trafiği doğru yöne dağıtan çok katlı otoyol kavşağı | Aksiyon Soft

LLM router nedir ve şirketler neden AI Ops katmanına ihtiyaç duyar?

LLM router, iş uygulamalarınızdan gelen her yapay zeka isteğini inceleyip o isteğe en uygun dil modeline yönlendiren ara katmandır. Bir yıl önce çoğu şirket tek bir sağlayıcının API anahtarını koda gömüp işe başlıyordu. Bugün aynı şirket; müşteri e-postalarını özetlemek için hızlı ve ucuz bir model, sözleşme analizi için güçlü bir model, kişisel veri içeren talepler için Türkiye’de çalışan bir model kullanmak istiyor. Üç modeli üç farklı yerden çağıran kod, kısa sürede yönetilemez hale geliyor.

Bu yazıda iş uygulamaları ile birden fazla model arasına konan AI Ops katmanını ele alıyoruz: yönlendirme kuralları, fallback, kişisel veri maskeleme, loglama, kalite değerlendirmesi ve bütçe sınırları. KVKK’nın 2024’te değişen 9. maddesinin yurt dışındaki modellere veri göndermeyi nasıl etkilediğini, EVREN ve Kumru gibi yerli seçeneklerin bu mimariye nereden bağlandığını ve OpenAI uyumlu tek bir arayüzün tedarikçi bağımlılığını nasıl azalttığını somut örneklerle anlatıyoruz.

Kısaca

  • LLM router, her isteği veri hassasiyeti, maliyet, gecikme ve kaliteye göre doğru modele gönderir.
  • AI Ops katmanı router’ın yanında fallback, PII maskeleme, loglama, değerlendirme ve bütçe kontrolünü de üstlenir.
  • KVKK m.9 değişikliğiyle yurt dışına aktarım standart sözleşme gibi uygun güvencelerle mümkün; ama kural setinizi buna göre kurmanız gerekir.
  • EVREN’in OpenAI uyumlu çıkarım servisi ve Kumru gibi yerli modeller, kişisel veri içeren istekler için güçlü bir rota seçeneği sunar.
  • Uygulamalar tek bir OpenAI uyumlu arayüzle konuşursa model değiştirmek kod değil yapılandırma işi olur.

• • •

AI Ops katmanı tam olarak ne yapar?

Internative’in 2026’nın ilk yarısı için yayımladığı Türkiye yazılım sektörü raporu, yedinci trend olarak “AI operasyon katmanı”nı tanımlıyor: tek model çağrısı yerine gelen isteği doğru modele yönlendiren, hatayı yöneten ve izleme yapan bir ara katman. Aynı rapor ikinci trendde yerli dil modellerinin sahaya çıktığını ve “yerli LLM + global LLM router” biçimindeki hibrit mimarinin yaygınlaştığını yazıyor. Bizim projelerde gördüğümüz tablo da bu.

Pratikte AI Ops katmanı, uygulamalarınızın gördüğü tek bir uç noktadır. Arkasında birden fazla model sağlayıcısı, kural motoru, maskeleme servisi, log deposu ve değerlendirme hattı çalışır. Uygulama “bu müşteri talebini sınıflandır” der; hangi modelin, hangi bölgede, hangi bütçeyle bu işi yapacağına katman karar verir.

Şema: LLM router mimarisi — uygulamalar, OpenAI uyumlu AI Ops katmanı ve şirket içi, Türkiye’de barındırılan ve yurt dışı model hedefleri
LLM router mimarisi: uygulamalar yalnızca AI Ops katmanıyla konuşur; katman isteği şirket içi, Türkiye’de barındırılan ya da yurt dışındaki modele yönlendirir.

Router ile API gateway arasındaki fark

Klasik bir API gateway kimlik doğrulama, hız sınırı ve yönlendirme yapar ama isteğin içeriğine bakmaz. LLM router ise içeriği anlamak zorundadır: istemde T.C. kimlik numarası var mı, görev kısa bir sınıflandırma mı yoksa uzun bir akıl yürütme mi, kullanıcı hangi departmanda? Bu yüzden router genellikle gateway’in arkasında, içerik farkındalığı olan ayrı bir katman olarak kurulur.

Katmanın beş temel görevi

Yönlendirme isteği kurallara göre modele gönderir. Fallback sağlayıcı hata verdiğinde ya da yavaşladığında isteği yedek modele aktarır. Maskeleme kişisel veriyi modele gitmeden önce gizler ve yanıtta geri yerine koyar. Loglama ve değerlendirme her çağrının maliyetini, gecikmesini ve kalitesini kaydeder. Bütçe kontrolü ise departman, uygulama ya da kullanıcı bazında harcama sınırı uygular.

• • •

LLM router hangi kriterlere göre karar verir?

IBM Research’ün LLM router yazısı konuyu bir hava trafik kontrolörüne benzetiyor: router sorguyu değerlendirip kütüphanenizdeki en iyi değeri sunan modele gönderir; seçimi fiyat, kalite, gecikme ya da başka herhangi bir kritere göre yapabilirsiniz. Kurumsal tarafta bu listeye iki kriter daha eklenir: veri hassasiyeti ve verinin işlendiği yer.

KriterNe ölçülür?Örnek kuralDikkat edilecek nokta
Veri hassasiyetiİstemde kişisel veya özel nitelikli kişisel veri var mı?T.C. kimlik no, IBAN ya da sağlık verisi tespit edilirse şirket içi veya Türkiye’de işleyen modele gitTespit hatalı olabilir; şüphede güvenli rotayı seçin
MaliyetToken başına fiyat, aylık bütçe kalanıBasit sınıflandırma ve özetleme küçük modele giderEn ucuz model her görevde en ucuz sonuç değildir; tekrar denemeleri de sayın
Gecikmeİlk token süresi ve toplam yanıt süresiCanlı sohbet ekranları için hedef süreyi aşan model devre dışı kalırToplu işler gecikmeye toleranslıdır; ayrı kuyrukta çalıştırın
KaliteGörev bazlı değerlendirme puanıSözleşme analizi yalnızca test setinde eşiği geçen modellere giderGenel benchmark değil, kendi verinizle ölçün
ErişilebilirlikHata oranı, zaman aşımı, kota durumuArt arda hata veren sağlayıcı geçici olarak devreden çıkar, istek yedeğe giderYedek model de aynı veri kuralına uymalı
Veri konumuModelin hangi ülkede çalıştığı, sözleşme durumuYurt dışı rotası yalnızca KVKK m.9 güvencesi olan sağlayıcılar için açılırSağlayıcının alt işleyenlerini de sorgulayın

Kriterlerin sırası önemlidir. Biz kural motorunu her zaman önce veri hassasiyeti ve konumu, sonra kalite eşiği, en son maliyet ve gecikme sırasıyla kurguluyoruz. Böylece ucuz bir model, kişisel veri içeren bir isteği “daha hızlı” olduğu için asla alamaz.

Şema: Veri hassasiyetine göre LLM yönlendirme karar ağacı — kişisel veri, maskeleme, gecikme ve kalite
Karar ağacı: önce kişisel veri kontrolü, ardından maskeleme olanağı, en son gecikme ve kalite kuralları devreye girer.
IBM Technology kanalındaki bu anlatım, isteklerin maliyet ve kaliteye göre farklı modellere nasıl yönlendirildiğini kısa bir örnekle gösteriyor (İngilizce).

• • •

KVKK 9. madde yurt dışındaki LLM’lere veri göndermeyi nasıl etkiler?

Kişisel veri içeren bir istemi yurt dışında çalışan bir modele göndermek, KVKK açısından yurt dışına aktarım anlamına gelir. 6698 sayılı Kanun’un 9. maddesi, 7499 sayılı Kanun’la (Resmî Gazete, 12.03.2024) değiştirildi ve yeni hükümler 01.06.2024’te yürürlüğe girdi. Uygulama esasları, 10.07.2024 tarihli Resmî Gazete’de yayımlanan yönetmelikle belirlendi.

Kurum’un yurt dışına aktarım sayfasına göre yeni düzende aktarım, 5. veya 6. maddedeki işleme şartlarından biri varsa ve aktarımın yapılacağı ülke için yeterlilik kararı bulunuyorsa yapılabiliyor. Yeterlilik kararı yoksa; ilgili kişinin haklarını kullanabilmesi ve aktarılan ülkede etkili kanun yollarına başvurabilmesi koşuluyla standart sözleşme, bağlayıcı şirket kuralları gibi uygun güvencelerden biri sağlanmalı. Standart sözleşme metni değiştirilemiyor ve imzadan itibaren beş iş günü içinde Kurum’a bildirilmesi gerekiyor. Ayrıca istisnai ve arızi aktarımlar için sınırlı durumlar tanımlanmış durumda.

Router tasarımına yansıması

Bu kurallar, LLM router’ın kural setine doğrudan yansımalı. Her model hedefi için “veri nerede işleniyor, hangi güvence var, sağlayıcı veri işleyen mi” sorularının yanıtı yapılandırmada tutulmalı; güvencesi olmayan bir yurt dışı modele kişisel veri içeren istek hiçbir koşulda gitmemeli. LLM sağlayıcısı sizin adınıza veri işleyen konumundadır; bu ilişkinin sözleşme ve denetim tarafını tedarikçi kaynaklı veri ihlali ve KVKK yazımızda ayrıntılı ele aldık. Bu yazı hukuki görüş değildir; somut aktarım senaryolarınızı hukuk danışmanınızla birlikte değerlendirmenizi öneririz.

Bir uyarı da sektör raporlarına: Internative raporu, KVKK kısıtı olan şirketler için yerli LLM’in “seçenek değil zorunluluk” olduğunu savunuyor. Değişen 9. madde uygun güvencelerle aktarıma izin verdiği için biz konuyu mutlak bir yasak olarak değil, risk ve maliyet dengesi olarak görüyoruz. Yerli model rotası, güvence yükünü azaltan en sade yoldur; tek yol değildir.

• • •

Yerli modeller EVREN ve Kumru router’a nasıl eklenir?

Router mimarisinin güzel yanı, yeni bir model hedefini eklemenin uygulamaları etkilememesidir. Türkiye’de son haftalarda bu açıdan iki önemli gelişme oldu.

EVREN: Türkiye’de işlenen, OpenAI uyumlu çıkarım servisi

Cumhurbaşkanlığı Savunma Sanayii Başkanlığı bünyesinde geliştirilen EVREN platformunun büyük dil modeli çıkarım servisi 23 Eylül 2026’da duyuruldu; platform 27 Eylül 2026’da resmen kullanıma açıldı. Anadolu Ajansı ve Dünya’nın aktardığına göre 11 açık ağırlıklı model tek bir OpenAI uyumlu API üzerinden sunuluyor; istemler, yanıtlar ve kullanım kayıtları Türkiye’deki yüksek performanslı GPU altyapısında işleniyor. Platform katkı esaslı bir kredi modeliyle çalışıyor, erişim e-Devlet kimlik doğrulamasıyla sağlanıyor ve 1 Kasım 2026’ya kadar yapılan API çağrıları kredi bakiyesinden düşülmüyor. Servis kendi içinde otomatik model yönlendirme de sunuyor.

Ayrıntılar için EVREN LLM çıkarım servisi ve milli yapay zeka platformu EVREN kullanıma açıldı haberlerimize bakabilirsiniz. EVREN’i mevcut uygulamalarınıza bağlamanın teknik adımlarını ise EVREN API’yi kurumsal yazılıma bağlamak rehberinde anlattık. Router açısından EVREN, “kişisel veri içeren ama Türkiye’de işlenmesi yeterli” istekler için doğal bir hedeftir.

Kumru: şirket içinde çalışabilen Türkçe model

VNGRS’in geliştirdiği Kumru, Türkçe için sıfırdan ön eğitilmiş 7,4 milyar parametreli, decoder-only bir dil modeli. VNGRS’in duyurusuna göre model 500 GB’lık, 300 milyar tokenlık bir veriyle eğitildi, 8.192 tokenlık bağlam penceresine (yaklaşık 20 A4 sayfası) sahip ve RTX A4000 ya da 3090 gibi 16 GB VRAM’li GPU’larda çalışabiliyor. Daha küçük Kumru-2B sürümü Hugging Face’te açık kaynak olarak yayımlanmış durumda. Verinin şirket dışına hiç çıkmaması gereken senaryolarda router’ın “şirket içi” hedefi böyle bir model olabilir.

İki büyük yongalı mavi devre kartı — yerli dil modelini şirket içi donanımda çalıştırmak
16 GB VRAM’li tek bir GPU, Kumru gibi orta boy bir Türkçe modeli şirket içinde çalıştırmaya yetebilir; kapasiteyi gerçek trafikle test edin.

• • •

Fallback, PII maskeleme ve loglama nasıl tasarlanır?

Fallback zinciri

Her rota için en az bir yedek model tanımlanmalı ve yedeğin de aynı veri kuralına uyması gerekir. Kişisel veri içeren bir istek için şirket içi modelden yurt dışı modele düşmek bir fallback değil, ihlal riskidir. Doğru zincir; şirket içi model, ardından Türkiye’de işleyen model, o da yoksa kullanıcıya anlaşılır bir “şu an işlenemiyor” yanıtıdır. Sağlık kontrolü, zaman aşımı ve devre kesici (circuit breaker) eşikleri her sağlayıcı için ayrı ayarlanmalı.

PII maskeleme

Maskeleme servisi istemdeki T.C. kimlik numarası, telefon, e-posta, IBAN ve adres gibi alanları tespit edip yer tutucularla değiştirir; model yanıtı döndüğünde yer tutucular orijinal değerlerle yeniden doldurulur. Böylece özetleme gibi kişisel veriye ihtiyaç duymayan görevler güçlü bir yurt dışı modelde de çalışabilir. Ancak tespit algoritmaları hata yapabilir; serbest metinlerde maskeleme tek başına güvence sayılmamalı, hassas iş akışları yine yerli rotada kalmalı.

Loglama ve erişim

Her çağrı için kullanıcı, uygulama, seçilen model, rota gerekçesi, token sayısı, maliyet, gecikme ve sonuç durumu kaydedilmeli. İstem ve yanıt metinlerinin kendisi ise maskelenmiş halde ve sınırlı süreyle tutulmalı. Bu loglara kimin erişeceği de bir yetki tasarımı konusudur; RBAC ile erişim modeli tasarımı yazımız bu noktada iyi bir başlangıç.

• • •

Maliyet ve kaliteyi nasıl ölçersiniz?

Router kurmanın en büyük getirisi maliyet kontrolüdür ama bu getiri ancak ölçülürse görünür. IBM Research yazısındaki temel fikir şu: büyük modelleri yüksek değerli, karmaşık işler için saklayın; zor olmayan işleri küçük ve ucuz modellere bırakın. Bunu yapabilmek için her görev tipine ait bir değerlendirme seti gerekir: gerçek, maskelenmiş örnek istekler ve beklenen çıktılar.

Biz değerlendirmeyi üç aşamada kuruyoruz. İlki, yeni bir modeli rotaya almadan önce değerlendirme setinde çevrimdışı test. İkincisi, canlı trafiğin küçük bir yüzdesini yeni modele yönlendiren kontrollü deneme. Üçüncüsü, kullanıcı geri bildirimi ve örneklem bazlı insan incelemesiyle sürekli izleme. Bütçe tarafında ise departman ve uygulama bazında aylık sınır, sınıra yaklaşıldığında uyarı ve sınır aşıldığında daha ucuz rotaya geçiş ya da durdurma kuralı tanımlanır.

Bu metrikleri ayrı bir panelde değil, mevcut izleme altyapınızda görmek gerekir. Gecikme ve hata oranlarının uygulama metrikleriyle aynı yerde durması, sorunun modelde mi yoksa entegrasyonda mı olduğunu hızla ayırt etmenizi sağlar.

Ekranda çizgi grafik — LLM router maliyet, gecikme ve kalite metriklerinin izlenmesi
Model başına maliyet, gecikme ve kalite puanı aynı grafikte izlenmeli; tek başına ucuzluk yanıltıcı olabilir.

• • •

OpenAI uyumlu arayüz tedarikçi bağımlılığını nasıl azaltır?

Internative raporunun dördüncü trendi, şirketlerin yeni yatırımlarda vendor lock-in toleransının düştüğünü söylüyor. Yapay zeka tarafında bunun en pratik karşılığı, uygulamaların belirli bir sağlayıcının SDK’sına değil, OpenAI uyumlu tek bir arayüze yazılmasıdır. Birçok açık kaynak sunucu ve EVREN gibi servisler bu arayüzü desteklediği için, AI Ops katmanı uygulamaya aynı /v1/chat/completions benzeri sözleşmeyi sunar; arkada hangi modelin çalıştığı yapılandırmayla değişir.

Uygulama kodunda model adı yerine “görev profili” kullanmak işi daha da kolaylaştırır: uygulama model="ozetleme-standart" gibi mantıksal bir ad gönderir, router bunu o günkü kurala göre gerçek modele çevirir. Bir sağlayıcının fiyatı değiştiğinde ya da yeni bir yerli model çıktığında yalnızca kural tablosu güncellenir. Uyumluluk her zaman yüzde yüz değildir; araç çağırma (tool calling) ve yapılandırılmış çıktı gibi özelliklerin her hedefte test edilmesi gerekir.

Aynı katman, yapay zeka ajanları için de omurga görevi görür. Ajan döngüsünün model çağrılarını doğrudan sağlayıcıya değil router’a yapması, bütçe ve veri kurallarını ajanlar için de geçerli kılar. Bu konuyu yapay zeka ajanlarını üretime almak rehberimizde middleware zinciri üzerinden anlattık.

• • •

LLM router kontrol listesi

Router’ı canlıya almadan önce aşağıdaki maddelerin her birinin yazılı bir yanıtı olmalı.

  • Her model hedefi için verinin işlendiği ülke, sözleşme durumu ve KVKK m.9 güvencesi kayıt altında mı?
  • Kişisel veri tespiti hangi alanları kapsıyor ve şüpheli durumda varsayılan rota güvenli rota mı?
  • Her rotanın yedek modeli aynı veri kuralına uyuyor mu, devre kesici eşikleri tanımlı mı?
  • Uygulamalar sağlayıcı SDK’sı yerine OpenAI uyumlu tek arayüze ve mantıksal görev profillerine mi yazıyor?
  • Her görev tipi için değerlendirme seti ve kalite eşiği var mı?
  • Departman ve uygulama bazında bütçe sınırı, uyarı ve aşım davranışı tanımlı mı?
  • Loglarda istem ve yanıt metinleri maskeleniyor mu, saklama süresi ve erişim yetkileri belirlendi mi?
  • Maliyet, gecikme ve hata metrikleri mevcut izleme altyapısına akıyor mu?
  • Yeni bir modeli rotaya almak için çevrimdışı test ve kontrollü deneme süreci yazılı mı?

• • •

Aksiyon Soft nasıl yardımcı olur?

API ve entegrasyon hizmetimiz kapsamında uygulamalarınız ile dil modelleri arasındaki AI Ops katmanını; yönlendirme kuralları, maskeleme, fallback ve loglama dahil olmak üzere tasarlayıp kuruyoruz. Router’ı ERP, CRM ve iç portallarınıza bağlayan süreçleri kurumsal yazılım çözümleri hizmetimizle hayata geçiriyoruz. Mimari yaklaşımımızı API ve veri entegrasyon platformu sayfasında inceleyebilirsiniz.

Çalışma modelimiz keşifle başlar: hangi uygulamaların hangi görevler için model kullandığı, hangi verilerin kişisel veri sayıldığı ve hangi sağlayıcıların hangi güvenceyle kullanılabileceği yazıya dökülür. Ardından tek bir uygulama ve iki model hedefiyle bir MVP kurar, her sprint sonunda çalışan akışı gösterir, canlıya geçiş sonrasında hypercare dönemi ve SLA’lı destekle devam ederiz. Merkezimiz Samsun’dadır; Türkiye’nin her yerindeki ekiplerle uzaktan çalışır, gerektiğinde planlı yerinde ziyaretler yaparız.

Sık sorulan sorular

LLM router kullanmak için kaç modele ihtiyacım var?

İki model bile yeterlidir: örneğin kişisel veri içeren istekler için Türkiye’de işleyen bir model ve diğer işler için güçlü bir genel model. Router’ın değeri model sayısından çok, kuralların tek yerde yönetilmesinden gelir.

Router her isteğe ek gecikme ekler mi?

Kural tabanlı bir router çoğu durumda modelin yanıt süresine göre ihmal edilebilir bir ek yük getirir. İçeriği ayrı bir modelle sınıflandıran router’larda ek gecikme artar; bu yüzden basit kurallarla başlamak mantıklıdır.

Kişisel veri içeren istemleri yurt dışındaki bir modele gönderebilir miyim?

Değişen KVKK 9. maddesi; işleme şartı ve yeterlilik kararı ya da standart sözleşme gibi uygun güvenceler varsa aktarıma izin veriyor. Somut senaryonuzu hukuk danışmanınızla değerlendirin; teknik tarafta ise güvencesi olmayan rotaları router seviyesinde kapatın.

EVREN’i kurumsal uygulamalarda kullanabilir miyiz?

EVREN’in çıkarım servisi OpenAI uyumlu bir API sunduğu için teknik olarak router’a bir hedef olarak eklenebilir. Erişim e-Devlet kimlik doğrulamasıyla sağlanıyor; kullanım koşullarını ve kredi modelini projeniz için ayrıca değerlendirmenizi öneririz.

Hazır bir AI gateway ürünü mü almalıyız, kendimiz mi kurmalıyız?

Hazır ürünler hızlı başlangıç sağlar; ancak KVKK kuralları, iç sistem entegrasyonu ve yerli model hedefleri çoğu zaman özelleştirme gerektirir. Keşif aşamasında iki seçeneği ihtiyaç listenize göre karşılaştırıyoruz.

Router kurulumu ne kadar sürer?

Tek uygulama ve iki model hedefiyle bir MVP birkaç sprintte canlıya alınabilir. Maskeleme, değerlendirme hattı ve çok sayıda uygulamanın taşınması kapsamı genişletir; keşif sonrasında yazılı bir takvim paylaşırız.

Projenizi konuşalım

Birden fazla dil modelini maliyet, kalite ve KVKK dengesini koruyarak kullanmak istiyorsanız iletişim sayfamızdan kısa bir özet gönderin. Hangi uygulamaların router’a taşınacağını, hangi model hedeflerinin uygun olduğunu ve entegrasyon kapsamını birlikte netleştirelim.

Kaynaklar

Blog ve haberlere abone olun

Yeni yazılar yayınlandığında e-posta alın. İstediğiniz zaman abonelikten çıkabilirsiniz.

İlgili içerikler