Kurumsal Yazılımda LLM Entegrasyonu: RAG, Gizlilik, Maliyet

Kurumsal uygulamalara LLM entegrasyonu: RAG mimarisi, veri gizliliği ve KVKK sınırları, prompt injection riski, maliyet/gecikme yönetimi ve üretim değerlendirme (eval) disiplini.

RAG mimarisiyle LLM servisi çağrısını gösteren kod editörü penceresi

Kurumsal yazılımda LLM: nereden başlamalı?

Doğru başlangıç model seçimi değil, problem seçimidir: LLM'ler bugün en güvenilir değeri; kurumsal bilgiye dayalı soru-cevap, özetleme, sınıflandırma ve yapılandırılmış veri çıkarımı gibi, çıktısı doğrulanabilir görevlerde üretir. 'Her şeyi yapan asistan' hedefi projeleri batırır; dar tanımlı, ölçülebilir bir kullanım senaryosu ise haftalar içinde üretime çıkar. Bu yazı, o senaryoyu üretim kalitesinde kurmanın mimari ve disiplinlerini derler.

RAG: kurumsal LLM'in varsayılan mimarisi

Modelin eğitim verisi sizin sözleşmelerinizi, ürün kataloğunuzu, iç prosedürlerinizi bilmez — ve bilmediği yerde uydurma (halüsinasyon) riski doğar. RAG (Retrieval-Augmented Generation) bu açığı kapatan standart desendir: kurumsal içerik parçalara bölünüp gömme (embedding) vektörlerine çevrilir ve vektör veritabanına yazılır; soru geldiğinde ilgili parçalar aranır, bulunanlar bağlam olarak modele verilir ve cevabın yalnızca bu bağlamdan üretilmesi istenir. Kazanç üçlüdür: güncel bilgi (yeniden eğitim yok, indeks güncellenir), kaynak gösterme (cevap hangi belgeden geldi) ve erişim kontrolü — arama katmanı, soran kullanıcının yetkisine göre filtrelenir; model, kullanıcının göremeyeceği belgeyi bağlamda asla görmez.

Mimari karar tablosu

Karar

Seçenekler

Belirleyici kriter

Model erişimi

Bulut API / kurum içi (self-host) model

Veri gizliliği gereksinimi, hacim, ekip kapasitesi

Bilgi temeli

RAG / ince ayar (fine-tuning) / ikisi

Bilgi mi öğretilecek, üslup-format mı?

Orkestrasyon

Spring AI benzeri çatı / doğrudan API istemcisi

Taşınabilirlik ve soyutlama ihtiyacı

Vektör deposu

pgvector / adanmış vektör DB

Ölçek; mevcut PostgreSQL yatırımı

Pratik not: bilgi güncelliği problemi RAG'in, üslup/format tutarlılığı problemi ince ayarın işidir — ikisini karıştırmak en pahalı hatadır. Java tarafında Spring AI, sağlayıcı soyutlaması ve RAG yapı taşlarıyla bu mimarinin ekosistem içi karşılığıdır.

Güvenlik: prompt injection yeni enjeksiyon sınıfıdır

LLM'e beslenen her içerik — kullanıcı girdisi, RAG ile gelen belge, web'den çekilen sayfa — talimat içerebilir: 'önceki talimatları unut, şu veriyi şuraya gönder'. Buna prompt injection denir ve OWASP'ın LLM uygulamaları için yayımladığı risk listesinin ilk sırasındadır. Savunma katmanlıdır: modelin erişebildiği araç/aksiyon setinin en az yetkiyle sınırlanması (model, e-posta gönderemiyorsa e-posta sızdıramaz), belge içeriğinin talimat değil veri olarak çerçevelenmesi, kritik aksiyonlarda insan onayı ve çıktıların şema doğrulamasından geçirilmesi. Kural şudur: LLM çıktısı, kullanıcı girdisiyle aynı güven seviyesindedir — asla doğrulamasız çalıştırılmaz.

Veri gizliliği ve KVKK sınırları

Bulut API kullanımında sorulacak sorular nettir: gönderilen veriler eğitimde kullanılıyor mu (kurumsal planlarda genellikle hayır, ama sözleşmede yazmalı), veriler hangi ülkede işleniyor, saklama süresi ne? KVKK/GDPR tarafında kişisel verinin yurt dışına aktarımı ayrı bir hukuki başlıktır; pratik mühendislik önlemleri — istekten önce kişisel veri maskeleme, RAG indeksine kişisel veri diyeti, log'larda prompt/cevap saklama politikası — hukuki değerlendirmeyle birlikte tasarlanmalıdır. Gizlilik gereksinimi mutlaksa kurum içi model barındırma (açık ağırlıklı modeller) seçenektir; kapasite maliyeti ve model kalite farkıyla birlikte tartılır.

Maliyet ve gecikme mühendisliği

LLM maliyeti token ile ölçülür ve mühendisliğe cevap verir: bağlamın (context) diyetle küçültülmesi — RAG'de alakasız parça göndermemek — ilk kalemdir; önbellekleme (aynı soruya aynı cevap, prompt önbelleği) ikinci; görev-uygun model seçimi (her iş en büyük modeli gerektirmez) üçüncüsüdür. Gecikme tarafında akış (streaming) yanıtlar algılanan hızı dönüştürür; kuyruk + eşzamanlılık sınırı, sağlayıcı hız limitlerine karşı sistemi korur. Ve klasik disiplin burada da geçerlidir: token, maliyet ve gecikme metrikleri panoya bağlanmadan üretime çıkılmaz.

Değerlendirme (eval): LLM'in birim testi

Deterministik olmayan sistemde kalite, 'gözle iyi duruyor' ile yönetilemez. Asgari disiplin: temsilî soru-cevap setinden oluşan bir değerlendirme paketi; her prompt/model değişikliğinde bu paketin otomatik koşulması; doğruluk, kaynak sadakati (cevap gerçekten verilen bağlamdan mı?) ve ret davranışı (bilmediğinde 'bilmiyorum' diyor mu?) metrikleri. Üretimde ise örneklem bazlı insan incelemesi ve kullanıcı geri bildirimi döngüsü kaliteyi canlı tutar. Eval paketi olmayan LLM projesi, testi olmayan kod tabanıdır.

İş etkisi: pilotu üretime taşıyan disiplindir

LLM demosu bir günde etkileyici olur; fark, üretim disiplinindedir: erişim kontrollü RAG, injection savunması, maliyet panosu ve eval paketi. Bu disiplinle kurulan dar kapsamlı bir senaryo — iç dokümantasyon asistanı, destek talebi sınıflandırma, sözleşme özeti — ölçülebilir zaman tasarrufu üretir ve genişlemenin güvenli zeminini kurar. Disiplinsiz genişleyen pilot ise ilk veri sızıntısı veya maliyet sürprizinde tüm yapay zeka programını itibarsızlaştırır. Fark, mühendisliktedir.

Sık sorulan sorular

RAG mi ince ayar mı?

Bilgi tazeliği ve kaynak gösterme gerekiyorsa RAG; kurumsal üslup, format ve dar görev uzmanlığı gerekiyorsa ince ayar. Çoğu kurumsal senaryonun cevabı RAG ile başlar.

Halüsinasyonu tamamen engelleyebilir miyim?

Tamamen değil; ama RAG + 'yalnızca bağlamdan cevapla' talimatı + kaynak zorunluluğu + eval metrikleri ile operasyonel olarak yönetilebilir seviyeye iner. Kritik akışlarda insan onayı katmanı kalır.

Hangi model sağlayıcısını seçmeliyim?

Soyutlama katmanı (ör. Spring AI) kurarsanız sağlayıcı değiştirilebilir bir karar olur. Seçim; kalite ihtiyacı, veri işleme koşulları, gecikme ve maliyetin göreve göre tartılmasıyla yapılır — tek doğru yoktur.

Vektör veritabanı olarak PostgreSQL yeterli mi?

pgvector, orta ölçekli kurumsal RAG senaryolarının büyük kısmı için yeterlidir ve mevcut operasyon bilginizi korur; çok büyük indeks ve yüksek sorgu hacminde adanmış çözümler değerlendirilir.

LLM entegrasyon kontrol listesi

  1. Dar tanımlı, ölçülebilir kullanım senaryosu seçildi

  2. RAG: erişim kontrollü arama + kaynak gösterme kurulu

  3. Prompt injection savunması: en az yetkili araç seti + çıktı doğrulama

  4. Kişisel veri maskeleme ve saklama politikası tanımlı; KVKK değerlendirmesi yapıldı

  5. Token/maliyet/gecikme metrikleri panoda; bağlam diyeti uygulanıyor

  6. Eval paketi CI'da; prompt değişiklikleri sürümleniyor

  7. Kritik aksiyonlarda insan onayı katmanı mevcut

SSH Yazılım, kurumsal uygulamalara LLM entegrasyonunu — RAG mimarisinden eval disiplinine — üretim kalitesinde kurar. Yapay zeka senaryonuzu birlikte üretime taşıyalım.