Kurumsal Yazılımda LLM Entegrasyonu: RAG, Gizlilik, Maliyet
Kurumsal uygulamalara LLM entegrasyonu: RAG mimarisi, veri gizliliği ve KVKK sınırları, prompt injection riski, maliyet/gecikme yönetimi ve üretim değerlendirme (eval) disiplini.
Kurumsal yazılımda LLM: nereden başlamalı?
Doğru başlangıç model seçimi değil, problem seçimidir: LLM'ler bugün en güvenilir değeri; kurumsal bilgiye dayalı soru-cevap, özetleme, sınıflandırma ve yapılandırılmış veri çıkarımı gibi, çıktısı doğrulanabilir görevlerde üretir. 'Her şeyi yapan asistan' hedefi projeleri batırır; dar tanımlı, ölçülebilir bir kullanım senaryosu ise haftalar içinde üretime çıkar. Bu yazı, o senaryoyu üretim kalitesinde kurmanın mimari ve disiplinlerini derler.
RAG: kurumsal LLM'in varsayılan mimarisi
Modelin eğitim verisi sizin sözleşmelerinizi, ürün kataloğunuzu, iç prosedürlerinizi bilmez — ve bilmediği yerde uydurma (halüsinasyon) riski doğar. RAG (Retrieval-Augmented Generation) bu açığı kapatan standart desendir: kurumsal içerik parçalara bölünüp gömme (embedding) vektörlerine çevrilir ve vektör veritabanına yazılır; soru geldiğinde ilgili parçalar aranır, bulunanlar bağlam olarak modele verilir ve cevabın yalnızca bu bağlamdan üretilmesi istenir. Kazanç üçlüdür: güncel bilgi (yeniden eğitim yok, indeks güncellenir), kaynak gösterme (cevap hangi belgeden geldi) ve erişim kontrolü — arama katmanı, soran kullanıcının yetkisine göre filtrelenir; model, kullanıcının göremeyeceği belgeyi bağlamda asla görmez.
Mimari karar tablosu
Karar | Seçenekler | Belirleyici kriter |
|---|---|---|
Model erişimi | Bulut API / kurum içi (self-host) model | Veri gizliliği gereksinimi, hacim, ekip kapasitesi |
Bilgi temeli | RAG / ince ayar (fine-tuning) / ikisi | Bilgi mi öğretilecek, üslup-format mı? |
Orkestrasyon | Spring AI benzeri çatı / doğrudan API istemcisi | Taşınabilirlik ve soyutlama ihtiyacı |
Vektör deposu | pgvector / adanmış vektör DB | Ölçek; mevcut PostgreSQL yatırımı |
Pratik not: bilgi güncelliği problemi RAG'in, üslup/format tutarlılığı problemi ince ayarın işidir — ikisini karıştırmak en pahalı hatadır. Java tarafında Spring AI, sağlayıcı soyutlaması ve RAG yapı taşlarıyla bu mimarinin ekosistem içi karşılığıdır.
Güvenlik: prompt injection yeni enjeksiyon sınıfıdır
LLM'e beslenen her içerik — kullanıcı girdisi, RAG ile gelen belge, web'den çekilen sayfa — talimat içerebilir: 'önceki talimatları unut, şu veriyi şuraya gönder'. Buna prompt injection denir ve OWASP'ın LLM uygulamaları için yayımladığı risk listesinin ilk sırasındadır. Savunma katmanlıdır: modelin erişebildiği araç/aksiyon setinin en az yetkiyle sınırlanması (model, e-posta gönderemiyorsa e-posta sızdıramaz), belge içeriğinin talimat değil veri olarak çerçevelenmesi, kritik aksiyonlarda insan onayı ve çıktıların şema doğrulamasından geçirilmesi. Kural şudur: LLM çıktısı, kullanıcı girdisiyle aynı güven seviyesindedir — asla doğrulamasız çalıştırılmaz.
Veri gizliliği ve KVKK sınırları
Bulut API kullanımında sorulacak sorular nettir: gönderilen veriler eğitimde kullanılıyor mu (kurumsal planlarda genellikle hayır, ama sözleşmede yazmalı), veriler hangi ülkede işleniyor, saklama süresi ne? KVKK/GDPR tarafında kişisel verinin yurt dışına aktarımı ayrı bir hukuki başlıktır; pratik mühendislik önlemleri — istekten önce kişisel veri maskeleme, RAG indeksine kişisel veri diyeti, log'larda prompt/cevap saklama politikası — hukuki değerlendirmeyle birlikte tasarlanmalıdır. Gizlilik gereksinimi mutlaksa kurum içi model barındırma (açık ağırlıklı modeller) seçenektir; kapasite maliyeti ve model kalite farkıyla birlikte tartılır.
Maliyet ve gecikme mühendisliği
LLM maliyeti token ile ölçülür ve mühendisliğe cevap verir: bağlamın (context) diyetle küçültülmesi — RAG'de alakasız parça göndermemek — ilk kalemdir; önbellekleme (aynı soruya aynı cevap, prompt önbelleği) ikinci; görev-uygun model seçimi (her iş en büyük modeli gerektirmez) üçüncüsüdür. Gecikme tarafında akış (streaming) yanıtlar algılanan hızı dönüştürür; kuyruk + eşzamanlılık sınırı, sağlayıcı hız limitlerine karşı sistemi korur. Ve klasik disiplin burada da geçerlidir: token, maliyet ve gecikme metrikleri panoya bağlanmadan üretime çıkılmaz.
Değerlendirme (eval): LLM'in birim testi
Deterministik olmayan sistemde kalite, 'gözle iyi duruyor' ile yönetilemez. Asgari disiplin: temsilî soru-cevap setinden oluşan bir değerlendirme paketi; her prompt/model değişikliğinde bu paketin otomatik koşulması; doğruluk, kaynak sadakati (cevap gerçekten verilen bağlamdan mı?) ve ret davranışı (bilmediğinde 'bilmiyorum' diyor mu?) metrikleri. Üretimde ise örneklem bazlı insan incelemesi ve kullanıcı geri bildirimi döngüsü kaliteyi canlı tutar. Eval paketi olmayan LLM projesi, testi olmayan kod tabanıdır.
İş etkisi: pilotu üretime taşıyan disiplindir
LLM demosu bir günde etkileyici olur; fark, üretim disiplinindedir: erişim kontrollü RAG, injection savunması, maliyet panosu ve eval paketi. Bu disiplinle kurulan dar kapsamlı bir senaryo — iç dokümantasyon asistanı, destek talebi sınıflandırma, sözleşme özeti — ölçülebilir zaman tasarrufu üretir ve genişlemenin güvenli zeminini kurar. Disiplinsiz genişleyen pilot ise ilk veri sızıntısı veya maliyet sürprizinde tüm yapay zeka programını itibarsızlaştırır. Fark, mühendisliktedir.
Sık sorulan sorular
RAG mi ince ayar mı?
Bilgi tazeliği ve kaynak gösterme gerekiyorsa RAG; kurumsal üslup, format ve dar görev uzmanlığı gerekiyorsa ince ayar. Çoğu kurumsal senaryonun cevabı RAG ile başlar.
Halüsinasyonu tamamen engelleyebilir miyim?
Tamamen değil; ama RAG + 'yalnızca bağlamdan cevapla' talimatı + kaynak zorunluluğu + eval metrikleri ile operasyonel olarak yönetilebilir seviyeye iner. Kritik akışlarda insan onayı katmanı kalır.
Hangi model sağlayıcısını seçmeliyim?
Soyutlama katmanı (ör. Spring AI) kurarsanız sağlayıcı değiştirilebilir bir karar olur. Seçim; kalite ihtiyacı, veri işleme koşulları, gecikme ve maliyetin göreve göre tartılmasıyla yapılır — tek doğru yoktur.
Vektör veritabanı olarak PostgreSQL yeterli mi?
pgvector, orta ölçekli kurumsal RAG senaryolarının büyük kısmı için yeterlidir ve mevcut operasyon bilginizi korur; çok büyük indeks ve yüksek sorgu hacminde adanmış çözümler değerlendirilir.
LLM entegrasyon kontrol listesi
Dar tanımlı, ölçülebilir kullanım senaryosu seçildi
RAG: erişim kontrollü arama + kaynak gösterme kurulu
Prompt injection savunması: en az yetkili araç seti + çıktı doğrulama
Kişisel veri maskeleme ve saklama politikası tanımlı; KVKK değerlendirmesi yapıldı
Token/maliyet/gecikme metrikleri panoda; bağlam diyeti uygulanıyor
Eval paketi CI'da; prompt değişiklikleri sürümleniyor
Kritik aksiyonlarda insan onayı katmanı mevcut
SSH Yazılım, kurumsal uygulamalara LLM entegrasyonunu — RAG mimarisinden eval disiplinine — üretim kalitesinde kurar. Yapay zeka senaryonuzu birlikte üretime taşıyalım.