OLGU / FENOMEN | #LLM #ModelGüvenliği

Halüsinasyon Hallucination

Düşük seviye ön bilgi gerekir.

LLM'in bir dil modeli ve text ürettiğini bilmek yeterli. Derin teknik bilgi veya matematiksel altyapı gerektirmez. Temel kullanıcı seviyesinde kavrayabilirsiniz.

Orta seviye öğrenme süreci.

Farklı Hallucination türlerini ayırt etmek (factual, intrinsic, extrinsic), hangi durumlarda ortaya çıktığını görmek ve detection yöntemlerini öğrenmek zaman alabilir.

Yüksek işlemsel zorluk.

Hallucination'ı tespit etmek ve önlemek çok zordur. Her çıktının manuel ya da otomatik olarak doğrulanması gerekir. RAG, kaynak ve doğrulama şarttır. Model ikna edici hatalar üretebilir; sürekli dikkat ve istisnai durumların yönetimi gerekir.

Kritik seviye yanlış anlaşılma riski.

"Model yalan söylüyor" yanılgısı: Model kasıtlı değil, istatistiksel örüntü eşlemesi yapar. "Tamamen önlenebilir" sanılması: Azaltılabilir ama tamamen ortadan kaldırılamaz. Güvenlik yanılgısı: Modelin kesin konuşması güven yaratır ama içerik yanlış olabilir. Üretim ortamında bu durum hukuki sorunlara yol açabilir.

Maksimum etki gücü.

Hallucination'ı doğru anlamak LLM kullanımında hayati öneme sahiptir. Canlı sistemlerde en büyük risklerden biridir. Doğru ele alındığında güvenilir uygulamalar inşa edebilir; aksi takdirde itibar ve yasal sorunlar yaşayabilirsiniz.

Çok yeni bir terim.

AI araştırmalarında eskiden de vardı, ancak LLM bağlamında 2022-2023 civarında popülerleşti. Hala aktif araştırma konusudur, yeni tespit ve azaltma teknikleri geliştirilmektedir.

Halüsinasyon, yapay zekânın gerçeğe uymayan ya da güvenilir bir dayanağı olmayan bir içeriği doğru çıktı olarak üretmesidir.
Terim insan psikolojisinden alınmıştır; yapay zekâda bu durum bir “görme yanılması” değil, yanlış ya da temelsiz içerik üretimidir.
Model ya veride olmayanı üretir ya da dayanağı olmayanı hesaplar, ikisi de güvenilmez çıktıdır.

Son güncelleme:

Teknik açıdan halüsinasyon, LLM'lerdeki olasılıksal token üretim sürecinin (Next Token Prediction) eğitim verisindeki gerçek dünya olgularıyla (ground truth) istatistiksel sapma yaşamasıdır.
Genellikle yüksek Temperature değerleri, Attention mekanizmasındaki hatalı ilişkilendirmeler veya veri setindeki bilgi eksikliği (OOD) nedeniyle tetiklenir.

Uygulama ve Çözüm

  • RAG (Retrieval-Augmented Generation): Modeli sadece kendi parametrelerine hapsetmeyin; dış, doğrulanabilir bir bilgi kaynağından (vektör veritabanı) besleyin.
  • Self-Correction Loop: Modelin çıktısını, dayandığı kaynakla karşılaştıran ve çelişki durumunda yeniden üretim yapan bir kontrol döngüsü kurun.
  • Logit Bias & Temperature Control: Yaratıcılığın kritik olmadığı durumlarda Temperature değerini 0'a yakın tutarak "açgözlü arama" (greedy search) yöntemini tercih edin.
Örnek Vaka:

Bir modelin, kendisine sorulan bir hukuk sorusuna cevap verirken, aslında literatürde hiç var olmayan bir mahkeme kararını tarih ve dosya numarası vererek gerçekmiş gibi referans göstermesi.

Son güncelleme:

Halüsinasyon, bir dil modelinin intersubjektif doğrulama prosedürlerine açık bir bilgi alanında —yani sistematik gözlem, çapraz-kaynak teyidi, ölçülebilir veriler veya standart doğrulama metodolojileriyle prensipte test edilebilir olgusal önermeler alanında (normatif, estetik veya tamamen subjektif değerlendirmeler hariç)— mevcut bağlam, açık talimatlar ve modelin eğitim sürecinde içselleştirdiği istatistiksel örüntüler temelinde epistemik destek sunulamayan veya bunlarla çelişen bir önermeyi;


    (a) Uygun belirsizlik göstergeleri ("muhtemelen", "emin değilim", "doğrulanması önerilir") kullanmaksızın veya kullanıyor ancak güven kalibrasyonu sistematik olarak hatalı biçimde (yüksek güvenle yanlış iddia),
    (b) Dilsel yapı, ifade kesinliği ve bağlamsal göstergeler temelinde, olgusal bilgi transferi olarak yorumlanabilecek bir sunum tarzıyla —burada yorumlama kriteri, benzer dilsel formların tipik olarak olgusal iddia taşıdığı standart iletişim bağlamlarına dayanır—,
    (c) Aşağıdaki kriterlerden en az birini karşılayacak şekilde:

  • (c1) Önermenin, modelin bilgi kesme tarihi itibarıyla geçerli olan, ilgili alanda genel kabul görmüş güvenilir kaynaklarla desteklenemediği veya bunlarla çeliştiği,

  • (c2) Önermenin ilgili alan standartlarına göre standart doğrulama yöntemlerinin uygulanmasıyla (kaynak kontrolü, çapraz referans, temel mantık testi) yanlışlanabilir veya desteksiz olduğunun gösterilebilir nitelikte olması,

  • (c3) Önermenin olgusal yapısının fabrication (uydurma varlık) veya confabulation (epistemik dayanağı olmayan yanlış birleşim) niteliği taşıması —basit tarih/sayı hatasından niteliksel olarak farklı olarak—,

  • (d) Söz konusu önermenin üretiminin şu bağlamlardan hiçbiriyle meşrulaştırılamadığı durumlarda:

  • (d1) Modelin tasarım gereği açıkça tanımlanmış yaratıcı, kurmaca veya spekülatif işlevi (hikaye, senaryo),

  • (d2) Kullanıcının açık talimatı ("hayal et", "varsay") veya soru modalitesinden türetilebilir kurmaca beklentisi,

  • (d3) Kabul edilmiş pedagojik pratiklerde yaygın olan (kavramsal çarpıtma içermeyen) basitleştirmeler,

  • (d4) Kontrafaktüel öncül içindeki çıkarımların, o varsayımsal dünyada bile mantıksal tutarlılık korumaması,

  • (e) Temporal geçerlilik şartı: Modelin bilgi kesme tarihi ile kullanım anı arasında önermenin doğruluk değeri değişmiş olsa bile, eğer model bu sınırı bildirmemişse veya üretim anındaki bilgi durumunda bile gerekçesizse oluşan durumdur.

üretmesidir.

Son güncelleme:

Halüsinasyon kavramını doğru konumlandırmak için neyi temsil etmediğini belirlemek hayati önem taşır;

  • Kasıtlı Bir Yalan Değildir: Modelin bir niyeti, bilinci veya "aldatma" amacı yoktur. Süreç tamamen istatistikseldir.
  • Basit Bir Yazılım Hatası (Bug) Değildir: Sistem bozuk olduğu için değil, olasılıksal doğası gereği bu çıktıyı üretir. Kodda bir hata yoktur, modelin çalışma biçiminin bir sonucudur.
  • Bilinçli Bir Tercih Değildir: Model "bilmiyorum" demek yerine en yüksek olasılıklı kelimeyi seçer; bu bir "karar" değil, matematiksel bir zorunluluktur.
Yapay zekâ halüsinasyon nedir? +
Makul görünen, ancak gerçek dışı, dayanaksız veya uydurulmuş çıktılar üretmesidir. Bu durum, transformer mimarisinin doğrudan doğuştan bir özelliği değil; daha çok modellerin nasıl eğitildiği, ayarlandığı ve kullanıma sunulduğuyla ilgilidir. Halüsinasyonlar, yapının kendisinin değil; bu yapının eğitim ve çıkarım sırasında nasıl kullanıldığının sonucudur.
Yapay zekâ halüsinasyonları nasıl engellenir / azaltılır? +
Oturumdaki maksimum token sayısını sınırlayın; Her oturumun belli bir token (oturum penceresindeki toplam kelime sayısı) sınırı vardır. Oturum, ne kadar uzarsa, eskileri hatırlama şansı azalır ve bu da halüsinasyon görme ihtimalini yükseldir.

Modelin, sorduğunuz bir sorunun yanıtını bilmediğinde yanıt vermemeyi öğrenmesi için "bilmiyorsan bilmiyorum de" veya "Emin olmadığın konularda istatistik verme, gerekiyorsa ‘Bilmiyorum’ de." vb. şekillerde ince ayarlar yapın. Bu, özellikle tarih, sayı vb. konulardaki uydurma cevap verme eğilimlerini azaltacaktır.

Yapay zekâya verdiğiniz bir kaynak veya bir metni "Sadece verdiğim bilgiye/kaynağa dayanarak cevap ver, başka dış kaynaklara gitme" vb. dediğinizde, halüsinasyon riski ciddi şekilde düşecektir.
Yapay zekâ halüsinasyon örnekleri +
  • Olmayan Kaynak Üretimi: Yapay zekâdan bir konu hakkında araştırma istendiğinde, hiç yazılmamış akademik makale, kitap veya davalara atıf yapması.
  • Tarihsel ve Coğrafi Hatalar: Hiç yaşanmamış olayları detaylandırma veya coğrafi konumlara dair yanlış bilgiler verme.
  • İçerik Çelişkisi: Cevabın başındaki bilgiyle sonundaki bilginin birbiriyle çelişmesi.
  • Yanlış Kişi Tanımları: Yaşayan birine öldü demesi veya iki farklı kişiyi tek bir kişiymiş gibi birleştirip biyografi yazması.
  • Uydurma Veriler: Şirket raporları veya istatistikler istendiğinde, gerçek olmayan grafikler veya tablolar sunması.
  • Yazılım ve Araçlar

    • Maxim AI — Yanılsama tespiti ve iş akışı otomasyonu için platform.
    • Arize AI — LLM'ler için gözlemlenebilirlik ve izleme odağı.
    • Comet — Deney takibi ve model değerlendirme araçları.

    Literatür ve Kitaplar

    • AI Hallucinations Decoded — Joshua Rodewald PhD
    • The Neuroscience of Visual Hallucinations — Daniel Collerton

    Dijital Kaynaklar