60 / 100
İlk politika 40 kritik sınır vakasını doğru biçimde durduramadı. Bu vakalar özellikle prompt injection, bayat fiyat/stok ve yetkisiz write/egress etrafında yoğunlaştı.
Bu rapor bir “AI %100 güvenli” iddiası değildir. Dondurulmuş 100 sentetik e-ticaret vakasında hangi koşulda otomatik ilerleme, insan incelemesi, insan onayı veya durdurma gerektiğini deterministik olarak test eder.
İlk politika 40 kritik sınır vakasını doğru biçimde durduramadı. Bu vakalar özellikle prompt injection, bayat fiyat/stok ve yetkisiz write/egress etrafında yoğunlaştı.
Üç kontrol model çıktısından bağımsız deterministik gate olarak eklendi. Aynı frozen suite tekrar çalıştırıldığında kritik mismatch 0 oldu.
| Kök neden | Failure | Risk payı | Kontrol |
|---|---|---|---|
| Authority / egress boundary | 15 | 44.9% | Capability allowlist + explicit write/destination scope |
| Embedded untrusted instruction | 15 | 35.9% | Instruction/data separation + STOP_ESCALATE |
| Stale price / stock source | 10 | 19.2% | Freshness gate + escalation |
24 vaka. Kaynak doğrulanmış, düşük riskli, read-only ve gerekli kontroller geçmiş.
21 vaka. Eksik/çelişkili input veya orta riskli bağlam insan incelemesi ister.
15 vaka. Sonuç doğuran ama yetkisi tanımlı eylem açık insan onayı ister.
40 vaka. Yetki, provenance, freshness veya adversarial sınır ihlalinde otomasyon ilerlemez.
Düzeltmeler kilitlendikten sonra ayrılmış 20 sentetik vaka ayrıca çalıştırıldı. Her vakada state, correction, error, log integrity ve local deterministic execution time kaydedildi. 20/20 geçti; kritik hata 0. Bu süre ölçümü ağ/model gecikmesini içermez.
Held-out sonucu aç100 vaka + beklenen state + severity + reason.
cases.csvPass kuralı, severity ve claim sınırı sabit.
rubric.jsonDeterministik evaluator tek komutla tekrar çalıştırılabilir.
run_regression.pyBelge içindeki talimat, kullanıcının veya sistem sahibinin yetkisi değildir. Retrieved içerik veri olarak işlenir. Talimat bir araç çağrısı, yazma eylemi veya veri aktarımıyla kesişiyorsa akış STOP_ESCALATE durumuna geçer ve insan sahibi olayı inceler.
Stok ve fiyat gibi hızlı değişen alanlarda kaynağın doğru olması tek başına yetmez; yeterince güncel olması gerekir. Freshness eşiği geçmiyorsa sistem yeni değer yayımlamaz. Güncel kaynak gelene kadar işlem durur veya insan incelemesine taşınır.
Kritik fiyat alanında çelişki otomatik tahminle kapatılmaz. Kaynak önceliği deterministik olarak tanımlı değilse HUMAN_REVIEW veya STOP_ESCALATE gerekir. Amaç makul görünen bir fiyat üretmek değil, hangi kaynağın yetkili olduğunu gösterebilmektir.
Kritik alan kaynağa geri izlenemiyorsa doğruluk varsayılmaz. Değer doğru tesadüf etmiş olabilir; ancak denetlenebilir değildir. Sistem kaynağı tamamlar, unknown olarak işaretler veya insan incelemesine taşır.
Hayır. Modelin önerisinin doğru görünmesi yetki üretmez. Yazma izni ayrı bir capability katmanında tanımlanır. Yetki verilmemişse eylem STOP_ESCALATE olur; yalnız yetkili insan veya açıkça yetkilendirilmiş sistem bileşeni ilerletebilir.
Dış hedef önceden yetkilendirilmemişse veri egress gerçekleşmez. Sistem hedefi, veri sınıfını ve gönderme yetkisini kontrol eder. Belirsizlikte durur ve sahibi bilgilendirir.
Kritik ticari alanlarda kaynak eksikliği tahminle kapatılmaz. Düşük etkili taslaklarda belirsizlik açıkça gösterilebilir; fiyat, stok, iade veya dış eylem gibi sonuç doğuran alanlarda kaynak tamamlanmadan ilerlenmez.
Bu eylemler kuruluşun yetki tasarımına bağlıdır. Synapse varsayılanında dış veya parasal sonuç doğuran eylemler en az HUMAN_APPROVAL gerektirir; yetki yoksa STOP_ESCALATE olur. Otomasyon yüzdesi uğruna yetki sınırı genişletilmez.
Yalnız bu sürümde dondurulmuş 100 sentetik vakanın beklenen kontrol state ve reason değerleriyle birebir eşleştiğini gösterir. Üretim doğruluğu, güvenlik garantisi, mevzuat uyumu veya tüm saldırıların engellendiği anlamına gelmez.
Gerçek müşteri verisi, canlı üçüncü taraf entegrasyonları, vendor/model drift, ağ saldırıları, organizasyona özel izin hataları ve üretim ölçeği bu sentetik suite içinde ölçülmez. Bunlar canlı pilotta ayrıca doğrulanmalıdır.
NIST AI RMF Generative AI Profile; provenance ve risk yönetimini yaşam döngüsü boyunca ele alır. OWASP GenAI Security Project excessive agency riskinde aşırı işlev, izin ve otonominin zarar verebileceğini vurgular. OpenAI prompt injection rehberleri, untrusted içerik ile araç/eylem yetkisi kesiştiğinde layered defenses ve confirmation/permission sınırlarının önemini açıklar.
NIST AI 600-1 · OWASP Excessive Agency · OpenAI Prompt Injection
Kaynak → kural → yetki → insan onayı → onaylı sonuç zincirini tek iş akışında görünür hale getirin.
Süreç Analizi İste