Yapay zekâ demosunda birkaç doğru cevap görmek, sistemin günlük işte güvenilir olduğunu göstermez. Demo örnekleri kolay seçilmiş olabilir; gerçek kullanımda eksik bilgi ve alışılmadık ifadeler vardır. Başarı ölçümü için önce sistemin hangi görevi yaptığı ve hangi hataların kabul edilemeyeceği yazılmalıdır. Tek bir genel kalite puanı, farklı hataların iş etkisini gizleyebilir.
Mevcut sürecin ölçüsünü alın
İnsanların aynı işi nasıl yaptığına dair küçük ama temsil edici bir başlangıç ölçümü hazırlayın. Ortalama süre kadar düzeltme ve tekrar iş miktarını da kaydedin. İnsan süreci kusursuzmuş gibi varsaymayın; karşılaştırmanın iki tarafında da aynı kalite ölçütünü kullanın. Hangi veri örneklerinin seçildiğini ve hangi dönemi temsil ettiğini yazın. Bu kayıt olmadan sonradan söylenen tasarruf oranı güvenilir olmayabilir.
Test setini gerçek çeşitlilikle kurun
Normal, belirsiz, eksik ve kapsam dışı örnekler olsun. Bir belge özetleme sisteminde kısa metin kadar uzun tablo ve çelişkili sürüm de değerlendirilsin. Beklenen cevap her zaman tek bir cümle olmayabilir; bulunması gereken bilgiler ve yapılmaması gereken iddialar tanımlanabilir. Sistemi geliştirirken kullanılan örneklerle son kontrol örneklerini mümkün olduğunca ayırın. Aksi halde yalnızca bilinen sorulara uyum sağlandığını ölçebilirsiniz.
Hataları etkilerine göre sınıflandırın
Yazım üslubunun zayıf olması ile yanlış müşteri kaydına işlem yapmak aynı ağırlıkta değildir. Bilgi uydurma, kaynak eksikliği, yetkisiz veri, yanlış eylem ve cevap verememe gibi sınıflar oluşturun. Kritik bir hata düşük toplam oran içinde kaybolmamalıdır. Her sınıf için örnek ve kabul kararı yazın. İşletme sahibi, teknik ekip ve işi kullanan kişiler bu tanımlarda anlaşmalıdır.
Örnek bir talep sınıflandırma pilotunda yanlış departmana yönlendirme tekrar iş yaratır. “Belirsiz” deyip insan incelemesine bırakma ise daha yavaş ama güvenilir olabilir. Bu iki sonucu aynı yanlış cevap kategorisine koymak tasarımı yanlış yönde teşvik eder. Sistemin gerektiğinde durabilmesini veya ek bilgi istemesini değerlendirme planına dahil edin.
Model maliyetinin yanına insan emeğini ekleyin
İstek başına ücret, toplam maliyetin yalnızca bir parçasıdır. Belge hazırlama, arama altyapısı, izleme, inceleme ve düzeltme emeği de vardır. Daha ucuz model daha çok düzeltme gerektiriyorsa toplamda pahalı olabilir. Daha hızlı yanıt da yanlışsa yarar sağlamaz. Karşılaştırma tablosunda kalite, gecikme ve toplam iş maliyetini birlikte gösterin; birini iyileştirirken diğerini bozduğunuzu görün.
- Manuel süreç için karşılaştırılabilir başlangıç ölçümü var mı?
- Test seti zor ve kapsam dışı örnekler içeriyor mu?
- Kritik hatalar ortalama puandan ayrı raporlanıyor mu?
- İnsan kontrolü ve düzeltme süresi maliyete dahil mi?
- Model veya kaynak değişince hangi testler tekrarlanacak?
Yayın sonrası kaliteyi izlemeyi sürdürün
Kaynak belgeler, model sürümü veya kullanıcı kitlesi değiştiğinde sonuçlar da değişebilir. Sürüm ve yapılandırma kaydı tutun; temsili örnekleri yeniden değerlendirin. Kullanıcı geri bildirimini doğrudan doğru kabul etmek yerine uygun inceleme süreci kurun. Başarısız örneklerden öğrenin ama test setine gizli kişisel veri biriktirmeyin. Yayın kararı kadar geri çekme ve insan sürecine dönme koşulları da tanımlı olmalıdır.
Değerlendirme ve risk yaklaşımı için NIST AI Risk Management Framework kullanılabilir. İlk otomasyon seçimi rehberi ölçülebilir pilot bulmaya yardımcı olur; AI projelerinde başarı ölçütlerini uygulamadan önce belirleyin.
