İçeriğe geç

Ajanım üretimde tutarsız: doğru çalıştığını nasıl anlarım?

Demoda çalışan ajan gerçek girdide bozuluyor. Tutarlılığı his ile değil, yazılı bir sınama kümesiyle ölçmenin yolu.

Yapay zekâ pratiği18 Eylül 2026 yayımlandı5 dakikalık okuma

Dayanak: Bu rehber Agentic AI Bootcamp'in değerlendirme bloğundan ve kendi ajanını üretime alan geliştiricilerin anlattığı tutarsızlıklardan yazıldı. Model karşılaştırması, doğruluk oranı veya kütüphane önerisi içermez.

Demoda kusursuz çalışıyordu.

Üretimde aynı işte üç farklı cevap veriyor.

Sorun modelde değil, ölçüde. Elinde "doğru" tanımı yoksa tutarlılığı da göremiyorsun. Bu yazı o tanımı kurmayı anlatıyor.

His ölçüm değil

İlk dönem herkes aynı şeyi yapıyor: değişiklik yapıp birkaç örnek deniyor ve "daha iyi oldu" diyor.

Bu yöntem ilk iki değişiklikte çalışıyor. Üçüncüde kayboluyor, çünkü neyin düzeldiğini neyin bozulduğunu kimse hatırlamıyor.

Kaybolan şey de hafıza değil, karşılaştırma. Aynı örnekleri her seferinde koşturmadığın sürece iki sürüm karşılaştırılamıyor.

Bu yüzden ilk iş yeni bir istem yazmak değil, sabit bir örnek kümesi kurmak.

Küme sabitlendiğinde tartışma da bitiyor. "Bence daha iyi" cümlesinin yerini "on yedi örnekten on beşi geçti" alıyor.

Bu cümle ekip içinde de fark yaratıyor. Ölçülebilir bir sonuç, tartışmayı fikir tartışması olmaktan çıkarıyor.

Yirmi gerçek girdiyle başla

Örnekleri uydurma. Üretimde gelen gerçek girdilerden seç.

Uydurulmuş girdiler temiz oluyor ve temiz girdi zaten sorun çıkarmıyor. Gerçek girdi eksik, çelişkili ve uzun geliyor.

Yirmi örnek çoğu iş için yeterli bir başlangıç. On tanesi tipik hâller, beş tanesi sınır hâller, beş tanesi bozuk girdiler olsun.

Bozuk girdileri özellikle koy. Boş alan, yanlış biçim, çok uzun metin ve alakasız içerik; üretimde en çok bunlar geliyor.

Alakasız içerik özellikle önemli. Ajanın kendi görevi dışındaki bir isteğe ne yaptığı, üretimde en çok sorun çıkaran davranış.

Kümeyi bir dosyada tut ve sürüm kontrolüne al. Kafada tutulan küme, küme değil.

Dosyada tutulan küme ayrıca devredilebiliyor. Ekibe yeni katılan kişi, sistemin ne yapması gerektiğini o dosyadan öğreniyor.

Beklenen çıktıyı yaz

Her örneğin yanına beklenen çıktıyı yaz. Kelimesi kelimesine değil, kabul ölçütü olarak.

"Şu alanı çıkarmalı", "şu tarihi doğru biçimde yazmalı", "bu durumda işlemi durdurmalı". Ölçüt bunlar.

Ölçütü yazarken de sınırı belirle: hangi farklar kabul, hangileri hata? İki farklı ama ikisi de doğru cevap normal; biri doğru biri yanlış olan çift ise sorun.

Ölçüt yazmak zorlayıcı bir iş ve çoğu ekip burada takılıyor. Takılmanın sebebi de bilgi eksikliği değil: doğru cevabın ne olduğu hiç konuşulmamış oluyor.

O konuşmayı yapmak zaten kazanç. Ekipte üç kişi üç farklı "doğru" bekliyorsa ajan değil tanım tutarsız.

Bu durumda yapılacak iş de model değiştirmek değil. Kabul ölçütünü birlikte yazmak, tutarsızlığın büyük kısmını kapatıyor.

Şema: sabit sınama kümesiyle her değişiklikten sonra ölçülen geçme sayısı ve regresyon yakalama.

Her değişiklikten sonra hepsini koştur

Sınama kümesinin değeri tekrar koşturmaktan geliyor.

İstem değişti, model değişti, araç eklendi; kümeyi baştan koştur. Kaç örnek geçti, kaç örnek düştü?

En önemli bilgi de düşen örnekler. Bir değişiklik genellikle bir şeyi düzeltirken başka bir şeyi bozuyor ve bu ancak kümeyle görülüyor.

Koşturmayı otomatik hâle getir. Elle koşturulan küme, üçüncü haftada koşturulmayan küme oluyor.

Sonuçları da yan yana göster. Hangi örnek önce geçiyordu şimdi düşüyor; asıl bilgi o karşılaştırmada.

Sonucu da kaydet. Sürüm, tarih, geçen sayı; üç satırlık bir kayıt bile eğilimi gösteriyor.

Eğilim önemli çünkü tek bir ölçüm bir şey söylemiyor. Beş sürüm boyunca düşen bir sayı, bir şeyin yanlış gittiğini söylüyor.

Çeşitlilikle hatayı ayır

Aynı girdiye iki farklı cevap gelmesi tek başına bir sorun değil.

Sorulacak soru şu: iki cevap da kabul ölçütünü geçiyor mu? Geçiyorsa çeşitlilik var, hata yok.

Biri geçip biri geçmiyorsa asıl sorun oradadır. Bu durumda çözüm modeli değiştirmek değil, görevi daraltmak oluyor.

Daraltmanın yolları belli: adımı böl, çıktı biçimini sabitle, seçenekleri sınırla, örneği isteme ekle.

Her daraltma da kümeyle sınanıyor. Daraltma bazen tutarlılığı artırırken kapsamı düşürüyor ve bu takas görülebilir olmalı.

Takası görmeden yapılan daraltmalar birikiyor. Altı ay sonra sistem çok tutarlı ama neredeyse hiçbir işe yaramıyor oluyor.

Belirsizlikte durmasını iste

Üretimdeki en pahalı hata yanlış cevap değil, emin görünen yanlış cevap.

Talimata bir madde koy: bilgi yoksa üretme, "bulunamadı" de ve dur. Bu maddeyi de kümeyle sına.

Kümeye özellikle cevabı olmayan örnekler koy. Ajan bunlarda ne yapıyor?

Durabilen ajan, üretimde çok daha az iş açıyor. Uyduran ajan ise her hatayı insana geç fark ettiriyor.

Durma davranışını ölçmek de kolay: kaç tanesinde doğru durdu, kaç tanesinde uydurdu?

Bu sayı çoğu ekipte hiç bakılmayan sayı. Bakıldığında da genellikle beklenenden kötü çıkıyor.

Üretimdeki her hatayı kümeye ekle

Küme donmuş bir dosya değil, büyüyen bir dosya.

Üretimde bir hata görüldüğünde iki iş yap: düzelt ve o girdiyi kümeye ekle. İkincisi yapılmadığında aynı hata altı ay sonra geri geliyor.

Bu alışkanlık kümeyi zamanla en değerli varlığına çeviriyor. Küme, sistemin bugüne kadar öğrendiği her şeyin kaydı oluyor.

Ekleme işini de kolaylaştır. Hata kaydından kümeye tek adımda taşınabiliyorsa yapılıyor; üç adım gerekiyorsa yapılmıyor.

Kümeyi büyütürken eskimiş örnekleri de temizle. Artık geçerli olmayan bir kural, yanlış bir başarısızlık üretiyor.

Temizlik de kayıtlı yapılsın. Neden çıkarıldığı yazılmayan bir örnek, altı ay sonra yeniden ekleniyor.

Günlük tut, sonucu değil yolu kaydet

Ajan bir adımda bozulduğunda nerede bozulduğunu bilmen gerekiyor.

Her koşunun adımlarını kaydet: hangi araç çağrıldı, hangi girdiyle, ne döndü? Yalnız son cevabı kaydeden günlük, hata ayıklamaya yetmiyor.

Kayıtta kişisel veri varsa maskeleme kuralını baştan koy. Sonradan eklenen maskeleme, geçmişteki kaydı temizlemiyor.

Günlükler ayrıca yeni sınama örneklerinin de kaynağı oluyor. Gerçek koşulardan seçilen girdi, uydurulmuş girdiden değerli.

Saklama süresini de yaz. Süresiz büyüyen günlük hem maliyet hem risk üretiyor.

Süre kararını da tek başına verme. Hangi verinin ne kadar saklanabileceği, kurumunda zaten cevabı olan bir soru olabiliyor.

Sonuç doğuran adıma onay koy

Tutarlılık ölçümü her hatayı engellemiyor. Bu yüzden geri alınamayan adımların önünde insan duruyor.

Mesaj gönderen, kayıt silen, ödeme başlatan ve dışarı çıkan adımlar bu sınıfa giriyor.

Ajan döngüsünü kurarken bu sınır zaten çiziliyor; üretimde en çok sınanan yer de burası.

Onay ekranını da bilgilendirici yap. Neyin onaylandığı görünmüyorsa onay bir düğmeye dönüşüyor.

Onay sayısını zamanla azaltabilirsin. Ama azaltma kararı ölçüme dayanmalı, alışkanlığa değil.

Ölçüt de hazır: o adımda kaç koşuda hata çıktı? Sıfır hatayla geçen iki yüz koşu, onayı kaldırmak için gerekçe olabiliyor.

Kim için

Kendi ajanını üretime almış ve tutarsızlıkla uğraşan geliştiriciler ve teknik liderler için.

Model karşılaştırması ya da kütüphane önerisi arayan için değil. Burada anlatılan şey, hangi modeli kullanırsan kullan geçerli kalan bir ölçüm alışkanlığı.

Henüz ajan kurmamış olanlar için de erken. Önce çalışan bir döngü, sonra ölçüm.

Bugün yapılacak tek şey

İstemi yeniden yazma.

Üretim günlüklerinden yirmi gerçek girdi seç ve bir dosyaya koy. Her birinin yanına beklenen çıktıyı kabul ölçütü olarak yaz.

Sonra bugünkü sürümü bu kümeyle koştur ve geçen sayıyı kaydet. O sayı, bundan sonraki her değişikliğin ölçüsü.

Nerede pratik yaparsın

ProgramAgentic AI Bootcamp

AI agent eğitimi, tek gün: ajan döngüsünü sıfırdan gör, tool tasarla, MCP bağla, ölç.

RotaAI-Native Builder rotası

Bu yazının konusu AI-Native Builder rotasının duraklarında gerçek bir görev olarak çalışılıyor.

Sık sorulanlar

Ajanın doğru çalıştığını nasıl ölçerim?

Yazılı bir sınama kümesiyle. Gerçek girdilerden yirmi örnek seç, her birine beklenen çıktıyı yaz ve her değişiklikten sonra hepsini koştur. His ile ölçüm, üçüncü değişiklikte kayboluyor.

Aynı girdiye farklı cevap veriyor, bu normal mi?

Bir dereceye kadar normal. Sorulacak soru çeşitliliğin zarar verip vermediği: kabul ölçütünü geçen iki farklı cevap sorun değil, ölçütü geçen ve geçmeyen iki cevap sorun.

Kaç örnek yeterli?

Sabit bir sayı yok. Yirmi örnekle başlamak çoğu işte yetiyor. Asıl kural şu: üretimde karşılaşılan her yeni hata, kümeye yeni bir örnek olarak giriyor.

Modeli değiştirince her şey bozuluyor, ne yapmalıyım?

Sınama kümesi olmadan model değiştirmek kör bir hamle. Küme varsa değişiklik bir karara dönüşüyor: hangi örnekler kazandı, hangileri kaybetti, net durum ne?

Yazar

Katıl

Bir yıl daha tek başına denemekle geçmesin

Üyelik sana üç şey veriyor: üzerinde çalışacağın gerçek bir görev, çıktına bakan insanlar ve tıkandığında soracak bir yer. Tek başına başladığın işi yanında insanlarla ilerletiyorsun.

Üyelikte ne var
  • Circle topluluğu ve üye alanları
  • Seçilmiş kendi hızında programlar
  • Komünite Space biletlerinde %50 indirim
  • Online etkinlikler ve yayınlar
  • 1.000+ saat kayıt arşivi
  • Oryantasyon
  • Ücretsiz etkinliklerde erken kayıt
  • Yazılım ve araç avantajları
  • Topluluk yöneticimizle ücretsiz 1-on-1’lar
Yıllık üyelik
3.600 ₺/ yıl

Yıllık tek ödeme · günde yaklaşık 10 ₺

  • Tek plan, tek fiyat
  • 12 ay boyunca geçerli
  • 9 maddenin tamamı dahil

Ödemeden sonra hesabını tek adımda kuruyorsun. Üyelik koşulları kullanıcı sözleşmesinde yer alır.

Zaten üyeyim ↳