Aynı ajan, sektörün alıştığı testte %82 alıyor. Gerçek profesyonel işlerden kurulmuş sınavın en zor kademesinde %0. Aradaki mesafe modelin zekâsıyla değil, işin kendisiyle ilgili.
Agents' Last Exam
Hazırlayan Berkeley RDI — California Üniversitesi'nin (Berkeley) merkezi. Sorumlu yazarlar Yiyou Sun ve Dawn Song; makalenin katkı listesinde 88 kurum ve 300'ü aşkın uygulayıcı görev yazarak katkı verdi. Yapılan iş bir anket değil, bir sınav: 55 dijital sektörden gerçek profesyonel işler toplanıp yapay zekâ ajanlarına verildi ve kaç tanesini bitirebildikleri ölçüldü.
Bugün yapay zekâ ajanları için kullanılan testler çoğunlukla yazılım işlerinden kurulu ve ajanlar onlarda yüksek not alıyor. Berkeley ekibi şunu sordu: aynı ajanı gerçek meslek sahiplerinin fiilen yaptığı işlerin önüne koyarsak ne olur? 55 sektörden iş topladılar, üç zorluk kademesine ayırdılar ve ajanları soktular.
Sonuç şu: aynı ajan sektörün alıştığı testte %82 alırken, en zor kademede sıfıra yakın kalıyor. Bu incelemede o düşüşün nereden geldiğini, en çok dolaşan sayının (%2,6) neden yanlış aktarıldığını ve ajanın hangi işte çalışıp hangisinde çalışmadığını çıkardım.
benchmarkÖlçüt sınavı: aynı görevleri farklı sistemlere
verip karşılaştırma imkânı veren standart test takımı.tam geçişGörevin tamamen bitmiş sayılması.
Kısmen doğru yapılan iş bu ölçümde sıfır sayılır — sınav "yaklaştı" demiyor.yapılandırmaAjanı çalıştıran takım: model + ona verilen
araçlar + iş akışı. Aynı model, farklı yapılandırmada farklı skor alır.ön-baskıHakem incelemesinden geçmeden yayımlanan
akademik metin. arXiv bir ön-baskı arşividir — aşağıdaki merdivene bakın.arXiv bir ön-baskı arşividir, hakemli değildir; moderasyon yalnız kapsam ve biçim düzeyinde çalışır. Bu metnin bir konferans veya dergide kabul edildiğine dair kayıt bulunamadı. Ama basamağın aşağıda olması kaynağı zayıf yapmaz: arkasında Berkeley RDI, açık kod, açık liderlik tablosu ve 100'den fazla kurumdan 300'ü aşkın uygulayıcı var. Hakemliğin yokluğu "doğrulanmamış" demek değil; "kim doğruladı" sorusunun cevabı farklı demek.
“Recent AI systems have achieved strong results on a wide range of
benchmarks, yet these gains have not translated into economically meaningful deployment…
We argue that this gap is largely an evaluation problem.”
İlk basamak başka bir sınavdır (Terminal-Bench, yaklaşık 100 terminal görevi) — aynı ölçek değil, karşılaştırma noktası. Sağdaki üç basamak ALE-CLI kademeleridir — sınavın 105 görevlik, yalnız komut satırı alt kümesi; Terminal-Bench ile karşılaştırılabilen tek kısmı bu. Tam ALE’de aynı yapılandırma 38,1 · 22,7 · 0,0 alıyor (Tablo 1, s.8).
Bu çalışmayı aktaran ikinci el özetlerin çoğu manşeti "en zor kademede ortalama %2,6" diye veriyor. İki yerde yanlış. Birincisi: %2,6 ortalama değil, en iyi yapılandırmaların skoru — makalenin kendi özeti ortalamayı "%1'in altında" diye veriyor. İkincisi ve daha önemlisi: o kademe 38 görevden oluşuyor. 1 bölü 38 = %2,63. Yani yüzde bir oran değil, tek bir işin adı.
Bir satıcı size ajan başarı oranı söylediğinde tek soru yeter: kaç iş üzerinden ve o işler kimin işi? Yüzde, taban olmadan bir iddia değil bir izlenimdir. Teklifin ekine "ölçüm tabanı" satırı koymayan sağlayıcıyla fiyat konuşmayın.
Bu bir okuma becerisi ve bugün çok kıt: gördüğünüz her yapay zekâ yüzdesinde "kaçın kaçı" sorusunu sorun. Buradaki %2,6 aslında 38 işten 1 demek — aynı sayı bir yerde etkileyici, diğerinde yıkıcı görünüyor. Sayının altındaki tabanı bulabilen kişi, toplantıda kimsenin göremediğini görür.
Çalışma başarısız koşuların kök sebebini sınıflandırıyor ve sonuç yönetim açısından şaşırtıcı: hataların en büyük payı bilgi eksikliği değil yaklaşım — yanlış strateji, işi eksik bırakma. Halüsinasyon ise hataların yalnız küçük bir dilimi. Ajanın sorunu "cevabı bilmemek" değil, işi nasıl kuracağını bilmemek.
Ajanı güçlendirmek için daha büyük model aramak yerine işin adımlarını yazın. Hataların yarısı strateji katmanında; o katman sizde, modelde değil. Yani bu bir satın alma kalemi değil, bir yazma işi.
Buradan çıkan beceri tanımı net: aranan şey "iyi soru yazmak" değil, işi adımlara bölmek. Hataların en büyük dilimi (%47) yanlış yol seçmek ve işi yarım bırakmak — ikisi de bir insanın yazılı iş akışıyla kapatabileceği şeyler. Kendi işinizden bir süreci alıp adım adım, bitmiş sayılma ölçütüyle yazmak, öğrenilebilecek en somut ajan becerisidir.
Alan bazlı skorlar geniş bir yelpazeye yayılıyor: kod komşusu alanlar yüksek, insan etkileşimi ağırlıklı alanlar dipte. Yazarların yorumu, eğitim verisindeki dengesizlik — kodla komşu alanlar araç kullanımı örneği bakımından kat kat daha zengin. Skorlar tek bir sayı olarak değil aralık olarak veriliyor; biz de öyle çiziyoruz.
Pilot seçerken "hangi departman hevesli" diye sormayın. İşin ajana yakın olup olmadığına bakın: çıktısı dosya olan, doğrusu makineyle kontrol edilebilen işler önce gelir. Heves sıralaması pilot batırır; işin biçimi batırmaz.
Aynı tablo tersinden de okunur: ajanın en zayıf olduğu alanlar insan etkileşimi ağırlıklı olanlar — eğitim en dipte (%25 altı). Yani işiniz insanla kurulan bir işse yerinize geçilmesi en zor işlerden birini yapıyorsunuz. Doğru hamle savunma değil birleştirme: işinizin dosya üreten kısmını ajana verip insanla geçen kısmına yer açmak.
Makale incelemesinin asıl işi bu ayrım: ölçülmüş olan ile iddia edilen ve yorumlanan aynı kefeye konmaz.
Kademe büyüklükleri (67 · 55 · 38 görev), tam geçiş oranları, alan bazlı skorlar, hata kök-sebep dağılımı, görev başına 3–10 dolar maliyet ve 5 saat koşu sınırı. Bunlar Tablo 1 ve Şekil 9'da açık; doğrulama deterministik ve rubrik tabanlı.
"55 SOC/O*NET sektörünün tamamını kapsayan ilk benchmark" — makalenin kendi iddiası, bağımsız doğrulaması yok. "Her görev uygulayıcının fiilen teslim ettiği işten geliyor" — sonuç bölümü böyle diyor, ama 1.490 örneğin 530'u komisyonlu ya da kurum içinde yazılmış. İkisi aynı anda tam doğru olamaz.
"Boşluk bir ölçüm problemidir" bir tez, bulgu değil. Aynı veri "ölçüm yanlış" yerine "ajanlar bu işleri gerçekten yapamıyor" diye de okunabilir — makale bu iki okumayı birbirinden ayıramıyor, çünkü ikisi de aynı düşük skoru üretir.
Katılmadığımız değil, kapatılmadığı noktalar.
Manşet oran %10'luk bir alt kümeden geliyor. Yayımlanan bütün sonuçlar 152 kamuya açık görev üzerinde ölçüldü; havuzun tamamı 1.490. Makale ekte alt kümenin temsil ettiğini savunuyor, ama "1.490 görevlik sınav" ile "ölçüm 152 görevde" aynı cümlede duruyor ve okuyucu ilkini hatırlıyor. Ayrıca 323 görev hâlâ doğrulanmamış, QC bekliyor.
Ölçen ile ölçülen aynı ekip. ALE ekibi hem sınavı kuruyor hem kendi ajan uygulamasını (ALE-Claw) tabloya koyuyor — ve ALE-Claw en zor kademede tepedeki yapılandırmalardan biri: tam geçişte dört yapılandırmayla başa baş (%2,6), ortalama skorda birinci. Bulgu yanlış demiyoruz; bu yapı beyan edilmeli, çünkü sınavı yazan kişi sınava da giriyor.
Düşük skor iki farklı şeyin kanıtı olabilir. Ya ajanlar gerçekten yetersiz, ya da görevler ajanın çalışma biçimine uymayan araç/arayüz zincirleri gerektiriyor. Zaman aşımı oranı %3,8 ve arayüz kaynaklı hata %4 — küçük ama sıfır değil. Makale bu iki açıklamayı ayıracak bir deney kurmuyor.
Üç sinyal bu incelemenin sabit biçimi: uzun bir kaynağı taşınabilir hâle getiren şey sınırın kendisi. Ama 40 sayfada manşet olmayan güçlü bulgular kalıyor — onları atmak yerine sayfa numarasıyla buraya düşüyorum.
Ajan çalıştırmak bedava değil. Tek bir görevin tek denemesi 3–10 dolar ve onlarca dakika ile saatler arası sürüyor. Bir yapılandırmanın üç kademeyi bitirmesi örneğinde fatura yaklaşık 2.400 dolar ve 213 saat. "Ajan ucuz işçi" varsayımı bu tabloda karşılığını bulmuyor — ölçek büyüdükçe maliyet kalemi ciddileşiyor. s.8–9, s.37
Sınavın kendisi beş kapıdan geçirilmiş. Her görev şu zinciri geçiyor: uzman kaynağı › gönderim portalı › konferans tipi ilk inceleme › uygulama + mühendis kuru koşusu › uzman komitesinde son kalite kontrolü. Bu, hakemli olmayan bir çalışmanın neden yine de ciddiye alınabildiğini açıklıyor: hakemlik yok ama süreç var. s.5
Rakip sınavlar da tam kapsamıyor. En yakın çağdaşları olan GDPval ve RLI, 55 sektörün yalnız 16'sını ve 14'ünü kapsıyor — yani 39 ve 41 sektöre hiç dokunmuyor; ayrıca ikisi de pahalı insan değerlendirmesine bağlı. Bu çalışmanın gerçek yeniliği kapsam kadar otomatik ve tekrarlanabilir doğrulama. s.10
Aracı değiştirmek sonucu değiştiriyor. Süre aşımından kaybedilen koşu oranı genelde %3,8 — ama hafif bir kurulumda yüzde 1 civarı, başka bir kurulumda %5,7. Yani "ajan yapamadı" dediğiniz vakaların bir kısmı ajanın değil kurulumun başarısızlığı. s.9
Görevlerin çoğu bilerek gizli tutuluyor. 1.490 görevin yalnız %10'u kamuya açık; gerisi özel havuzda ve dönüşümlü rotasyonla kullanılıyor. Sebep bulaşma: soru internete düşerse modeller onu ezberleyebilir ve sınav ölçmeyi bırakır. İyi bir metodoloji tercihi — ama aynı tercih yayımlanan oranların neden küçük bir alt kümeden geldiğini de açıklıyor. s.5
Model karşılaştırma tablosu bilinçli kullanılmadı. Çalışmada 11 farklı modelin tam tablosu var. Bu incelemeye alınmadı: "hangi model iyi" listesi bir ayda eskiyor ve tartışmayı ajan mühendisliğinden uzaklaştırıyor. Bu incelemenin ölçütü şu — altı ay sonra hâlâ doğru olacak şeyi yaz. kapsam kararı
Bu listede Türkiye'ye dair hiçbir sayı yok. Çalışma Türkiye'yi ölçmüyor; meslek taksonomisi ABD federal sınıflandırmasına (SOC/O*NET 2018) dayanıyor ve yalnız fiziksel olmayan sektörleri kapsıyor.
Cevaplar "evet/hayır" değil: kaç iş üzerinden, kimin işi, nasıl kontrol edildi.
Elinizdeki başarı oranı kaç görev üzerinden ölçüldü — ve o görevleri kim yazdı?
O görevler sizin ekibinizin fiilen teslim ettiği işlerden mi geliyor, yoksa demo için mi kurgulandı?
Ajanın çıktısını makine mi kontrol ediyor, yoksa "iyi görünüyor" diyen bir insan mı?
Başarısız koşuların kök sebebini sınıflandırıyor musunuz — anlama mı, yaklaşım mı, icra mı?
Bir işi ajana vermeden önce tam bitmiş sayılma ölçütünü yazıyor musunuz? Yazılı ölçüt yoksa geçme oranı da yok.
Ajanı hangi işe koyacağınıza karar vermek için önce o işin geçme ölçütünü yazmak gerekir. AGENXY'de yaptığımız iş tam bu: işi adımlara bölmek, çıktının makineyle kontrol edilebilir tanımını kurmak, sonra ajana vermek.
Bir görüşme ayarlaRakamları kullandım, ama şu altı kalem olmadan kullanılamazlar. Hepsi metnin içinde yazılı — gizlenmiş değil, sadece kimse alıntılamıyor.
Kaynak: Agents' Last Exam — Yiyou Sun, Xinyang Han, Weichen Zhang, Dawn Song ve 300'ü aşkın katkıcı. Lider kurum University of California, Berkeley (RDI). arXiv:2606.05405, v2 · 11 Haziran 2026 (v1: 3 Haziran). 40 sayfa. Tam metin ücretsiz ve açık — kayıt/form istemiyor, bu yüzden kapsam uyarısı yerine künye notu yeterli.
Ne kadar okundu: 40 sayfanın tamamı. Sayfadaki her sayı kaynak metne geri bağlandı; olgusayfa eşlemesi teslim paketindeki veri_notlari.md ve sayfa_haritasi.txt dosyalarında.
Yorum / olgu ayrımı: "Ölçülmüş olgu" bölümündeki her şey tablodan; "aktarılan" bölümü makalenin kendi iddiası; "yorum" bölümü hem yazarların hem bizim yorumumuz ve öyle işaretli. Türkiye'ye dair sayı üretilmedi — bu çalışma Türkiye'yi ölçmüyor; taksonomi ABD federal meslek sınıflandırmasına (SOC/O*NET 2018) dayanıyor ve yalnız fiziksel olmayan sektörleri kapsıyor.
Düzeltilen manşet: ikincil kaynakların "%2,6 ortalama" aktarımı hatalıdır. %2,6 en iyi yapılandırmaların skoru ve 38 görevden 1'ine karşılık gelir; makalenin kendi özeti ortalamayı %1'in altında veriyor.
Alıntı politikası: tezi belirleyen tek cümle özgün diliyle alıntılandı, kaynak ve yazar adıyla. Uzun alıntı yapılmadı. Kaynağın görselleri kullanılmadı — makale incelemesinde kapak üretilir (Şekil 1/5/9 yeniden çizilmedi; veriler kendi görsel dilimizde yeniden kuruldu).
Doğrulanmayanlar: makalenin "55 sektörün tamamını kapsayan ilk" iddiası ve görevlerin tamamının gerçek teslim edilmiş işten geldiği ifadesi bağımsız olarak doğrulanmadı — sayfada iddia olarak işaretli. Hakem durumu: kabul kaydı bulunamadı.
Podcast: makale incelemelerinde sesli bölüm üretilmez (format kartı).