Aynı ajan, sektörün alıştığı testte %82 alıyor. Gerçek profesyonel işlerden kurulmuş sınavın en zor kademesinde %0. Aradaki mesafe modelin zekâsıyla değil, işin kendisiyle ilgili.
arXiv bir ön-baskı arşividir, hakemli değildir; moderasyon yalnız kapsam ve biçim düzeyinde çalışır. Bu metnin bir konferans veya dergide kabul edildiğine dair kayıt bulunamadı. Ama basamağın aşağıda olması kaynağı zayıf yapmaz: arkasında Berkeley RDI, açık kod, açık liderlik tablosu ve 100'den fazla kurumdan 300'ü aşkın uygulayıcı var. Hakemliğin yokluğu "doğrulanmamış" demek değil; "kim doğruladı" sorusunun cevabı farklı demek.
“Recent AI systems have achieved strong results on a wide range of
benchmarks, yet these gains have not translated into economically meaningful deployment…
We argue that this gap is largely an evaluation problem.”
İlk basamak başka bir sınavdır (Terminal-Bench, ~100 terminal görevi) — aynı ölçek değil, karşılaştırma noktası. Sağdaki üç basamak aynı sınavın kademeleridir.
Bu çalışmayı aktaran ikinci el özetlerin çoğu manşeti "en zor kademede ortalama %2,6" diye veriyor. İki yerde yanlış. Birincisi: %2,6 ortalama değil, en iyi yapılandırmaların skoru — makalenin kendi özeti ortalamayı "%1'in altında" diye veriyor. İkincisi ve daha önemlisi: o kademe 38 görevden oluşuyor. 1 bölü 38 = %2,63. Yani yüzde bir oran değil, tek bir işin adı.
Bir satıcı size ajan başarı oranı söylediğinde tek soru yeter: kaç iş üzerinden ve o işler kimin işi? Yüzde, taban olmadan bir iddia değil bir izlenimdir.
Çalışma başarısız koşuların kök sebebini sınıflandırıyor ve sonuç yönetim açısından şaşırtıcı: hataların en büyük payı bilgi eksikliği değil yaklaşım — yanlış strateji, işi eksik bırakma. Halüsinasyon ise hataların yalnız küçük bir dilimi. Ajanın sorunu "cevabı bilmemek" değil, işi nasıl kuracağını bilmemek.
Ajanı güçlendirmek için daha büyük model aramak yerine işin adımlarını yazın. Hataların yarısı strateji katmanında; o katman sizde, modelde değil.
Alan bazlı skorlar geniş bir yelpazeye yayılıyor: kod komşusu alanlar yüksek, insan etkileşimi ağırlıklı alanlar dipte. Yazarların yorumu, eğitim verisindeki dengesizlik — kodla komşu alanlar araç kullanımı örneği bakımından kat kat daha zengin. Skorlar tek bir sayı olarak değil aralık olarak veriliyor; biz de öyle çiziyoruz.
Pilot seçerken "hangi departman hevesli" diye sormayın. İşin ajana yakın olup olmadığına bakın: çıktısı dosya olan, doğrusu makineyle kontrol edilebilen işler önce gelir.
Makale incelemesinin asıl işi bu ayrım: ölçülmüş olan ile iddia edilen ve yorumlanan aynı kefeye konmaz.
Kademe büyüklükleri (67 · 55 · 38 görev), tam geçiş oranları, alan bazlı skorlar, hata kök-sebep dağılımı, görev başına 3–10 dolar maliyet ve 5 saat koşu sınırı. Bunlar Tablo 1 ve Şekil 9'da açık; doğrulama deterministik ve rubrik tabanlı.
"55 SOC/O*NET sektörünün tamamını kapsayan ilk benchmark" — makalenin kendi iddiası, bağımsız doğrulaması yok. "Her görev uygulayıcının fiilen teslim ettiği işten geliyor" — sonuç bölümü böyle diyor, ama 1.490 örneğin 530'u komisyonlu ya da kurum içinde yazılmış. İkisi aynı anda tam doğru olamaz.
"Boşluk bir ölçüm problemidir" bir tez, bulgu değil. Aynı veri "ölçüm yanlış" yerine "ajanlar bu işleri gerçekten yapamıyor" diye de okunabilir — makale bu iki okumayı birbirinden ayıramıyor, çünkü ikisi de aynı düşük skoru üretir.
Katılmadığımız değil, kapatılmadığı noktalar.
Manşet oran %10'luk bir alt kümeden geliyor. Yayımlanan bütün sonuçlar 152 kamuya açık görev üzerinde ölçüldü; havuzun tamamı 1.490. Makale ekte alt kümenin temsil ettiğini savunuyor, ama "1.490 görevlik sınav" ile "ölçüm 152 görevde" aynı cümlede duruyor ve okuyucu ilkini hatırlıyor. Ayrıca 323 görev hâlâ doğrulanmamış, QC bekliyor.
Ölçen ile ölçülen aynı ekip. ALE ekibi hem sınavı kuruyor hem kendi ajan uygulamasını (ALE-Claw) tabloya koyuyor — ve ALE-Claw en zor kademede en iyi iki yapılandırmadan biri. Bulgu yanlış demiyoruz; bu yapı beyan edilmeli, çünkü sınavı yazan kişi sınava da giriyor.
Düşük skor iki farklı şeyin kanıtı olabilir. Ya ajanlar gerçekten yetersiz, ya da görevler ajanın çalışma biçimine uymayan araç/arayüz zincirleri gerektiriyor. Zaman aşımı oranı %3,8 ve arayüz kaynaklı hata %4 — küçük ama sıfır değil. Makale bu iki açıklamayı ayıracak bir deney kurmuyor.
Cevaplar "evet/hayır" değil: kaç iş üzerinden, kimin işi, nasıl kontrol edildi.
Elinizdeki başarı oranı kaç görev üzerinden ölçüldü — ve o görevleri kim yazdı?
O görevler sizin ekibinizin fiilen teslim ettiği işlerden mi geliyor, yoksa demo için mi kurgulandı?
Ajanın çıktısını makine mi kontrol ediyor, yoksa "iyi görünüyor" diyen bir insan mı?
Başarısız koşuların kök sebebini sınıflandırıyor musunuz — anlama mı, yaklaşım mı, icra mı?
Bir işi ajana vermeden önce tam bitmiş sayılma ölçütünü yazıyor musunuz? Yazılı ölçüt yoksa geçme oranı da yok.
Ajanı hangi işe koyacağınıza karar vermek için önce o işin geçme ölçütünü yazmak gerekir. AGENXY'de yaptığımız iş tam bu: işi adımlara bölmek, çıktının makineyle kontrol edilebilir tanımını kurmak, sonra ajana vermek.
Bir görüşme ayarla →Kaynak: Agents' Last Exam — Yiyou Sun, Xinyang Han, Weichen Zhang, Dawn Song ve 300'ü aşkın katkıcı. Lider kurum University of California, Berkeley (RDI). arXiv:2606.05405, v2 · 11 Haziran 2026 (v1: 3 Haziran). 40 sayfa. Tam metin ücretsiz ve açık — kayıt/form istemiyor, bu yüzden kapsam uyarısı yerine künye notu yeterli.
Ne kadar okundu: 40 sayfanın tamamı. Sayfadaki her sayı kaynak metne geri bağlandı; olgu→sayfa eşlemesi teslim paketindeki veri_notlari.md ve sayfa_haritasi.txt dosyalarında.
Yorum / olgu ayrımı: "Ölçülmüş olgu" bölümündeki her şey tablodan; "aktarılan" bölümü makalenin kendi iddiası; "yorum" bölümü hem yazarların hem bizim yorumumuz ve öyle işaretli. Türkiye'ye dair sayı üretilmedi — bu çalışma Türkiye'yi ölçmüyor; taksonomi ABD federal meslek sınıflandırmasına (SOC/O*NET 2018) dayanıyor ve yalnız fiziksel olmayan sektörleri kapsıyor.
Düzeltilen manşet: ikincil kaynakların "%2,6 ortalama" aktarımı hatalıdır. %2,6 en iyi yapılandırmaların skoru ve 38 görevden 1'ine karşılık gelir; makalenin kendi özeti ortalamayı %1'in altında veriyor.
Alıntı politikası: tezi belirleyen tek cümle özgün diliyle alıntılandı, kaynak ve yazar adıyla. Uzun alıntı yapılmadı. Kaynağın görselleri kullanılmadı — makale incelemesinde kapak üretilir (Şekil 1/5/9 yeniden çizilmedi; veriler kendi görsel dilimizde yeniden kuruldu).
Doğrulanmayanlar: makalenin "55 sektörün tamamını kapsayan ilk" iddiası ve görevlerin tamamının gerçek teslim edilmiş işten geldiği ifadesi bağımsız olarak doğrulanmadı — sayfada iddia olarak işaretli. Hakem durumu: kabul kaydı bulunamadı.
Podcast: makale incelemelerinde sesli bölüm üretilmez (format kartı).
Her hafta dünyada yayımlanan uzun bir raporu, makaleyi ya da videoyu okuyup üç sinyale ve bir karara indiriyoruz. Yeni incelemeler ilk olarak LinkedIn'de duyuruluyor — takip edin, kaçırmayın.