SSinyal
No. 004 — Makale
Berkeley · Agents' Last Exam · 55 sektör · 1.490 görev

Ajanlar sınava girdi.
En zor kademede 38 işten 1'ini bitirdiler.

Aynı ajan, sektörün alıştığı testte %82 alıyor. Gerçek profesyonel işlerden kurulmuş sınavın en zor kademesinde %0. Aradaki mesafe modelin zekâsıyla değil, işin kendisiyle ilgili.

Çağdaş Erekli · AGENXY · 4 dk okuma · 04.08.2026
No. 004 inceleme kapağı — Agents' Last Exam
İncelenen kaynak
Agents' Last Exam
Yiyou Sun, Dawn Song ve 300+ katkıcı · University of California, Berkeley (RDI)
arXiv:2606.05405 v2 · 11 Haziran 2026 · 40 sayfa · arxiv.org · tam metin açık
Bu kaynak hangi basamakta
1Hakemli yayın — konferans veya dergi kabulü var
2Hakemli ön-baskı — açık inceleme kaydı ya da kabul duyurusu var
3Ön-baskı, hakem kaydı yok — bu çalışma burada
4Kurumsal rapor — iç değerlendirme, çıkar beyanı gerekir
5Satıcı pazarlama araştırması

arXiv bir ön-baskı arşividir, hakemli değildir; moderasyon yalnız kapsam ve biçim düzeyinde çalışır. Bu metnin bir konferans veya dergide kabul edildiğine dair kayıt bulunamadı. Ama basamağın aşağıda olması kaynağı zayıf yapmaz: arkasında Berkeley RDI, açık kod, açık liderlik tablosu ve 100'den fazla kurumdan 300'ü aşkın uygulayıcı var. Hakemliğin yokluğu "doğrulanmamış" demek değil; "kim doğruladı" sorusunun cevabı farklı demek.

Yazarların tezi — kendi cümleleriyle
“Recent AI systems have achieved strong results on a wide range of benchmarks, yet these gains have not translated into economically meaningful deployment… We argue that this gap is largely an evaluation problem.”
Türkçesi: Ajanlar testleri geçiyor ama ekonomik olarak anlamlı bir yayılım olmuyor — ve yazarlara göre bunun asıl sebebi modellerin yetersizliği değil, yanlış şeyi ölçüyor olmamız. Bu bir tespit değil, açıkça bir iddia: makale "we argue" diyor.
38'de 1
En zor kademede en iyi yapılandırmanın bitirdiği iş sayısı. Yüzde değil, adet.
%0
Sektörün en güçlü kabul ettiği yapılandırmanın aynı kademedeki tam geçiş oranı. Sıfır.
13 / 55
16 büyük mevcut testin birleşimi bile 55 alt alanın 13'üne hiç dokunmuyor.
Aynı ajan, dört ölçüm
Codex + GPT-5.5 — tam geçiş oranı (%). Sektörün alıştığı testten gerçek işe doğru inildikçe düşüş.
82
Terminal-
Bench
37,2
ALE
Near-Term
19,0
ALE Full-
Spectrum
0,0
ALE
Last-Exam

İlk basamak başka bir sınavdır (Terminal-Bench, ~100 terminal görevi) — aynı ölçek değil, karşılaştırma noktası. Sağdaki üç basamak aynı sınavın kademeleridir.

Sinyal 01

"%2,6" diye dolaşan sayı, 38 işten 1 demek.

Bu çalışmayı aktaran ikinci el özetlerin çoğu manşeti "en zor kademede ortalama %2,6" diye veriyor. İki yerde yanlış. Birincisi: %2,6 ortalama değil, en iyi yapılandırmaların skoru — makalenin kendi özeti ortalamayı "%1'in altında" diye veriyor. İkincisi ve daha önemlisi: o kademe 38 görevden oluşuyor. 1 bölü 38 = %2,63. Yani yüzde bir oran değil, tek bir işin adı.

Last-Exam kademesi · 38 görevBitirilen: 1
Karar

Bir satıcı size ajan başarı oranı söylediğinde tek soru yeter: kaç iş üzerinden ve o işler kimin işi? Yüzde, taban olmadan bir iddia değil bir izlenimdir.

Sinyal 02

Ajan bilmediği için değil, yanlış yol seçtiği için başarısız oluyor.

Çalışma başarısız koşuların kök sebebini sınıflandırıyor ve sonuç yönetim açısından şaşırtıcı: hataların en büyük payı bilgi eksikliği değil yaklaşım — yanlış strateji, işi eksik bırakma. Halüsinasyon ise hataların yalnız küçük bir dilimi. Ajanın sorunu "cevabı bilmemek" değil, işi nasıl kuracağını bilmemek.

%31
%47
%22
AnlamaGörevi ya da alanı kavrayamama — alan bilgisi eksiği %25, halüsinasyon %6.
YaklaşımEn büyük pay. Yanlış strateji %30, işi eksik bırakma %17.
İcraYapabildiği hâlde beceremediği kısım: biçim hatası %10, uygulama hatası %8, arayüz %4.
Karar

Ajanı güçlendirmek için daha büyük model aramak yerine işin adımlarını yazın. Hataların yarısı strateji katmanında; o katman sizde, modelde değil.

Sinyal 03

Ajan her işte aynı değil — ve zayıf olduğu yerler tesadüf değil.

Alan bazlı skorlar geniş bir yelpazeye yayılıyor: kod komşusu alanlar yüksek, insan etkileşimi ağırlıklı alanlar dipte. Yazarların yorumu, eğitim verisindeki dengesizlik — kodla komşu alanlar araç kullanımı örneği bakımından kat kat daha zengin. Skorlar tek bir sayı olarak değil aralık olarak veriliyor; biz de öyle çiziyoruz.

Hesaplamalı matematik
tarım / çevre
%55–85
İş / yönetim
hukuk
%50–55
Eğitim
en düşük alan
%25 altı
050100
Karar

Pilot seçerken "hangi departman hevesli" diye sormayın. İşin ajana yakın olup olmadığına bakın: çıktısı dosya olan, doğrusu makineyle kontrol edilebilen işler önce gelir.

Neyi olgu sayıyoruz, neyi saymıyoruz

Makale incelemesinin asıl işi bu ayrım: ölçülmüş olan ile iddia edilen ve yorumlanan aynı kefeye konmaz.

Ölçülmüş olgutabloda var · yeniden üretilebilir

Kademe büyüklükleri (67 · 55 · 38 görev), tam geçiş oranları, alan bazlı skorlar, hata kök-sebep dağılımı, görev başına 3–10 dolar maliyet ve 5 saat koşu sınırı. Bunlar Tablo 1 ve Şekil 9'da açık; doğrulama deterministik ve rubrik tabanlı.

Aktarılan / iddiadoğrulanacak

"55 SOC/O*NET sektörünün tamamını kapsayan ilk benchmark" — makalenin kendi iddiası, bağımsız doğrulaması yok. "Her görev uygulayıcının fiilen teslim ettiği işten geliyor" — sonuç bölümü böyle diyor, ama 1.490 örneğin 530'u komisyonlu ya da kurum içinde yazılmış. İkisi aynı anda tam doğru olamaz.

Yorum / hipoteztartışmaya açık

"Boşluk bir ölçüm problemidir" bir tez, bulgu değil. Aynı veri "ölçüm yanlış" yerine "ajanlar bu işleri gerçekten yapamıyor" diye de okunabilir — makale bu iki okumayı birbirinden ayıramıyor, çünkü ikisi de aynı düşük skoru üretir.

Kapatılmamış üç yer

Katılmadığımız değil, kapatılmadığı noktalar.

01

Manşet oran %10'luk bir alt kümeden geliyor. Yayımlanan bütün sonuçlar 152 kamuya açık görev üzerinde ölçüldü; havuzun tamamı 1.490. Makale ekte alt kümenin temsil ettiğini savunuyor, ama "1.490 görevlik sınav" ile "ölçüm 152 görevde" aynı cümlede duruyor ve okuyucu ilkini hatırlıyor. Ayrıca 323 görev hâlâ doğrulanmamış, QC bekliyor.

02

Ölçen ile ölçülen aynı ekip. ALE ekibi hem sınavı kuruyor hem kendi ajan uygulamasını (ALE-Claw) tabloya koyuyor — ve ALE-Claw en zor kademede en iyi iki yapılandırmadan biri. Bulgu yanlış demiyoruz; bu yapı beyan edilmeli, çünkü sınavı yazan kişi sınava da giriyor.

03

Düşük skor iki farklı şeyin kanıtı olabilir. Ya ajanlar gerçekten yetersiz, ya da görevler ajanın çalışma biçimine uymayan araç/arayüz zincirleri gerektiriyor. Zaman aşımı oranı %3,8 ve arayüz kaynaklı hata %4 — küçük ama sıfır değil. Makale bu iki açıklamayı ayıracak bir deney kurmuyor.

Zorunlu blok

Çıkar ve metodoloji beyanı

  1. Çalışma Tianqiao & Chrissy Chen Institute, Snorkel AI ve UniPat AI tarafından finansal ve kredi desteğiyle fonlandı. Snorkel AI bir yapay zekâ veri ve değerlendirme şirketidir ve makaleyi kendi araştırma sayfasında da yayımlıyor. Değerlendirme altyapısı satan bir şirketin fonladığı bir değerlendirme çalışması.
  2. Danışma kurulu akademisyenlerin yanında şirket yöneticileri içeriyor.
  3. Tüm sonuçlar 152 kamuya açık görev üzerinde; 1.490'ın tamamında değil. Havuzun yalnız %10'u bilinçli olarak kamuya açık (bulaşma önlemi).
  4. Makale kendi içinde iki yerde tutarsız: uzman sayısı özet 250+ / sonuç 300+; kamuya açık görev sayısı metin 152 / Şekil 5 150.
  5. arXiv hakemli değildir; bu metnin kabul kaydı bulunamadı (yukarıdaki merdiven).
  6. Modeller hızla değişiyor: tablodaki yapılandırmalar Haziran 2026 sürümleridir. Aynı sınav bugün tekrarlansa sayılar değişir — bu oranlar tarihli verilerdir.

Sizin ajanınız hangi sınava giriyor? 5 soru

Cevaplar "evet/hayır" değil: kaç iş üzerinden, kimin işi, nasıl kontrol edildi.

01

Elinizdeki başarı oranı kaç görev üzerinden ölçüldü — ve o görevleri kim yazdı?

02

O görevler sizin ekibinizin fiilen teslim ettiği işlerden mi geliyor, yoksa demo için mi kurgulandı?

03

Ajanın çıktısını makine mi kontrol ediyor, yoksa "iyi görünüyor" diyen bir insan mı?

04

Başarısız koşuların kök sebebini sınıflandırıyor musunuz — anlama mı, yaklaşım mı, icra mı?

05

Bir işi ajana vermeden önce tam bitmiş sayılma ölçütünü yazıyor musunuz? Yazılı ölçüt yoksa geçme oranı da yok.

Üçünden fazlasına net cevabınız yoksa elinizde ajan performansı ölçümü değil, bir izlenim var. Bu çalışmanın asıl mesajı da bu: fark ajanın zekâsında değil, işin nasıl tanımlandığında.

Kendi işinizin sınavını kuralım.

Ajanı hangi işe koyacağınıza karar vermek için önce o işin geçme ölçütünü yazmak gerekir. AGENXY'de yaptığımız iş tam bu: işi adımlara bölmek, çıktının makineyle kontrol edilebilir tanımını kurmak, sonra ajana vermek.

Bir görüşme ayarla →
Künye, yöntem ve doğrulama notları

Kaynak: Agents' Last Exam — Yiyou Sun, Xinyang Han, Weichen Zhang, Dawn Song ve 300'ü aşkın katkıcı. Lider kurum University of California, Berkeley (RDI). arXiv:2606.05405, v2 · 11 Haziran 2026 (v1: 3 Haziran). 40 sayfa. Tam metin ücretsiz ve açık — kayıt/form istemiyor, bu yüzden kapsam uyarısı yerine künye notu yeterli.

Ne kadar okundu: 40 sayfanın tamamı. Sayfadaki her sayı kaynak metne geri bağlandı; olgu→sayfa eşlemesi teslim paketindeki veri_notlari.md ve sayfa_haritasi.txt dosyalarında.

Yorum / olgu ayrımı: "Ölçülmüş olgu" bölümündeki her şey tablodan; "aktarılan" bölümü makalenin kendi iddiası; "yorum" bölümü hem yazarların hem bizim yorumumuz ve öyle işaretli. Türkiye'ye dair sayı üretilmedi — bu çalışma Türkiye'yi ölçmüyor; taksonomi ABD federal meslek sınıflandırmasına (SOC/O*NET 2018) dayanıyor ve yalnız fiziksel olmayan sektörleri kapsıyor.

Düzeltilen manşet: ikincil kaynakların "%2,6 ortalama" aktarımı hatalıdır. %2,6 en iyi yapılandırmaların skoru ve 38 görevden 1'ine karşılık gelir; makalenin kendi özeti ortalamayı %1'in altında veriyor.

Alıntı politikası: tezi belirleyen tek cümle özgün diliyle alıntılandı, kaynak ve yazar adıyla. Uzun alıntı yapılmadı. Kaynağın görselleri kullanılmadı — makale incelemesinde kapak üretilir (Şekil 1/5/9 yeniden çizilmedi; veriler kendi görsel dilimizde yeniden kuruldu).

Doğrulanmayanlar: makalenin "55 sektörün tamamını kapsayan ilk" iddiası ve görevlerin tamamının gerçek teslim edilmiş işten geldiği ifadesi bağımsız olarak doğrulanmadı — sayfada iddia olarak işaretli. Hakem durumu: kabul kaydı bulunamadı.

Podcast: makale incelemelerinde sesli bölüm üretilmez (format kartı).

Haftalık inceleme serisi

Yeni bölüm çıktığında haberdar olun.

Her hafta dünyada yayımlanan uzun bir raporu, makaleyi ya da videoyu okuyup üç sinyale ve bir karara indiriyoruz. Yeni incelemeler ilk olarak LinkedIn'de duyuruluyor — takip edin, kaçırmayın.

AGENXY · getagenxy.com — Uzun raporları, makaleleri ve videoları üç sinyale ve bir karara indiriyoruz.