SSinyal
No. 004 — Makale getagenxy.com
Berkeley · Agents' Last Exam · 55 sektör · 1.490 görev

Ajanlar sınava girdi.
En zor kademede 38 işten 1'ini bitirdiler.

Aynı ajan, sektörün alıştığı testte %82 alıyor. Gerçek profesyonel işlerden kurulmuş sınavın en zor kademesinde %0. Aradaki mesafe modelin zekâsıyla değil, işin kendisiyle ilgili.

Çağdaş Erekli · AGENXY · 7 dk okuma · 04.08.2026
Künye — incelenen kaynak No. 004 · makale incelemesi
No. 004 inceleme kapağı — Agents' Last Exam
Kapak: AGENXY
üretimi

Agents' Last Exam

Hazırlayan Berkeley RDI — California Üniversitesi'nin (Berkeley) merkezi. Sorumlu yazarlar Yiyou Sun ve Dawn Song; makalenin katkı listesinde 88 kurum ve 300'ü aşkın uygulayıcı görev yazarak katkı verdi. Yapılan iş bir anket değil, bir sınav: 55 dijital sektörden gerçek profesyonel işler toplanıp yapay zekâ ajanlarına verildi ve kaç tanesini bitirebildikleri ölçüldü.

Yayım tarihi11 Haziran 2026 arXiv v2 · ilk sürüm 3 Haziran
Ölçek1.490 görev 55 sektör · 960 uzman-yazımı iş akışı
Kimin işiUygulayıcılar Ama 530 örnek kurum içinde yazıldı — bkz. beyan
Bu inceleme7 dakika okuma Yayın 4 Ağustos 2026 · Çağdaş Erekli
Çalışmanın aslıarxiv.org 40 sayfa · ücretsiz, form yok · yeni sekmede açılır
Bu çalışma ne anlatıyor

Bugün yapay zekâ ajanları için kullanılan testler çoğunlukla yazılım işlerinden kurulu ve ajanlar onlarda yüksek not alıyor. Berkeley ekibi şunu sordu: aynı ajanı gerçek meslek sahiplerinin fiilen yaptığı işlerin önüne koyarsak ne olur? 55 sektörden iş topladılar, üç zorluk kademesine ayırdılar ve ajanları soktular.

Sonuç şu: aynı ajan sektörün alıştığı testte %82 alırken, en zor kademede sıfıra yakın kalıyor. Bu incelemede o düşüşün nereden geldiğini, en çok dolaşan sayının (%2,6) neden yanlış aktarıldığını ve ajanın hangi işte çalışıp hangisinde çalışmadığını çıkardım.

benchmarkÖlçüt sınavı: aynı görevleri farklı sistemlere verip karşılaştırma imkânı veren standart test takımı.
tam geçişGörevin tamamen bitmiş sayılması. Kısmen doğru yapılan iş bu ölçümde sıfır sayılır — sınav "yaklaştı" demiyor.
yapılandırmaAjanı çalıştıran takım: model + ona verilen araçlar + iş akışı. Aynı model, farklı yapılandırmada farklı skor alır.
ön-baskıHakem incelemesinden geçmeden yayımlanan akademik metin. arXiv bir ön-baskı arşividir — aşağıdaki merdivene bakın.
Bu kaynak hangi basamakta
1Hakemli yayın — konferans veya dergi kabulü var
2Hakemli ön-baskı — açık inceleme kaydı ya da kabul duyurusu var
3Ön-baskı, hakem kaydı yok — bu çalışma burada
4Kurumsal rapor — iç değerlendirme, çıkar beyanı gerekir
5Satıcı pazarlama araştırması

arXiv bir ön-baskı arşividir, hakemli değildir; moderasyon yalnız kapsam ve biçim düzeyinde çalışır. Bu metnin bir konferans veya dergide kabul edildiğine dair kayıt bulunamadı. Ama basamağın aşağıda olması kaynağı zayıf yapmaz: arkasında Berkeley RDI, açık kod, açık liderlik tablosu ve 100'den fazla kurumdan 300'ü aşkın uygulayıcı var. Hakemliğin yokluğu "doğrulanmamış" demek değil; "kim doğruladı" sorusunun cevabı farklı demek.

Yazarların tezi — kendi cümleleriyle
“Recent AI systems have achieved strong results on a wide range of benchmarks, yet these gains have not translated into economically meaningful deployment… We argue that this gap is largely an evaluation problem.”
Türkçesi: Ajanlar testleri geçiyor ama ekonomik olarak anlamlı bir yayılım olmuyor — ve yazarlara göre bunun asıl sebebi modellerin yetersizliği değil, yanlış şeyi ölçüyor olmamız. Bu bir tespit değil, açıkça bir iddia: makale "we argue" diyor.
38'de 1
En zor kademede en iyi yapılandırmanın bitirdiği iş sayısı. Yüzde değil, adet.
%0
Sektörün en güçlü kabul ettiği yapılandırmanın aynı kademedeki tam geçiş oranı. Sıfır.
13 / 55
16 büyük mevcut testin birleşimi bile 55 alt alanın 13'üne hiç dokunmuyor.
Aynı ajan, dört ölçüm
Codex + GPT-5.5 — tam geçiş oranı (%). Sektörün alıştığı testten gerçek işe doğru inildikçe düşüş.
82
Terminal-
Bench
37,2
ALE-CLI
Near-Term
19,0
ALE-CLI Full-
Spectrum
0,0
ALE-CLI
Last-Exam

İlk basamak başka bir sınavdır (Terminal-Bench, yaklaşık 100 terminal görevi) — aynı ölçek değil, karşılaştırma noktası. Sağdaki üç basamak ALE-CLI kademeleridir — sınavın 105 görevlik, yalnız komut satırı alt kümesi; Terminal-Bench ile karşılaştırılabilen tek kısmı bu. Tam ALE’de aynı yapılandırma 38,1 · 22,7 · 0,0 alıyor (Tablo 1, s.8).

Sinyal01

"%2,6" diye dolaşan sayı, 38 işten 1 demek.

Bu çalışmayı aktaran ikinci el özetlerin çoğu manşeti "en zor kademede ortalama %2,6" diye veriyor. İki yerde yanlış. Birincisi: %2,6 ortalama değil, en iyi yapılandırmaların skoru — makalenin kendi özeti ortalamayı "%1'in altında" diye veriyor. İkincisi ve daha önemlisi: o kademe 38 görevden oluşuyor. 1 bölü 38 = %2,63. Yani yüzde bir oran değil, tek bir işin adı.

Last-Exam kademesi · 38 görevBitirilen: 1
Öneri
Kuruma

Bir satıcı size ajan başarı oranı söylediğinde tek soru yeter: kaç iş üzerinden ve o işler kimin işi? Yüzde, taban olmadan bir iddia değil bir izlenimdir. Teklifin ekine "ölçüm tabanı" satırı koymayan sağlayıcıyla fiyat konuşmayın.

Bireye

Bu bir okuma becerisi ve bugün çok kıt: gördüğünüz her yapay zekâ yüzdesinde "kaçın kaçı" sorusunu sorun. Buradaki %2,6 aslında 38 işten 1 demek — aynı sayı bir yerde etkileyici, diğerinde yıkıcı görünüyor. Sayının altındaki tabanı bulabilen kişi, toplantıda kimsenin göremediğini görür.

Sinyal02

Ajan bilmediği için değil, yanlış yol seçtiği için başarısız oluyor.

Çalışma başarısız koşuların kök sebebini sınıflandırıyor ve sonuç yönetim açısından şaşırtıcı: hataların en büyük payı bilgi eksikliği değil yaklaşım — yanlış strateji, işi eksik bırakma. Halüsinasyon ise hataların yalnız küçük bir dilimi. Ajanın sorunu "cevabı bilmemek" değil, işi nasıl kuracağını bilmemek.

%31
%47
%22
AnlamaGörevi ya da alanı kavrayamama — alan bilgisi eksiği %25, halüsinasyon %6.
YaklaşımEn büyük pay. Yanlış strateji %30, işi eksik bırakma %17.
İcraYapabildiği hâlde beceremediği kısım: biçim hatası %10, uygulama hatası %8, arayüz %4.
Öneri
Kuruma

Ajanı güçlendirmek için daha büyük model aramak yerine işin adımlarını yazın. Hataların yarısı strateji katmanında; o katman sizde, modelde değil. Yani bu bir satın alma kalemi değil, bir yazma işi.

Bireye

Buradan çıkan beceri tanımı net: aranan şey "iyi soru yazmak" değil, işi adımlara bölmek. Hataların en büyük dilimi (%47) yanlış yol seçmek ve işi yarım bırakmak — ikisi de bir insanın yazılı iş akışıyla kapatabileceği şeyler. Kendi işinizden bir süreci alıp adım adım, bitmiş sayılma ölçütüyle yazmak, öğrenilebilecek en somut ajan becerisidir.

Sinyal03

Ajan her işte aynı değil — ve zayıf olduğu yerler tesadüf değil.

Alan bazlı skorlar geniş bir yelpazeye yayılıyor: kod komşusu alanlar yüksek, insan etkileşimi ağırlıklı alanlar dipte. Yazarların yorumu, eğitim verisindeki dengesizlik — kodla komşu alanlar araç kullanımı örneği bakımından kat kat daha zengin. Skorlar tek bir sayı olarak değil aralık olarak veriliyor; biz de öyle çiziyoruz.

Hesaplamalı matematik
tarım / çevre
%55–85
İş / yönetim
hukuk
%50–55
Eğitim
en düşük alan
%25 altı
050100
Öneri
Kuruma

Pilot seçerken "hangi departman hevesli" diye sormayın. İşin ajana yakın olup olmadığına bakın: çıktısı dosya olan, doğrusu makineyle kontrol edilebilen işler önce gelir. Heves sıralaması pilot batırır; işin biçimi batırmaz.

Bireye

Aynı tablo tersinden de okunur: ajanın en zayıf olduğu alanlar insan etkileşimi ağırlıklı olanlar — eğitim en dipte (%25 altı). Yani işiniz insanla kurulan bir işse yerinize geçilmesi en zor işlerden birini yapıyorsunuz. Doğru hamle savunma değil birleştirme: işinizin dosya üreten kısmını ajana verip insanla geçen kısmına yer açmak.

Neyi olgu sayıyoruz, neyi saymıyoruz

Makale incelemesinin asıl işi bu ayrım: ölçülmüş olan ile iddia edilen ve yorumlanan aynı kefeye konmaz.

Ölçülmüş olgutabloda var · yeniden üretilebilir

Kademe büyüklükleri (67 · 55 · 38 görev), tam geçiş oranları, alan bazlı skorlar, hata kök-sebep dağılımı, görev başına 3–10 dolar maliyet ve 5 saat koşu sınırı. Bunlar Tablo 1 ve Şekil 9'da açık; doğrulama deterministik ve rubrik tabanlı.

Aktarılan / iddiadoğrulanacak

"55 SOC/O*NET sektörünün tamamını kapsayan ilk benchmark" — makalenin kendi iddiası, bağımsız doğrulaması yok. "Her görev uygulayıcının fiilen teslim ettiği işten geliyor" — sonuç bölümü böyle diyor, ama 1.490 örneğin 530'u komisyonlu ya da kurum içinde yazılmış. İkisi aynı anda tam doğru olamaz.

Yorum / hipoteztartışmaya açık

"Boşluk bir ölçüm problemidir" bir tez, bulgu değil. Aynı veri "ölçüm yanlış" yerine "ajanlar bu işleri gerçekten yapamıyor" diye de okunabilir — makale bu iki okumayı birbirinden ayıramıyor, çünkü ikisi de aynı düşük skoru üretir.

Kapatılmamış üç yer

Katılmadığımız değil, kapatılmadığı noktalar.

01

Manşet oran %10'luk bir alt kümeden geliyor. Yayımlanan bütün sonuçlar 152 kamuya açık görev üzerinde ölçüldü; havuzun tamamı 1.490. Makale ekte alt kümenin temsil ettiğini savunuyor, ama "1.490 görevlik sınav" ile "ölçüm 152 görevde" aynı cümlede duruyor ve okuyucu ilkini hatırlıyor. Ayrıca 323 görev hâlâ doğrulanmamış, QC bekliyor.

02

Ölçen ile ölçülen aynı ekip. ALE ekibi hem sınavı kuruyor hem kendi ajan uygulamasını (ALE-Claw) tabloya koyuyor — ve ALE-Claw en zor kademede tepedeki yapılandırmalardan biri: tam geçişte dört yapılandırmayla başa baş (%2,6), ortalama skorda birinci. Bulgu yanlış demiyoruz; bu yapı beyan edilmeli, çünkü sınavı yazan kişi sınava da giriyor.

03

Düşük skor iki farklı şeyin kanıtı olabilir. Ya ajanlar gerçekten yetersiz, ya da görevler ajanın çalışma biçimine uymayan araç/arayüz zincirleri gerektiriyor. Zaman aşımı oranı %3,8 ve arayüz kaynaklı hata %4 — küçük ama sıfır değil. Makale bu iki açıklamayı ayıracak bir deney kurmuyor.

Çalışmadan not düşülenler — manşet olmayan bulgular 6 kalem · sayfa referanslı

Üç sinyal bu incelemenin sabit biçimi: uzun bir kaynağı taşınabilir hâle getiren şey sınırın kendisi. Ama 40 sayfada manşet olmayan güçlü bulgular kalıyor — onları atmak yerine sayfa numarasıyla buraya düşüyorum.

01

Ajan çalıştırmak bedava değil. Tek bir görevin tek denemesi 3–10 dolar ve onlarca dakika ile saatler arası sürüyor. Bir yapılandırmanın üç kademeyi bitirmesi örneğinde fatura yaklaşık 2.400 dolar ve 213 saat. "Ajan ucuz işçi" varsayımı bu tabloda karşılığını bulmuyor — ölçek büyüdükçe maliyet kalemi ciddileşiyor. s.8–9, s.37

02

Sınavın kendisi beş kapıdan geçirilmiş. Her görev şu zinciri geçiyor: uzman kaynağı › gönderim portalı › konferans tipi ilk inceleme › uygulama + mühendis kuru koşusu › uzman komitesinde son kalite kontrolü. Bu, hakemli olmayan bir çalışmanın neden yine de ciddiye alınabildiğini açıklıyor: hakemlik yok ama süreç var. s.5

03

Rakip sınavlar da tam kapsamıyor. En yakın çağdaşları olan GDPval ve RLI, 55 sektörün yalnız 16'sını ve 14'ünü kapsıyor — yani 39 ve 41 sektöre hiç dokunmuyor; ayrıca ikisi de pahalı insan değerlendirmesine bağlı. Bu çalışmanın gerçek yeniliği kapsam kadar otomatik ve tekrarlanabilir doğrulama. s.10

04

Aracı değiştirmek sonucu değiştiriyor. Süre aşımından kaybedilen koşu oranı genelde %3,8 — ama hafif bir kurulumda yüzde 1 civarı, başka bir kurulumda %5,7. Yani "ajan yapamadı" dediğiniz vakaların bir kısmı ajanın değil kurulumun başarısızlığı. s.9

05

Görevlerin çoğu bilerek gizli tutuluyor. 1.490 görevin yalnız %10'u kamuya açık; gerisi özel havuzda ve dönüşümlü rotasyonla kullanılıyor. Sebep bulaşma: soru internete düşerse modeller onu ezberleyebilir ve sınav ölçmeyi bırakır. İyi bir metodoloji tercihi — ama aynı tercih yayımlanan oranların neden küçük bir alt kümeden geldiğini de açıklıyor. s.5

06

Model karşılaştırma tablosu bilinçli kullanılmadı. Çalışmada 11 farklı modelin tam tablosu var. Bu incelemeye alınmadı: "hangi model iyi" listesi bir ayda eskiyor ve tartışmayı ajan mühendisliğinden uzaklaştırıyor. Bu incelemenin ölçütü şu — altı ay sonra hâlâ doğru olacak şeyi yaz. kapsam kararı

Bu listede Türkiye'ye dair hiçbir sayı yok. Çalışma Türkiye'yi ölçmüyor; meslek taksonomisi ABD federal sınıflandırmasına (SOC/O*NET 2018) dayanıyor ve yalnız fiziksel olmayan sektörleri kapsıyor.

Sizin ajanınız hangi sınava giriyor? 5 soru

Cevaplar "evet/hayır" değil: kaç iş üzerinden, kimin işi, nasıl kontrol edildi.

01

Elinizdeki başarı oranı kaç görev üzerinden ölçüldü — ve o görevleri kim yazdı?

02

O görevler sizin ekibinizin fiilen teslim ettiği işlerden mi geliyor, yoksa demo için mi kurgulandı?

03

Ajanın çıktısını makine mi kontrol ediyor, yoksa "iyi görünüyor" diyen bir insan mı?

04

Başarısız koşuların kök sebebini sınıflandırıyor musunuz — anlama mı, yaklaşım mı, icra mı?

05

Bir işi ajana vermeden önce tam bitmiş sayılma ölçütünü yazıyor musunuz? Yazılı ölçüt yoksa geçme oranı da yok.

Üçünden fazlasına net cevabınız yoksa elinizde ajan performansı ölçümü değil, bir izlenim var. Bu çalışmanın asıl mesajı da bu: fark ajanın zekâsında değil, işin nasıl tanımlandığında.

Kendi işinizin sınavını kuralım.

Ajanı hangi işe koyacağınıza karar vermek için önce o işin geçme ölçütünü yazmak gerekir. AGENXY'de yaptığımız iş tam bu: işi adımlara bölmek, çıktının makineyle kontrol edilebilir tanımını kurmak, sonra ajana vermek.

Bir görüşme ayarla
Çıkar ve metodoloji beyanı 6 madde · okumadan alıntılamayın

Bu çalışmayı okurken altı şeyi bilerek okumak gerekiyor

Rakamları kullandım, ama şu altı kalem olmadan kullanılamazlar. Hepsi metnin içinde yazılı — gizlenmiş değil, sadece kimse alıntılamıyor.

  1. Çalışma Tianqiao & Chrissy Chen Institute, Snorkel AI ve UniPat AI tarafından finansal ve kredi desteğiyle fonlandı. Snorkel AI bir yapay zekâ veri ve değerlendirme şirketidir ve makaleyi kendi araştırma sayfasında da yayımlıyor. Değerlendirme altyapısı satan bir şirketin fonladığı bir değerlendirme çalışması.
  2. Danışma kurulu akademisyenlerin yanında şirket yöneticileri içeriyor.
  3. Tüm sonuçlar 152 kamuya açık görev üzerinde; 1.490'ın tamamında değil. Havuzun yalnız %10'u bilinçli olarak kamuya açık (bulaşma önlemi).
  4. Makale kendi içinde iki yerde tutarsız: uzman sayısı özet 250+ / sonuç 300+; kamuya açık görev sayısı metin 152 / Şekil 5 150.
  5. arXiv hakemli değildir; bu metnin kabul kaydı bulunamadı (yukarıdaki merdiven).
  6. Modeller hızla değişiyor: tablodaki yapılandırmalar Haziran 2026 sürümleridir. Aynı sınav bugün tekrarlansa sayılar değişir — bu oranlar tarihli verilerdir.
Künye, yöntem ve doğrulama notları kaynak · telif · yorum ayrımı

Kaynak: Agents' Last Exam — Yiyou Sun, Xinyang Han, Weichen Zhang, Dawn Song ve 300'ü aşkın katkıcı. Lider kurum University of California, Berkeley (RDI). arXiv:2606.05405, v2 · 11 Haziran 2026 (v1: 3 Haziran). 40 sayfa. Tam metin ücretsiz ve açık — kayıt/form istemiyor, bu yüzden kapsam uyarısı yerine künye notu yeterli.

Ne kadar okundu: 40 sayfanın tamamı. Sayfadaki her sayı kaynak metne geri bağlandı; olgusayfa eşlemesi teslim paketindeki veri_notlari.md ve sayfa_haritasi.txt dosyalarında.

Yorum / olgu ayrımı: "Ölçülmüş olgu" bölümündeki her şey tablodan; "aktarılan" bölümü makalenin kendi iddiası; "yorum" bölümü hem yazarların hem bizim yorumumuz ve öyle işaretli. Türkiye'ye dair sayı üretilmedi — bu çalışma Türkiye'yi ölçmüyor; taksonomi ABD federal meslek sınıflandırmasına (SOC/O*NET 2018) dayanıyor ve yalnız fiziksel olmayan sektörleri kapsıyor.

Düzeltilen manşet: ikincil kaynakların "%2,6 ortalama" aktarımı hatalıdır. %2,6 en iyi yapılandırmaların skoru ve 38 görevden 1'ine karşılık gelir; makalenin kendi özeti ortalamayı %1'in altında veriyor.

Alıntı politikası: tezi belirleyen tek cümle özgün diliyle alıntılandı, kaynak ve yazar adıyla. Uzun alıntı yapılmadı. Kaynağın görselleri kullanılmadı — makale incelemesinde kapak üretilir (Şekil 1/5/9 yeniden çizilmedi; veriler kendi görsel dilimizde yeniden kuruldu).

Doğrulanmayanlar: makalenin "55 sektörün tamamını kapsayan ilk" iddiası ve görevlerin tamamının gerçek teslim edilmiş işten geldiği ifadesi bağımsız olarak doğrulanmadı — sayfada iddia olarak işaretli. Hakem durumu: kabul kaydı bulunamadı.

Podcast: makale incelemelerinde sesli bölüm üretilmez (format kartı).

Haftalık inceleme serisi

Yeni bölüm çıktığında haberdar olun.

SİNYAL — AGENXY analiz serisi · No. 004 getagenxy.com