AI benchmark'ları nasıl okunur?
GPQA, Humanity's Last Exam, SWE-bench ve genel zekâ endeksleri neyi ölçer? Model karşılaştırmalarını doğru okumak için kısa rehber.

Her yeni model duyurusu bir benchmark tablosuyla geliyor ve her şirket kendi modelini “en iyi” ilan ediyor. Bu tabloları doğru okumak için hangi testin neyi ölçtüğünü bilmek yeterli.
En çok karşılaşacağınız testler
- GPQA Diamond: Biyoloji, fizik ve kimyada doktora seviyesinde 198 çoktan seçmeli soru. Alanın uzmanları yaklaşık %65, internete erişimi olan uzman olmayanlar yaklaşık %34 başarı gösteriyor. Bilimsel akıl yürütmeyi ölçer.
- Humanity’s Last Exam (HLE): Center for AI Safety ve Scale AI’ın Ocak 2025’te yayımladığı, onlarca alandan 2.500 zor soru. Mevcut modellerin en zorlandığı testlerden biri.
- SWE-bench Verified: 12 açık kaynak Python projesindeki gerçek GitHub sorunlarından, insanlar tarafından kontrol edilmiş 500 görev. Modelin gerçek bir yazılım hatasını düzeltip düzeltemediğini ölçer.
- Genel endeksler: Artificial Analysis’in zekâ endeksi gibi ölçümler birçok testi tek bir puanda birleştirir. Hızlı karşılaştırma için kullanışlıdır.
Okurken dikkat edilecek 3 şey
- Ayar farkı: Aynı model “düşük” ve “maksimum” akıl yürütme ayarında çok farklı puan alabilir. Karşılaştırdığınız rakamların aynı ayarda olduğundan emin olun.
- Kim ölçtü? Şirketin kendi açıkladığı puanlar ile bağımsız kuruluşların ölçtükleri farklı olabilir. Bağımsız ölçümler daha güvenilirdir.
- Tek test her şey değildir: Kodlamada zirvede olan bir model yazı yazmada ortalama kalabilir. İşinize en yakın testlere bakın.
Güncel sıralamayı AI Modelleri sayfamızda görebilirsiniz.
Daha derin bakış
Veri sızıntısı (contamination). Bir testin soruları internette yayımlandıysa, modeller eğitim sırasında bu soruları görmüş olabilir. Bu yüzden eski ve popüler testlerde yüksek puan, gerçek yetenekten çok ezberi gösterebilir. Yeni ve gizli tutulan test setleri bu yüzden daha değerli.
Doygunluk (saturation). Modeller bir testte %90’ın üstüne çıktığında test artık modelleri birbirinden ayıramaz hale gelir. MMLU gibi eski testlerin yerini GPQA ve HLE gibi zor testlerin alması bu yüzden.
Maliyet ve hız da performanstır. Aynı puanı 10 kat daha ucuza veya hızlıya veren model, pratikte çoğu zaman daha iyi seçimdir. Artificial Analysis’in “görev başı maliyet” ve “hız” sütunları bu yüzden önemli; AI modelleri sayfamızdaki tabloda bu değerler de var.
İnsan tercihi ölçümleri. LMArena gibi platformlar, kullanıcıların iki modelin cevabını karşılaştırıp oy vermesiyle Elo puanı hesaplar. Gerçek kullanıcı beğenisini yansıtır ama uzun ve süslü cevapları ödüllendirme eğilimi gösterebilir.
Bizim notumuz
Bir modeli seçerken tek bir sayıya değil, üç şeye birlikte bakın: işinize yakın test sonuçları, bağımsız ölçüm ve maliyet/hız. Benchmark tabloları iyi bir başlangıçtır; son sözü kendi işiniz üzerinde yapacağınız kısa bir deneme söyler.
Yorumlar
Yorum yazmak ve beğenmek için ücretsiz üye olun.
Henüz yorum yok. İlk yorumu siz yazın.