İçeriğe atla
Blog
Kanıt Masası

Kıyaslamalar ürün kabul testi değildir

Herkese açık kıyaslamalar yönlendirici sinyaller verir ancak ürüne özel değerlendirmelerin yerini alamaz. Gerçek kullanım koşullarını yeterince kapsamazlar.

Kıyaslamalar neden doğru gibi görünür ama değildir

Bir liderlik tablosundaki sayı baştan çıkarıcıdır. Aylarca süren araştırma, mühendislik ve çıkarımı tek bir kayan noktalı sayıya sıkıştırır. Karşılaştırmaya davet eder. Bir makale okumadan, bir test çalıştırmadan, testin gerçekte ne ölçtüğünü bilmeden “Model A, Model B’den daha iyidir” demenizi sağlar.

Bu baştan çıkarıcılık sorunun ta kendisidir. Kıyaslamalar ürün kabul testi değildir. Kontrollü koşullar altında, seçilmiş görevlerde dar, statik anlık görüntülerdir. Üretim ortamı bunların hiçbiri değildir.

Kıyaslamalar gerçekte neyi ölçer (ve neyi kaçırır)

Kıyaslamalar gerçekte neyi ölçer (ve neyi kaçırır) için yazısız editoryal akış diyagramı

LibriSpeech’te düşük kelime hatası oranı alan bir konuşmadan metne modelini ele alalım. Bu sayı bir geçer not gibi görünür. Ancak LibriSpeech, sesli kitaplardan okunan konuşmadır—temiz ses, standart Amerikan İngilizcesi, tahmin edilebilir kelime dağarcığı. Aynı modeli alan adına özgü jargon, kod değiştirme veya bölgesel aksanlar içeren çağrı merkezi transkriptlerine koyun, hata oranı hızla yükselir.

Kıyaslamalar, yaratıcılarının ölçmeyi seçtiği şeyi ölçer. Stanford CRFM tarafından yürütülen HELM projesi, modelleri birden çok senaryoda değerlendirerek bunu açıkça ortaya koyar—ancak çok senaryolu bir kıyaslama bile tasarımcılarının hayal ettiği senaryolarla sınırlıdır. MLCommons Inference kıyaslamaları, modelin sizin özel bağlamınızda güvenli veya kullanışlı çıktılar üretip üretmediğine değil, standartlaştırılmış koşullar altında verim ve gecikme süresine odaklanır.

Kıyaslamaların sistematik olarak kaçırdıkları:

  • Alanınızdaki uç durumlar. Bir kodlama kıyaslaması genel programlama yeteneğini test eder, sizin dahili API kurallarınızı veya eski kod desenlerinizi değil.
  • Kullanıcılarınız için önemli olan hata modları. Bir kıyaslama olgusal doğruluğu test edebilir, ancak modelin ürününüz hakkında kendinden emin bir şekilde yanlış bilgi vermesini test etmeyebilir.
  • Etkileşim etkileri. Kıyaslamalar izole görevleri test eder. Üretim sistemleri çağrıları zincirler, bileşenler arasında bağlam aktarır ve hiçbir kıyaslamanın yakalayamayacağı şekillerde bozulur.

Liderlik tablosu sıralaması ile üretim güvenilirliği arasındaki uçurum

Her halka açık liderlik tablosunda zirvede olan bir model, üretim ortamında felaketle sonuçlanacak şekilde başarısız olabilir. Nedenler yapısaldır:

Dağılım kayması. Kıyaslama test kümeleri statiktir. Üretim verileri kayar. 2023 kıyaslama verileri için optimize edilmiş bir model, 2024 kullanıcı girdilerinde çökebilir.

Metrik uyumsuzluğu. Kıyaslamalar toplam puanlar bildirir. Üretim sistemlerinin örnek bazında güvenilirliğe ihtiyacı vardır. Yüksek doğruluk ortalaması alan bir model, en kritik kullanım durumlarınızı oluşturan girdilerin küçük bir kısmında başarısız olabilir.

Güvenlik ve sağlamlık kıyaslanmaz. Kırmızı takım çalışması, çekişmeli girdiler ve güvenlik değerlendirmeleri, hiçbir genel kıyaslamanın sağlamadığı amaca yönelik test paketleri gerektirir. Bir model standart testlerde iyi puan alırken önemsiz bir şekilde jailbreaklenebilir.

Ürüne özel değerlendirmeler oluşturma

Alternatif, kıyaslamaları terk etmek değildir. Onları birçok girdiden biri olarak ele alın. Ürüne özel bir değerlendirme yığını şunları içermelidir:

  1. Göreve özel test verileri. Gerçek üretim girdilerini yansıtan örnekler toplayın veya oluşturun—gerçek kullanıcı sorguları, alan terminolojisi, günlüklerden uç durumlar.

  2. Önceden tanımlanmış başarısızlık eşikleri. Testleri çalıştırmadan önce neyin geçer veya kalır sayılacağına karar verin. Doğrulukta küçük bir düşüş kabul edilebilir olabilir; halüsinasyon oranındaki küçük bir artış kabul edilemez olabilir.

  3. Kırmızı takım paketleri. Hata modlarını sistematik olarak araştırın: çekişmeli istemler, dağılım dışı girdiler, sınır koşulları. Bu tek seferlik bir çalışma değildir; otomatikleştirin ve her aday modelde çalıştırın.

  4. Öznel kalite için insan değerlendirmesi. Kıyaslamalar ton, güvenlik veya bağlam içinde uygunluğu ölçemez. Net yönergeler kullanan insan değerlendiriciler, otomatik metriklerin kaçırdığını yakalar.

Kıyaslamalar ne zaman yararlıdır (ve ne zaman yanıltır)

Kıyaslamalar doğrulayıcı değil, filtre görevi görür. Aday havuzunu daraltmak için kullanın. Bir model ilgili kıyaslamalarda bir eşiğin altında puan alıyorsa, üretimde performans göstermesi olası değildir. Ancak kıyaslamayı geçmek yeterli değildir—yalnızca modelin henüz elenmediği anlamına gelir.

Kıyaslamalar, kabul kriteri olarak ele alındıklarında yanıltıcı olur. Bir satıcının liderlik tablosu sıralaması göstermesi, modellerinin sizin kullanım durumunuz için çalıştığına dair kanıt değildir. Modellerinin başka birinin testi için çalıştığına dair kanıt sağlarlar.

Pratik bir iş akışı

Pratik bir iş akışı için yazısız editoryal akış diyagramı
  1. Kıyaslamalarla eleyin. İlgili boyutlarda açıkça yetersiz performans gösteren modelleri elemek için halka açık kıyaslamaları kullanın.
  2. Alana özel test kümeleri oluşturun. Üretim günlüklerinden, alan uzmanlarından ve sentetik üretimden örnekler seçin.
  3. Hata modu başına eşikler tanımlayın. Test etmeden önce neyi kabul edeceğinizi ve neyi reddedeceğinizi bilin.
  4. Kırmızı takım ve çekişmeli değerlendirme yapın. Güvenlik, sağlamlık ve uç durumlar için otomatik ve manuel araştırmalar.
  5. Öznel kriterler için insan değerlendirmesi. Ton, yardımseverlik, güvenlik, uygunluk.
  6. Testlerin neyi ölçmediğini belgeleyin. Her değerlendirmenin kör noktaları vardır. Bunları açıkça belirtin.

Kıyaslama bir başlangıç noktasıdır, bir sonuç değil. Ürün kabul testi, kendi hata modlarınızı anladıktan sonra inşa ettiğiniz şeydir.