OpenRouter, TypeSafe’in sınıflandırma modeli Jev 1.13 ile Claude Opus 5’i Banking77 test setinde (3.080 müşteri destek ifadesi, 77 niyet) karşılaştırdı. Yazı, küçük bir yargı modelinin frontier sohbet modeli yerine ne kadar doğruluk kaybıyla maliyet ve gecikme kazandırabileceğini ölçüyor.
Sonuçlar
Jev doğruluk %81,0, Opus 5 %84,4 (fark ~3,3 puan; bootstrap %95 GA 2,3–4,4). Macro-F1 %80,5’e karşı %83,6. Medyan gecikme 175 ms / 2.266 ms (~13×). Tam koşu maliyeti $0,34 / $7,44; bin istekte $0,11 / $2,42 (Opus’ta uzun sistem istemi önbellekli). İki model örneklerin %89,3’ünde aynı etiketi vermiş.
Güven skoru ile yönlendirme
Jev güveni kalibre olasılık değil ama sıralama sinyali olarak işe yarıyor. Güven ≥0,90 iken trafiğin ~%76’sı Jev’de kalıp Opus’a eskalasyonla doğruluk Opus-only’ye 0,4 puan mesafede, maliyet ~3,5× düşük kalabiliyor. Tek veri seti / tek prompt / reasoning kapalı Opus koşulları sınır olarak not edilmiş.
Kaynak: OpenRouter — Is Jev as Accurate as Frontier Models at Classification?
Henüz yorum yok. İlk yorumu siz yapın!