Açık kaynaklı pxpipe aracı, Claude Code için uzun metin girdilerini kompakt PNG dosyalarına dönüştürerek token maliyetlerini önemli ölçüde azaltıyor. Bu yöntem, Anthropic'in görüntüleri nasıl fiyatlandırdığına dayalı olarak çalışıyor. Metin, karakter başına yaklaşık bir token maliyetine sahipken, görüntüler sabit bir token sayısı ile fiyatlandırılıyor ve bu sayı piksel boyutlarına bağlı olarak değişiyor. Böylece, kod veya JSON gibi yoğun içerikler bir görüntü olarak işlenerek her görüntü token'ına yaklaşık 3.1 karakter sığdırılabiliyor.
Pxpipe, yerel bir proxy olarak bu işlevi yerine getiriyor. Claude Code'a yapılan talepleri yakalayarak, sistem istemleri, araç belgeleri ve eski sohbet geçmişi gibi hacimli, statik kısımları görüntüler olarak işliyor. Son mesajlar ve model çıktıları ise normal metin olarak geçiyor. Aşağıdaki görselde, modelin gördüğü içerik gösteriliyor: Yaklaşık 48,000 karakterlik sistem istemi ve araç belgeleri tek bir yoğun PNG sayfasına sıkıştırılıyor. Metin olarak bu içerik yaklaşık 25,000 token maliyetine sahipken, görüntü olarak maliyet yaklaşık 2,700 token olarak hesaplanıyor.
Geliştirici Steven Chong'a göre, toplam tasarruf oranı ortalama %59 ile %70 arasında değişiyor. Bir Fable 5 demosunda, oturum maliyeti $42.21'den $6.06'ya düştü. Eğer bu yöntem yaygınlaşırsa, yapay zeka şirketleri görüntü işleme fiyatlarını artırma yoluna gidebilir.
Ancak bu yaklaşımın bazı dezavantajları da var. İşlem kayıplı olduğu için, hash gibi tam dizgeler görüntülerden okunduğunda bozulabiliyor. Ayrıca, modelin işlenmiş görüntüleri bir görsel kodlayıcıdan geçirmesi gerektiğinden işlem süresi de daha uzun oluyor.
Varsayılan olarak, pxpipe Claude Fable 5 ve GPT 5.6'yı destekliyor. Karşılaştırma testleri ve değerlendirmeler, depoda belgelenmiş durumda. Fable 5, modelin ezberleyemeyeceği yeni rastgele sayılarla yapılan matematik problemlerinde %100 doğruluk oranına ulaşıyor. Chong'a göre, Opus 4.7 ve 4.8 işlenmiş görüntülerin yaklaşık %7'sini yanlış okuyor ve GPT 5.5 de görüntü bağlamında daha düşük performans gösteriyor. Her iki model de varsayılan olarak kapalı ve yalnızca manuel olarak etkinleştirilebiliyor.
Yapay zeka modellerine metin beslemek için sıkıştırılmış görüntüler kullanma fikri yeni değil. Deepseek, metin belgelerini görüntü olarak işleyen bir OCR sistemi geliştirdi ve teknik raporuna göre, bilgilerin %97'sini koruyarak bu belgeleri on kat kadar sıkıştırabiliyor.
0 Yorum
Henüz yorum yok. İlk yorumu siz yazın.