Artificial Analysis, Yapay Zeka Ajanları İçin Arama Motoru Performansını Ölçen Yeni Bir Kriter Yayınladı

Yapay zeka ajanlarının internet üzerindeki bilgiye erişim süreçlerini standartlaştırmayı hedefleyen Artificial Analysis, yeni kıyaslama platformu Search Index'i kullanıma sundu. Bu platform; Parallel, Exa, Firecrawl, You.com, Tavily, Keenable ve Brave gibi popüler arama motoru arayüzlerini, aynı yapay zeka modeli ve çalışma ortamı altında test ederek performanslarını ölçüyor.
Sistem, GPT-5.6 Luna modelini ve açık kaynaklı Stirrup çerçevesini kullanarak her arama sağlayıcısı için 25 farklı görev çalıştırıyor. Kıyaslama süreci üç ana bölümden oluşuyor: 900 araştırma sorusunu içeren DeepSearchQA, çok aşamalı tarama gerektiren 200 zorlu olguyu test eden BrowseComp ve altı farklı bilgi alanını kapsayan 600 soruluk AA-Omniscience kümesi. Bu testler, modelin hiçbir dış araç kullanmadan kendi başına yanıt verdiği temel bir referans noktasıyla karşılaştırılıyor.
Araştırma, arama kalitesinin toplam maliyet üzerindeki doğrudan etkisini ortaya koyuyor. Kaliteli sonuçlar, yapay zekanın daha az token tüketmesini sağlayarak işlem maliyetlerini düşürüyor. Örneğin, Parallel Search'ün gelişmiş sürümü, temel sürüme kıyasla token kullanımını yüzde 40 oranında azaltarak toplam görev maliyetini 0,11 dolardan 0,084 dolara çekiyor.
Sorgu başına hızın her zaman toplam süreyi kısaltmadığı da test sonuçlarında görülüyor. Parallel Search (turbo) sürümü 0,51 saniyelik sorgu hızıyla en hızlı seçenek olsa da, daha düşük kalite puanı nedeniyle ajanın daha fazla işlem yapmasına yol açıyor. Bu durum, toplam görev süresinin diğer seçeneklerle benzer seviyelerde kalmasına neden oluyor. Şu anki verilere göre Parallel, Firecrawl ve Parallel (turbo), maliyet ve performans açısından en dengeli sonuçları sunan sağlayıcılar olarak öne çıkıyor.


