AI Arama Altyapısı

Multi-Vector Embedding Modeller Artık Fine-Tune Edilebiliyor: E-Ticaret Arama Altyapısı İçin Ne Anlam Taşıyor?

Arama Motoru Değil, Anlama Motoru

E-ticarette arama kalitesi doğrudan gelire bağlıdır. Müşteri "kırmızı yazlık elbise" yerine "düğün için hafif, canlı renkli elbise" yazdığında geleneksel keyword-based arama çuvallar; ürün orada durur ama yüzüne bile bakılmaz. Uzun süredir bu sorunu çözmek için tek-vektör embedding modelleri (BERT türevleri gibi) kullanıldı. Ancak bunlar bir metni tek bir sayı dizisine sıkıştırır — anlam zenginliği bu süreçte kaybolur.

Hugging Face'in 26 Ağustos 2026'da yayımladığı rehber tam bu noktayı kırıyor: Multi-vector (geç etkileşim) embedding modelleri artık Sentence Transformers ile hem eğitilebiliyor hem fine-tune edilebiliyor. ColBERT mimarisinin tabana yayıldığı bu gelişme, firmaların kendi kataloglarına özel anlama motorları kurmasının önünü somut biçimde açıyor.


Geç Etkileşim Ne Demek, Neden Fark Yaratıyor?

Klasik dense retrieval'da sorgu da, ürün açıklaması da birer tek vektöre indirgenir; benzerlik bu iki vektörün nokta çarpımıyla ölçülür. Hız yüksek, ama bağlam körleşir.

Multi-vector / late interaction modellerinde (ColBERT, ColPali vb.) her token kendi vektörünü korur. Sorgunun her kelimesi, üründeki her token ile ayrı ayrı karşılaştırılır; ardından en yüksek skorlar toplanır (MaxSim). Sonuç: hem hız makul hem de bağlamsal hassasiyet dramatik biçimde artar.

E-ticaret için somut örnek:

  • Sorgu: "su geçirmez, hafif trekking botu bayan 38 numara"
  • Klasik embedding: "bot" + "bayan" + "38" → tek vektör → yakın ürünler genel sporcu botu olabilir
  • Late interaction: "su geçirmez" tokeni direkt ürün açıklamasındaki "waterproof membrane" ile eşleşir, "hafif" başka bir token'la, "38" ayrıca — her boyut ayrı işlenir

Bu fark, uzun kuyruk sorgularda (long-tail) dönüşüm oranını doğrudan etkiler. Long-tail sorgular kural olarak daha yüksek satın alma niyeti taşır.


Fine-Tune Olabilmesi Neden Kritik?

Genel amaçlı bir embedding modeli "hafif bot" ile "çevik ayakkabı" arasındaki farkı bilmez; ama sizin mağazanızın 3 yıllık arama logları bilir.

Sentence Transformers güncellemesi şunu mümkün kılıyor:

  1. Kendi arama log'larınızdan (query → tıklanan ürün) çiftler çıkarın.
  2. Bu çiftlerle ColBERT tabanlı modeli fine-tune edin — negatif örnekleme stratejisi rehberde detaylı.
  3. Fine-tune edilmiş modeli kendi vektör veritabanınıza (Qdrant, Weaviate, pgvector) entegre edin.

Bu pipeline artık Hugging Face Inference Endpoints üzerinde doğrudan çalışıyor. Yani büyük mühendislik ekibi gerekmeksizin, Shopify + vektör DB + HF endpoint üçgeniyle üretim ortamına taşıyabilirsiniz.


Firma Tarafı: Ne Yapılmalı, Hangi Sırayla?

1. Veri sağlığı önce gelir. Arama loglarınızı çekin: sorgu, tıklanan ürün, sepete ekleme, satın alma. Sadece tıklama değil, satın alma sinyali olan çiftler öncelikli. Kirli log (bot trafiği, test sorguları) fine-tune'u bozar.

2. Katalog boyutunuzu değerlendirin. 10.000'in altındaki ürün sayısıyla late interaction'ın avantajı sınırlı kalır; klasik dense retrieval + BM25 hibrit yeterli olabilir. 50.000+ SKU'da fark belirgin olur.

3. ColBERT-v2 veya BGE-M3 ile başlayın. İkisi de Sentence Transformers ile fine-tune edilebilir, Türkçe için BGE-M3 çok dilli desteğiyle öne çıkıyor.

4. Eski sistemi anında öldürmeyin. A/B testi kurun: geleneksel keyword arama ile yeni vektör tabanlı aramayı paralel çalıştırın, 30 gün boyunca dönüşüm oranı ve ortalama sipariş değeri karşılaştırın.

5. Görsel kataloglarda ColPali'ye bakın. Ürün görseli ağırlıklı mağazalarda (moda, mobilya, dekor) ColPali text-image late interaction sunuyor — henüz fine-tune rehberi daha sınırlı ama yol haritasında.


Gözden Kaçan Risk

Fine-tune süreci pozitif çiftleri öğrenirken popüler ürünleri aşırı güçlendirebilir. Log'larınız zaten çok satan ürünlere doğru önyargılı; model bu önyargıyı pekiştirir, yeni veya niş ürünler karanlıkta kalır. Çözüm: negatif örneklemeye "popularity debias" ekleyin, nadir tıklanan ama yüksek dönüşümlü ürünleri eğitim setinde ağırlıklandırın.


E-ticaret arama kalitesi uzun süredir "yeterince iyi" kategorisinde sıkıştı. Multi-vector embedding'lerin fine-tune edilebilir hale gelmesi bu durumu bozuyor — ve bunu şimdi uygulayan firmalar, rakipleri hâlâ keyword eşleştirmesiyle boğuşurken kataloglarını gerçek anlamda konuşturmaya başlıyor.