Topic clustering yaparken semantik benzerlik nasıl ölçülür?
Yazar: Yılmaz Saraçtopic-clusteringembeddingserp-ortusmesiicerik-mimarisi
Kısa cevap: Üç ölçüm birlikte kullanılır: metin gömme (embedding) vektörleri arasındaki kosinüs benzerliği, sorguların SERP örtüşmesi ve Search Console verisinde aynı sayfaya gelen sorgu aileleri. Tek yönteme yaslanmak yanlış kümeleme üretir.
Pratik ölçüm yöntemi
- Embedding tabanı: sorguları ve sayfa başlıklarını gömme modeliyle vektörleştirin, kosinüs benzerliğiyle aday kümeleri çıkarın; k-means veya HDBSCAN gibi algoritmalar işi ölçekler.
- SERP örtüşmesi testi: iki sorgu için ilk sonuç sayfası büyük ölçüde aynıysa tek sayfa, farklıysa ayrı sayfa gerekir; niyet ayrımını en iyi bu test yakalar.
- GSC doğrulaması: hâlihazırda aynı URL üzerinde gösterim alan sorgular doğal küme kanıtıdır.
- Editoryal kontrol: algoritmik kümeler insan gözüyle onaylanır; ticari niyet farkları vektörde görünmeyebilir.
Sonuç küme bazlı izlenir: her kümenin gösterim, tıklama ve sorgu kapsamı tek satırda raporlanır, ayrışan sayfalar yeniden değerlendirilir.