Web Kazıma için Tarayıcı Parmak İzi: Proxilerin Düzeltip Düzeltmeyeceği Şeyler

Elena Kovacs tarafından1 Tem 202611 dk. okuma
browser-fingerprinting

Tarayıcınız test ortamında çalışıyor, ancak üretim farklı bir hikaye anlatıyor. Engellemeler artıyor, yeniden denemeler maliyetli hale geliyor ve ana veriler yoğun saatlerde kayboluyor. IP'leri döndürüyor, konut proxy'leri kullanıyor veya proxy havuzlarını değiştiriyor olabilirsiniz, ancak sorun yalnızca proxy katmanında olmayabilir. Sorun tarayıcı parmak izi olabilir.

Web scraping için tarayıcı parmak izi, web sitelerinin bir tarayıcıyı, cihazı veya otomasyon yığınını IP adresinin ötesinde tanımlamak için kullandığı sinyalleri ifade eder. Proxy'ler IP itibarını, konumunu, ASN karışımını ve eşzamanlılığı yönetmeye yardımcı olabilir. Ancak, User-Agent, WebGL, canvas, yazı tipleri, saat dilimi, WebRTC davranışı, TLS özellikleri veya otomasyon bayrakları gibi istemci tarafı sinyallerini düzeltemezler.

Bu kılavuz, proxy'lerin neleri düzeltebileceğini, neleri düzeltemeyeceğini ve yanlış bir çözüme bütçe harcamadan önce proxy sorunlarını parmak izi sorunlarından nasıl ayıracağınızı açıklar.

Tarayıcı Parmak İzi Nedir?

Tarayıcı parmak izi, birçok tarayıcı ve cihaz sinyalini bir araya getirerek bir oturumu tanımak veya puanlamak sürecidir.

Bir web sitesi şunlara bakabilir:

  • User-Agent
  • Tarayıcı sürümü
  • İşletim sistemi
  • Ekran boyutu
  • Saat dilimi
  • Dil
  • Yazı tipleri
  • Canvas davranışı
  • WebGL çıktısı
  • Ses API'leri
  • TLS/JA3 özellikleri
  • WebRTC davranışı
  • Çerez ve depolama geçmişi
  • Otomasyon bayrakları

Her bir sinyal tek başına zararsız görünebilir. Bir araya geldiğinde, yaygın, nadir, tutarsız veya otomatik görünen bir profil oluşturabilir.

Scraping ekipleri için sorun, bir sitenin bir tarayıcıyı tanıyıp tanımadığı değil, tarayıcı kimliğinizin proxy, bölge, oturum geçmişi ve iş yükü için inandırıcı görünüp görünmediğidir.

Tarayıcı Parmak İzinin Web Scraping İçin Önemi

Modern web siteleri yalnızca IP tabanlı engellemeye dayanmaz. Genellikle IP itibarını tarayıcı davranışı, JavaScript sinyalleri, ağ özellikleri ve oturum geçmişi ile birleştirirler.

Bu, web scraping proxy'leri kullanan bir scraper'ın tarayıcı yığını yanlış görünüyorsa başarısız olabileceği anlamına gelir.

Örneğin:

  • IP Almanya'da görünüyor.
  • Saat dilimi Amerika Birleşik Devletleri'ne ayarlanmış.
  • User-Agent Windows Chrome diyor.
  • Yazı tipi listesi Linux gibi görünüyor.
  • WebGL alışılmadık bir satıcı bildiriyor.
  • WebRTC çelişkili bir ağ yolu açığa çıkarıyor.

Bir proxy IP'nin doğru görünmesini sağlayabilir, ancak tarayıcı ortamını kendi başına tutarlı hale getiremez.

Parmak izi sinyalleri tutarsız olduğunda, ekipler şunları görebilir:

  • Daha fazla CAPTCHA
  • Daha yüksek 403 veya 429 oranları
  • Yumuşak engellemeler
  • Eksik fiyatlar
  • Yanlış yerelleştirilmiş içerik
  • Daha düşük oturum hayatta kalma
  • Daha yüksek CPSR

CPSR, başarılı istek başına maliyet anlamına gelir.

Açık terimlerle: CPSR, her kullanılabilir sonucun proxy harcaması, hesaplama, yeniden denemeler ve başarısız oturumlar sonrasında ne kadar maliyetli olduğunu gösterir.

Proxy'lerin Düzeltilebileceği Şeyler

Proxy'ler hala scraping altyapısı için gereklidir. Ağ katmanına bağlı sorunları çözerler.

Proxy'ler şunlarla yardımcı olabilir:

  • IP itibarı
  • IP döngüsü
  • Ülke veya şehir yönlendirmesi
  • ASN çeşitliliği
  • IP düzeyinde hız sınırlamaları
  • Coğrafi olarak belirli erişim
  • IP başına eşzamanlılık kontrolü
  • Yapışkan oturum yönlendirmesi

Örneğin, veri merkezi proxy'leri statik sayfalar, kamu verisi toplama, izleme ve daha düşük sürtünmeli hedefler için iyi çalışabilir. Hedefin veri merkezi IP aralıklarını ağır bir şekilde cezalandırmadığı durumlarda genellikle daha hızlı ve maliyet açısından daha verimlidir.

Konut proxy'leri genellikle coğrafi olarak hassas sayfalar, giriş tabanlı akışlar, yerelleştirilmiş içerik, pazar yerleri ve sunucu tarafı trafiğine güçlü bir şekilde tepki veren web siteleri için daha iyidir.

Anahtar, proxy türünü iş yükü baskısına eşleştirmektir.

Proxy'lerin Düzeltilemeyeceği Şeyler

Proxy'ler tarayıcıyı veya otomasyon çalışma zamanını düzeltemez.

Doğrudan kontrol etmezler:

  • Tarayıcı parmak izi
  • User-Agent tutarlılığı
  • Canvas çıktısı
  • WebGL davranışı
  • Ses parmak izi
  • Yüklenmiş yazı tipleri
  • Navigator özellikleri
  • TLS/JA3 imzası
  • WebDriver sızıntıları
  • Çerez geçmişi
  • Yerel depolama
  • Oturum davranışı
  • WebRTC açığa çıkarma

Bu nedenle, daha iyi bir proxy havuzu satın almak her zaman engelleri azaltmaz. Hedef, tarayıcı kimliğini reddediyorsa, IP'leri değiştirmek sadece daha fazla gürültü ekleyebilir.

Yaygın bir hata, her engelin bir IP sorunu olduğu varsayımında bulunmaktır. Bazen IP iyidir, ancak tarayıcı otomatik, nadir veya iç tutarsızlık gösterir.

Proxy Sinyalleri vs Parmak İzi Sinyalleri

Bu tabloyu iki katmanı ayırmak için kullanın.

SinyalProxy Bunu Düzeltir Mi?Neden Önemli
------------------------------------------:-----------------------------------------
IP itibarıEvetProxy havuzu kalitesi güveni etkiler
Ülke veya şehir konumuEvetÇıkış konumu coğrafyayı kontrol eder
ASN karışımıKısmenProxy kaynağı ağ profilini etkiler
IP eşzamanlılığıEvetHer IP için çok fazla istek baskıyı artırır
TLS/JA3Hayırİstemci yığınından gelir
Kullanıcı-AjanHayırTarayıcı/runtime tarafından kontrol edilir
FontlarHayırOS/tarayıcı ortamından gelir
Canvas/WebGLHayırGrafikler ve tarayıcı davranışı ile bağlıdır
Zaman dilimi/dilHayırTarayıcı profilinde yapılandırılmalıdır
WebRTC sızıntılarıDolaylı olarakDevre dışı bırakılmalı veya doğru yönlendirilmelidir
Çerezler/depolamaHayırTarayıcı oturumunda bulunur

Bu ayrım önemlidir çünkü pahalı sorun giderme hatalarını önler.

Sorunun Proxy ile İlgili Olup Olmadığını Nasıl Anlarsınız

Eğer şunları görüyorsanız proxy katmanıyla başlayın:

  • Eşzamanlılığı düşürdüğünüzde iyileşen 429 oran limitleri
  • GEO'yu değiştirdikten sonra çalışan ülke kilitli sayfalar
  • Belirli ASN'ler etrafında kümelenmiş engeller
  • Veri merkezi IP'lerinden konut IP'lerine geçtikten sonra daha iyi başarı
  • Yapışkan oturumlarla iyileşen sonuçlar
  • Bir proxy havuzu veya bölgeye bağlı hatalar

Bu durumlarda, proxy ayarlaması doğru ilk adım olabilir.

Deneyin:

  • Her IP için eşzamanlılığı azaltmak
  • Proxy türünü değiştirmek
  • Farklı GEO'ları test etmek
  • Yapışkan oturumlar kullanmak
  • ASN çeşitliliğini artırmak
  • Yüksek riskli hedefleri düşük riskli hedeflerden ayırmak

Eğer bu değişiklikler başarı oranını artırıyorsa, proxy katmanı muhtemelen önemli bir faktördü.

Sorunun Parmak İzi ile İlgili Olup Olmadığını Nasıl Anlarsınız

Eğer:

  • Yeni IP'ler hala başarısız oluyorsa
  • Sayfalar yükleniyor ancak eksik veri gösteriyorsa
  • JavaScript yürütüldükten sonra engeller ortaya çıkıyorsa
  • Stabil IP'lerle bile oturum açma akışları sıfırlanıyorsa
  • Birden fazla proxy havuzunda CAPTCHA'lar ortaya çıkıyorsa
  • Hatalar yalnızca başsız veya otomatik tarayıcılarda oluyorsa
  • Gerçek Chrome, otomasyon yığınınızdan daha iyi performans gösteriyorsa

Bu, tarayıcı kimliğinin sorun olabileceğinin işaretleridir.

Bir proxy, otomasyon bayraklarını, uyumsuz cihaz özelliklerini veya gerçekçi olmayan JavaScript davranışını açığa çıkaran bir tarayıcıyı düzeltemez.

Scraping Ekipleri İçin Pratik Bir Karar Yolu

Sağlayıcıları değiştirmeden veya scraper'ınızı yeniden inşa etmeden önce, sorunu izole edin.

Adım 1: Hata Türünü Belirleyin

Eğer sayfa, JavaScript etkileşimi olmadan düz 403 veya 429 hataları döndürüyorsa, IP, oran limitleri veya ASN baskısıyla başlayın.

Eğer sayfa CAPTCHA, JavaScript zorlukları, eksik içerik veya oturum açma sıfırlamaları tetikliyorsa, parmak izi ve otomasyon sinyallerini inceleyin.

Adım 2: Bir Değişkeni Aynı Anda Değiştirin

Aynı tarayıcıyı koruyun ve yalnızca proxy'yi değiştirin.

Eğer performans iyileşirse, proxy yolu önemlidir.

Sonra aynı proxy'yi koruyun ve tarayıcı ortamını değiştirin.

Eğer performans iyileşirse, parmak izi muhtemelen daha güçlü bir sorun olabilir.

Adım 3: Profil Tutarlılığını Kontrol Edin

Bu sinyallerin eşleştiğinden emin olun:

  • IP konumu
  • Zaman dilimi
  • Dil
  • Kullanıcı-Ajan
  • OS
  • Fontlar
  • WebGL satıcısı
  • Ekran boyutu
  • Çerez geçmişi

Tarayıcı, tek bir tutarlı hikaye anlatmalıdır.

Adım 4: Doğru Çözümü Seçin

Sorun proxy tarafındaysa, proxy türünü, döndürmeyi, eşzamanlılığı ve oturum süresini ayarlayın.

Sorun parmak izi tarafındaysa, tarayıcı tutarlılığını, oturum sürekliliğini, WebRTC yönetimini ve otomasyon davranışını geliştirin.

Parmak İzi Farkındalığına Sahip Bir Scraping Yığını Oluşturma

Güçlü bir scraping yığını, proxy'leri ve tarayıcı parmak izlerini ayrı ama bağlantılı katmanlar olarak ele alır.

Amaç basit: istemcinin, proxy ile aynı bölgeden gelen, kararlı ve inandırıcı bir tarayıcı gibi görünmesini sağlamak.

Üretim için hazır bir kurulum şunları içermelidir:

  • Güncel tarayıcı sürümleri
  • Her oturum için kararlı User-Agent
  • Eşleşen saat dilimi ve dil
  • Tutarlı görünüm ve ekran boyutu
  • Gerektiğinde kalıcı çerezler
  • OS/profille eşleşen WebGL davranışı
  • WebRTC sızıntı önleme
  • Mantıklı eşzamanlılık sınırları
  • Dinamik akışlar için yapışkan oturumlar

Tarayıcı tabanlı iş akışları için, Playwright, Puppeteer ve Selenium gibi çerçeveler iyi çalışabilir, ancak yine de dikkatli yapılandırma gerektirir.

Gerçek bir tarayıcı, otomatik olarak gerçekçi bir tarayıcı oturumu anlamına gelmez.

HTTP İstemcileri ile Tam Tarayıcılar Ne Zaman Kullanılmalı

Her scraping işi tam bir tarayıcıya ihtiyaç duymaz.

HTTP istemcileri veya hafif scraping kullanın:

  • Sayfalar statikse
  • API'ler mevcutsa
  • JavaScript gerekli değilse
  • Hedefin düşük anti-bot baskısı varsa
  • Veriler HTML'den doğrulanabiliyorsa

Tam tarayıcı otomasyonu kullanın:

  • Sayfalar JavaScript ile render ediliyorsa
  • Giriş veya sepet işlemleri gerekiyorsa
  • Tarayıcı davranışı dönen içeriği etkiliyorsa
  • Hedef JavaScript ile açığa çıkan özellikleri kontrol ediyorsa
  • HTTP istemcileri eksik sonuçlar üretiyorsa

En iyi ekipler her ikisini de kullanır. Düşük sürtünmeli sayfaları ucuz tutar ve yüksek sürtünmeli akışlar için tam tarayıcıları ayırır.

Proxy Türü ve Parmak İzi Baskısı

İş YüküProxy TürüParmak İzi BaskısıÖnerilen Kurulum
Statik kamu sayfalarıVeri merkeziDüşükHTTP istemcisi + eşzamanlılık kontrolü
Katalog izlemeVeri merkezi veya ISPOrtaHafif istemci ile yedek tarayıcı
Yerelleştirilmiş fiyatKonutOrta ile yüksekYapışkan oturumlar + yerel hizalama
Giriş iş akışlarıKonutYüksekKalıcı tarayıcı bağlamı
Pazar yeri otomasyonuKonutYüksekHer hesap için kararlı tarayıcı profili
Yüksek sürtünme hedefleriKonut veya mobilÇok yüksekTam tarayıcı + dikkatli parmak izi kontrolü

Bu tablo bir başlangıç noktasıdır. Her kurulumu pilot verilerle doğrulayın.

Ne Ölçülmeli

Ölçmediğiniz şeyi geliştiremezsiniz.

Bu sinyalleri takip edin:

  • Başarı oranı
  • Engelleme oranı
  • CAPTCHA oranı
  • Yumuşak engelleme oranı
  • Yeniden deneme derinliği
  • Oturum hayatta kalma
  • Coğrafi doğruluk
  • Gecikme
  • CPSR

Bu Metriklerin Önemi

Başarı oranı, scraper'ın kullanılabilir çıktı alıp almadığını gösterir.

Engelleme oranı, hedefin ne kadar direnç gösterdiğini gösterir.

CAPTCHA oranı genellikle tarayıcı veya davranış sorunlarına işaret eder.

Yumuşak engelleme oranı, yüklenen ancak yanlış veya eksik veri döndüren sayfaları yakalar.

Oturum hayatta kalma, bir tarayıcı profilinin ne kadar süre güvenilir kaldığını gösterir.

CPSR, daha pahalı bir kurulumun değerli olup olmadığını belirlemeye yardımcı olur.

Eğer konut proxy'leri yeniden denemeleri azaltıyor ve geçerli çıktıyı artırıyorsa, toplam maliyeti düşürebilirler, hatta isteğe bağlı yol daha pahalı olsa bile.

Bu Hata Modlarına Dikkat Edin

IP'leri Aşırı Döndürme

IP'leri çok sık değiştirmek oturum güvenini yok edebilir.

Eğer çerezler, yerel depolama ve tarayıcı kimliği aynı kalırken IP sürekli değişiyorsa, oturum şüpheli görünebilir.

Çok Fazla Parmak İzi Sinyalini Rastgeleleştirmek

Daha fazla rastgeleleştirme her zaman daha fazla gerçekçilik anlamına gelmez.

Gerçek kullanıcılar, cihaz belleğini, yazı tiplerini, saat dilimini ve ekran boyutunu her birkaç dakikada bir değiştirmez.

WebRTC'yi Görmezden Gelmek

WebRTC, proxy yoluyla çelişen ağ bilgilerini açığa çıkarabilir.

Daha derin bir analiz için, WebRTC sızıntıları konusundaki kılavuzumuzu gözden geçirin.

Birden Fazla Bölge İçin Tek Profil Kullanmak

Bir ülkeden çerezler ve başka bir ülkeden proxy yolları içeren bir tarayıcı profili tutarsızlıklara yol açar.

Farklı GEO'lar, hesaplar veya iş akışları için ayrı profiller kullanın.

200 Yanıtını Başarı Olarak Değerlendirmek

Bir sayfa 200 dönebilir ve yine de yanlış olabilir.

Başarıyı saymadan önce beklenen içeriği, bölgeyi, fiyatı, para birimini, kullanılabilirliği ve gerekli alanları doğrulayın.

Gerçek Dünya Senaryosu: Seyahat Fiyatlandırması

Bir seyahat veri ekibi, birden fazla bölgede uçuş fiyatlarını toplar.

Tarayıcıları, konut proxy'leri kullanır, ancak CAPTCHA oranları yüksek kalır. Proxy havuzlarını değiştirmek sorunu çözmez.

Araştırma, tüm oturumların aynı görünüm alanını, saat dilimini ve tarayıcı dilini kullandığını gösterir, hatta proxy konumu ülkeye göre değişse bile.

Çözüm, uyumlu saat dilimi, dil ve yapışkan konut oturumları ile bölgeye özgü tarayıcı bağlamları oluşturmaktır. CAPTCHA oranları düşer ve oturumun hayatta kalması iyileşir.

Ders: proxy tek sorun değildi. Tarayıcı profili rotayı eşleştirmeliydi.

Gerçek Dünya Senaryosu: Pazar İzleme

Bir e-ticaret ekibi, pazar ürün sayfalarını izler.

Statik ürün sayfaları, veri merkezi yolları ve HTTP istemcileri ile çalışır. Ancak dinamik içerikli teklif sayfaları render edildikten sonra başarısız olur.

Tüm sistemi tarayıcılara ve konut IP'lerine taşımak yerine, ekip hattı segmentlerine ayırır.

Basit sayfalar daha düşük maliyetli yollar kullanmaya devam eder. Yüksek sürtünmeli sayfalar, tutarlı profiller ve konut oturumları ile tarayıcı otomasyonuna geçer.

Bu, israfı azaltırken zor sayfalardaki kapsama alanını artırır.

Sıkça Sorulan Sorular

Proxy'ler tarayıcı parmak izlerini gizler mi?

Hayır. Proxy'ler IP, ASN ve konum gibi ağdan görünen sinyalleri değiştirir. Tarayıcı parmak izleri, Kullanıcı-Ajanı, yazı tipleri, WebGL, TLS davranışı, saat dilimi ve otomasyon sinyalleri dahil olmak üzere istemci ortamından gelir.

Her istekte Kullanıcı-Ajanı'nı döndürmeli miyim?

Genellikle hayır. Kullanıcı-Ajanı'nı çok sık döndürmek tutarsız oturumlar yaratabilir. Her tarayıcı oturumu için bir makul Kullanıcı-Ajanı kullanın ve yeni bir oturum profili başlatmadıkça stabil tutun.

Başsız mod her zaman tespit edilir mi?

Hayır, ancak kötü yapılandırılmış başsız tarayıcılar daha kolay tespit edilir. Eksik eklentiler, WebDriver bayrakları, garip görünüm alanı değerleri veya uyumsuz tarayıcı özellikleri riski artırabilir.

Parmak izinin engellere neden olup olmadığını nasıl anlarım?

Proxy'ye özel değişiklikleri tarayıcıya özel değişikliklerle karşılaştırın. Yeni IP'ler hala başarısız oluyorsa ancak gerçek tarayıcı oturumları sonuçları iyileştiriyorsa, parmak izi muhtemelen etkili oluyordur.

Korunan siteler için konut proxy'leri yeterli mi?

Kendiliğinden değil. Konut proxy'leri ağ güvenini artırabilir, ancak tarayıcı kimliği, çerezler, WebRTC ve davranışın tutarlı olması gerekir.

CPSR'yi daha çok ne etkiler: proxy türü mü yoksa parmak izi kalitesi mi?

Hedef zorluğuna bağlıdır. Düşük sürtünmeli sitelerde, proxy türü ve eşzamanlılık baskın olabilir. Korunan sitelerde, parmak izi kalitesi başarılı çıktı ve yeniden deneme maliyeti üzerinde daha büyük bir etkiye sahip olabilir.

Kazıma için anti-tespit tarayıcıları kullanmalı mıyım?

Oturum yoğun, hesap bazlı veya coğrafi olarak hassas iş akışları için yardımcı olabilirler. Basit kamu kazıma için daha az gereklidirler. Tarayıcı kimliği yönetiminin iş akışının gerçek bir parçası olduğu durumlarda kullanın.

Son Düşünceler

Web kazıma için tarayıcı parmak izi, yalnızca bir proxy sorunu değildir. Proxiler IP itibarını, coğrafi yönlendirmeyi, ASN karışımını ve eşzamanlılığı yönetir. Tarayıcı parmak izleri, isteğin arkasındaki istemciyi ortaya çıkarır.

En iyi kazıma sistemleri, her iki katmanı birlikte ayarlar.

Engellerin proxy yolundan mı yoksa tarayıcı kimliğinden mi geldiğini belirleyerek başlayın. Ardından proxy konumunu, tarayıcı ayarlarını, oturum sürekliliğini, WebRTC davranışını ve izleme metriklerini hizalayın.

Daha fazla uygulama yardımı için, SquidProxies'in proxy eğitimlerine ve daha geniş proxy kullanım senaryolarına göz atarak proxy stratejisini üretim kazıma iş akışlarıyla birleştirin.

Yazar Hakkında

Elena Kovacs

Elena Kovacs works at the intersection of data strategy and proxy infrastructure. She designs scalable, geo-targeted data collection frameworks for SEO monitoring, market intelligence, and AI datasets. Her writing explores how proxy networks enable reliable, compliant data acquisition at scale.