Proxy für Scrapy: Warum IP-Qualität über Erfolg oder Blockierung entscheidet
Ein Scrapy-Spider ist schnell geschrieben. Teuer wird es erst, wenn er nach wenigen hundert Requests nur noch Captchas, 403-Antworten oder leere Seiten zurückbekommt. Oft liegt das nicht am Code, sondern an der IP, über die die Anfragen laufen. Wer den Typ der IP richtig wählt, bekommt Daten statt Blockaden und muss nicht jede Nacht Jobs neu starten.
Datacenter-, Residential- und Mobile-Proxys im Vergleich
| Parameter | Datacenter-Proxys | Residential-Proxys | Mobile Proxys |
|---|
| ASN-Typ | hosting / business | isp | mobile / isp |
| Vertrauen | niedrig | hoch | am höchsten |
| Blockierungsrisiko | hoch | mittel | minimal |
| Geschwindigkeit | sehr hoch | hoch | mittel |
Datacenter-IPs sind schnell, scheitern aber an geschützten Zielen zuerst. Mobile Proxys sind langsamer, liefern dafür die meisten verwertbaren Antworten pro Request – und genau diese Antworten bezahlen Sie am Ende.
Typische Scrapy-Ziele mit aggressivem Antibot-Schutz
- Google SERP für Ranking-Monitoring nach Stadt und Operator
- Amazon-Produkt- und Preisseiten
- Booking.com und Flugpreis-Portale
- LinkedIn-Profile und Unternehmensseiten
Wo Residential-Proxys unter 80 % Success Rate fallen, erreichen mobile Proxys auf denselben Zielen 95–99 %. Weniger Wiederholungen bedeuten kürzere Laufzeiten und weniger verlorene Datensätze.
Wie mobile Proxys Trust Score und CGNAT für Web-Scraping nutzen
Der Vorteil mobiler IPs ist strukturell, nicht kosmetisch. Er entsteht durch die Herkunft der Adresse aus dem Netz eines echten Mobilfunkbetreibers. Für Ihr Projekt heißt das: weniger Aufwand für Captcha-Lösungen und stabilere Crawls.
Fraud Score und ASN-Klassifizierung bei Anti-Fraud-Systemen
Systeme wie DataDome, Akamai oder Cloudflare bewerten jede IP zuerst nach Netztyp. Eine mobile IP liegt typischerweise bei einem Fraud Score von 0–15 von 100, eine Datacenter-IP bei 75–100. Ihre Requests starten also mit Vorschuss an Vertrauen, statt schon vor der ersten Seite aussortiert zu werden.
CGNAT-Effekt: Warum Plattformen milde Maßnahmen statt harter Bans einsetzen
Mobilfunker teilen eine öffentliche IPv4-Adresse unter 500–5000 Kunden (Carrier-Grade NAT, RFC 6888). Wer so eine IP sperrt, sperrt tausende zahlende Nutzer mit. Deshalb reagieren Plattformen meist mit Rate Limits statt dauerhaften Bans – Ihr Spider drosselt kurz und arbeitet weiter, statt den ganzen Pool zu verlieren.
Natürliche IP-Rotation durch Handover und PDP-Context-Wechsel
In Mobilfunknetzen wechselt die IP im normalen Betrieb, etwa beim Neuaufbau der Datenverbindung. Für die Zielseite sieht eine neue Adresse deshalb wie ein gewöhnliches Smartphone aus. Rotation erzeugt so keine auffälligen Muster, sondern frische Sessions ohne Warnsignal.
Scrapy Rotating Proxy einrichten: Middleware, Authentifizierung und Sessions
Die Integration ist in wenigen Minuten erledigt. Entscheidend ist weniger der Code als die Frage, wer die Rotation steuert: Ihr Spider oder der Anbieter.
Proxy per Meta-Parameter oder Custom Middleware in settings.py setzen
- Pro Request:
request.meta["proxy"] = "http://login:passwort@ip:port" – die eingebaute HttpProxyMiddleware übernimmt den Rest. - Zentral: eine eigene Downloader-Middleware in
DOWNLOADER_MIDDLEWARES registrieren, die den Proxy für alle Requests setzt.
Pakete wie scrapy-proxies oder scrapy-rotating-proxy verwalten Listen mit vielen Proxies und sortieren tote Einträge aus. Mit einem mobilen Proxy für Scrapy, der die IP selbst wechselt, reicht oft ein einziger Endpunkt – das spart Pflegeaufwand für lange Proxy-Listen.
Pro-Tip: Setzen Sie RETRY_HTTP_CODES um 429 und 403 und kombinieren Sie das mit AutoThrottle. So verwandeln sich weiche Limits in kurze Pausen statt in verlorene URLs.
Login:Passwort vs. IP-Whitelisting für Scrapy-Requests
Login:Passwort funktioniert von jedem Server und jedem CI-Runner aus, ideal für Cloud-Deployments mit wechselnden Adressen. IP-Whitelisting spart Zugangsdaten im Code, passt aber nur zu einem Server mit fester IP. Die Wahl entscheidet, wie schnell Sie Spider auf neue Maschinen umziehen können.
Sticky Session, Rotation per Link oder Timer steuern
- Sticky Session: dieselbe IP für Login und Paginierung, damit Warenkorb oder Suchfilter nicht verloren gehen.
- Rotation per Link: Ihr Spider ruft eine URL auf und erhält eine neue IP, sobald ein Limit greift.
- Rotation per Timer: automatischer Wechsel für lange Nachtläufe ohne eigenen Steuerungscode.
Grenzen von Mobile Proxys: Was Scrapy-Scraper zusätzlich brauchen
Ein mobiler Proxy löst die IP-Ebene. Alles darüber bleibt Ihre Aufgabe – wer das weiß, plant Budget und Zeit realistisch.
Fingerprinting und TLS/JA3 als Bruchstelle jenseits der IP-Ebene
Browser-Fingerprint und TLS-Signatur (JA3/JA4) verraten ein Skript auch hinter der besten IP. Bei JavaScript-lastigen Zielen helfen Playwright mit realistischem User-Agent, zufällige Verzögerungen und menschliche Abfolgen. So verpufft die investierte IP-Qualität nicht an einer anderen Stelle.
Geschwindigkeit, Latenz und Parallelität realistisch einordnen
Rechnen Sie mit 50–300 ms Latenz und 5–50 Mbit/s. Pro Modem sind meist 1–5 parallele Verbindungen sinnvoll, daher sollte CONCURRENT_REQUESTS_PER_DOMAIN niedrig bleiben. Für HTML und JSON reicht das problemlos, für große Mediendownloads lohnen sich mobile Kanäle nicht.
Lite oder Regular: Welcher OnlineProxy-Tarif zu deinem Scrapy-Projekt passt
OnlineProxy rechnet nach Port und Zeitraum ab – 1, 7 oder 30 Tage, ohne Abrechnung pro Gigabyte. Die Preise hängen von Land und Operator ab und werden auf der Seite angezeigt. Traffic-intensive Crawls bleiben dadurch planbar.
Lite-Port für verteilte, automatisch rotierende Scraping-Jobs
Lite ist ein geteilter Port: Ein Gerät wird von bis zu 5 Nutzern verwendet, die IP wechselt automatisch alle 2–5 Minuten. Rotation und Neustart lassen sich nicht steuern. Für Massen-Parsing ohne Login bekommen Sie so laufend frische IPs, ohne eine Zeile Rotationscode zu schreiben.
Regular-Port für kontrollierte Sessions und wiederholte Logins
Regular gibt Ihnen ein komplettes Gerät für die Mietdauer: Sticky Session, Wechsel per Link oder Timer, Neustart des Geräts und priorisierter Support. Als Proxy für Scrapy mit Authentifizierung und Paginierung behält jede Session ihre IP, bis Ihr Spider selbst wechselt.
Protokolle und Authentifizierung für die Integration in Scrapy
Beide Tarife unterstützen HTTP(S) und SOCKS5 sowie Login:Passwort und IP-Whitelisting im Format ip:port:login:password. Scrapy nutzt HTTP(S) direkt, SOCKS5 steht für weitere Tools im Stack bereit. Die Anleitungen unter onlineproxy.io/de/manual verkürzen den Einstieg; der Support arbeitet rund um die Uhr mit einer angestrebten ersten Antwort innerhalb von 4 Stunden.
Scrapy Proxy Fehler, die Scraping-Projekte teuer machen
Geo-Inkonsistenz zwischen IP, Sprache und Zeitzone
Eine deutsche Mobil-IP mit Accept-Language: en-US und US-Zeitzone wirkt sofort unstimmig. Passen Sie Header, Sprache und Währung an das Land der IP an. So vermeiden Sie falsche Preise und gefälschte Suchergebnisse im Datensatz.
Fehlende IP-Prüfung: Hosting-IP statt echtem Mobile-ASN
Manche Anbieter verkaufen als „mobil“, was bei der Prüfung als hosting erscheint. Kontrollieren Sie den Name des ASN per whois, IPQualityScore oder Spur.us; der Fraud Score sollte unter 25 liegen. Eine Minute Prüfung schützt vor Wochen mit schlechten Daten.
Checkliste zur Auswahl eines seriösen Mobile-Proxy-Anbieters
- Konkrete Operatoren und Städte angegeben
- HTTP(S) und SOCKS5, beide Authentifizierungsarten
- Rotation per API, Link und Timer, einstellbare Sticky Sessions
- Transparente Abrechnung ohne versteckte GB-Kosten
- Warnsignal: Pools mit Millionen IPs ohne Operator-Angabe
Nach Ende einer bezahlten Miete schreibt OnlineProxy Cashback als Promo-Guthaben auf Ihr internes Konto gut. Eine Rückerstattung ist gemäß Refund-Policy in der ersten Stunde nach Zugangsausgabe vollständig möglich, danach abzüglich der genutzten Zeit – bei technischen Problemen wird zuerst ein Ersatz-Proxy angeboten. So testen Sie den Port am echten Ziel mit überschaubarem Risiko.