Scrapy (Software)

Scrapy

Logo
Basisdaten

Entwickler Zyte Limited
Erscheinungsjahr 26. Juni 2008
Aktuelle Version 2.17.0[1]
(7. Juli 2026)
Betriebssystem Microsoft Windows[2], Linux[2], macOS[2], Berkeley Software Distribution[3]
Programmier­sprache Python[4]
Kategorie Webcrawler, Screen Scraping
Lizenz 3-Klausel-BSD[5][6]
scrapy.org, GitHub

Scrapy ([skrɛɪ̯pi̯]) ist ein „Free and Open Source“-Webcrawling- und Scraping-Framework, das in der Programmiersprache Python geschrieben wurde.[7] Ursprünglich wurde Scrapy für Webscraping designt, jedoch kann es als Allzweck-Webcrawler oder auch zur Extraktion von Daten mittels API genutzt werden. Gegenwärtig wird es von der Firma Zyte Limited (früher Scrapinghub Ltd.) betreut.

Die Architektur baut auf sogenannten Spiders auf. Dies sind in sich geschlossene Crawler, denen eine Reihe von Anweisungen gegeben werden. Nach dem Prinzip anderer „Don’t repeat yourself“-Frameworks, wie beispielsweise Django,[8] vereinfacht das Framework den Aufbau und die Skalierung von großen Crawling-Projekten, indem es Entwicklern erlaubt, den Code wiederzuverwenden. Scrapy bietet auch eine Shell, die Entwickler nutzen können, um ihre Annahmen auf das Verhalten einer Website zu testen.[9]

Einige Unternehmen und Produkte, die Scrapy nutzen, sind:[10]

Geschichte

Scrapy entstand in dem in London ansässigen E-Commerce-Unternehmen Mydeco, wo es von Angestellten von Mydeco und Insophia (ein Unternehmen für Web-Beratung, ansässig in Montevideo, Uruguay) entwickelt und betrieben wurde. Die erste Veröffentlichung fand im August 2008 unter der BSD-Lizenz statt; die Version 1.0 erschien im Juni 2015.[17] Im Jahre 2011 wurde Scrapinghub der offizielle Betreuer des Projekts.[18][19]

Einzelnachweise

  1. Release 2.17.0. 7. Juli 2026 (abgerufen am 8. Juli 2026).
  2. a b c Installation guide. (abgerufen am 9. April 2022).
  3. Scrapy. (abgerufen am 9. April 2022).
  4. The scrapy Open Source Project on Open Hub: Languages Page. In: Open Hub. (abgerufen am 18. Juli 2018).
  5. directory.fsf.org. In: Free Software Directory. (abgerufen am 26. März 2017).
  6. The scrapy Open Source Project on Open Hub: Licenses Page. In: Open Hub. (abgerufen am 18. Juli 2018).
  7. Scrapy auf GitHub
  8. Frequently Asked Questions. Abgerufen am 28. Juli 2015 (englisch).
  9. Scrapy shell. Abgerufen am 28. Juli 2015 (englisch).
  10. Scrapy | Companies using Scrapy. Abgerufen am 9. April 2022 (englisch).
  11. Eddie Bell, Jonathan Heusser: Scalable Scraping Using Machine Learning. Archiviert vom Original am 9. Oktober 2016; abgerufen am 28. Juli 2015 (englisch).  Info: Der Archivlink wurde automatisch eingesetzt und noch nicht geprüft. Bitte prüfe Original- und Archivlink gemäß Anleitung und entferne dann diesen Hinweis.@1@2Vorlage:Webachiv/IABot/talks.lystit.com
  12. Scrapy | Companies using Scrapy
  13. Andrew Montalenti: Web Crawling & Metadata Extraction in Python. (englisch).
  14. Scrapy Companies. In: Scrapy website. (englisch).
  15. Hyphe v0.0.0: the first release of our new webcrawler is out!
  16. World Govt Data site uses Django, Solr, Haystack, Scrapy and other exciting buzzwords http://bit.ly/5jU3La #opendata #datastore. (englisch).
  17. Scrapy 1.0 official release out! 19. Juni 2015; (englisch).
  18. Pablo Hoffman: List of the primary authors & contributors. 2013 (englisch, github.com [abgerufen am 18. November 2013]).
  19. Interview Scraping Hub.

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.