TechFormator
  • Mobile
  • Systemy
  • Sprzęt
  • Bezpieczeństwo
  • e-Marketing
  • Software
  • Newsy
  • Kontakt
  • Reklama na blogu
TechFormator
  • Mobile
  • Systemy
  • Sprzęt
  • Bezpieczeństwo
  • e-Marketing
  • Software
  • Newsy
  • Kontakt
  • Reklama na blogu
struktura linków
Marketing internetowy

Wyciąganie linków ze stron, Google Chrome XPath Scraper

17 lutego 2012

Bardzo często można natrafić na witryny zawierające zestawienia katalogów, precli, blogów dofollow czy proxy. Czasem chcielibyśmy pozyskać z takiej witryny same odnośniki. Przy kilkuset podstronach, na każdej 20-100 odnośników kopiowanie ręczne jest nierealne… chyba że ktoś ma sporo wolnego czasu i cierpliwości. Klikanie, kopiuj, wklej z wykorzystaniem notatnika ech… to nie dla nas. Znam lepszą metodę.

Do szybkiego pozyskiwania linków z odwiedzanych witryn posłuży nam przeglądarka Google Chrome wyposażona w dodatek Scraper.

Google Chrome Scraper to niepozorne narzędzie, którego celem jest pozyskiwanie konkretnych danych ze stron internetowych oraz eksport informacji do arkusza kalkulacyjnego Google Docs. Do obróbki danych domyślnie wykorzystuje wyrażenia XPath (XML Path Language), których złożoność jest o wiele mniej skomplikowana aniżeli tradycyjne wyrażenia regularne. Nie oznacza to, że XPath cierpi z powodu braku funkcjonalności, wręcz przeciwnie, jeśli chodzi o filtrowanie danych jest rewelacyjne. Nie wiem jak u Was z tym jest, ale osobiście mam odczucie, iż z pamięci o wiele łatwiej wpisać selektory XPath, niż klasyczne regułki przynależne do wyrażeń regularnych.

Uruchamiamy przeglądarkę Chrome z zainstalowanym dodatkiem Scraper i zaczynamy zabawę…

Listy katalogów, wyciąganie URL wyrażeniami XPath

Wpierw zajmiemy się katalogami. Przejdę od razu do przykładów. Pierwsze zestawienie, chyba jedno z popularniejszych www.katalogiseo.info

Chrome URL Scraper

Wchodzimy na stronę, wywołujemy menu kontekstowe i wybieramy Scrape similar. Normalnie powinniśmy zaznaczyć wybrany tekst (link) i dopiero wtedy dokonać wyboru opcji, w przypadku zaawansowanego scrapingu to jest zbędne, albowiem regułkę i tak będzie trzeba zdefiniować od zera.

Mamy wywołany moduł Scraper, w lewej części okna znajdziemy pole XPath Reference, w którym to należy wpisać wyrażenie służące do wydobywania linków ze strony.

Lista katalogów

Aby zbudować wyrażenie warto przejść do kodu źródłowego i zobaczyć co w trawie piszczy. Do inspekcji danego fragmentu użyjemy Firebug. Zaznaczamy pierwsze od góry hiperłącze do katalogu i z menu kontekstowego wybieramy Inspect with Firebug Lite.

Interesuje nas hierarchia znaczników, co w czym się znajduje, co jaką klasą jest oznaczone. To pozwoli sprecyzować, który element witryny należy wyodrębnić.

Dla www.katalogiseo.info przykładowe wyrażenie XPath ma postać…

//table/tbody/tr/td/a[@class='broken']

Na zrzucie ekranu kolorem żółtym zaznaczyłem, które elementy zostały wykorzystane do zbudowania wyrażenia. Nie będę opisywał schematów reguł i sposobów budowania wyrażeń, tego typu informacje znajdziecie w dokumentacji XPath.

Analiza kodu Firebug

Teoretycznie gdybym ograniczył się do wskazania /a[@class=’broken’] na wyjściu także otrzymam zestaw linków, natomiast wyznaję zasadę, czym precyzyjniej tym lepiej.

Po zbudowaniu wyrażenia wprowadzamy go w polu XPath Reference, po czym klikamy Scrape lub wciskamy klawisz ENTER. Wynikiem polecenia jest lista adresów URL.

Lista adresów katalogów

Teraz najciekawsza opcja. W prawym dolnym rogu istnieje przycisk oznaczony Export to Google Docs. Wszelkie przechwycone dane możemy łatwo zapisać do skoroszytu.

Dodatkową zaletą wtyczki jest zapamiętywanie wyrażeń (Presets). Zapisanie schematów bardzo pomaga podczas pobierania informacji z wielu stron/podstron.

W przypadku użycia funkcji CTRL+A i CTRL+V, po wklejeniu odnośników do notatnika powstanie lista numerowana, zatem aby uzyskać czyste informacje będzie trzeba obrobić dane wyrażeniami regularnymi.

Kilka innych przykładowych patternów XPath do wykorzystania:

  • www.katalogi.net.pl: //table/tbody/tr/td/a[@class=’tytul’]/@href
  • dobre-katalogi.pl: //strong/a/@href
  • autospis.pl: //div/table/tbody/tr/td/a[@class=’nazwak’]/@href
  • www.moje-katalogi.pl: //table/tbody/tr/td/table/tbody/tr/td/font[@color=’#0000FF’]

Pozyskiwanie linków z wyników wyszukiwania

Metodę można zastosować dla wyników wyszukiwania. Przykładowe wyrażenie XPath pobierające z Google adresy URL:

//div/div/ol/li/div/h3[@class='r']/a/@href

Dla wyszukiwarki Bing…

//div[@class='sb_tlst']/h3/a/@href

Dla Blekko…

//li/div/h2[@class='title']/a/@href

Czasem aby pobrać pewne informacje ze strony nie ma sensu stosować wyspecjalizowanych automatów. Niniejszą metodę wyodrębniania odnośników przedstawiłem jako ciekawostkę.

🚀 Chcesz opanować więcej ukrytych funkcji i rozwiązać inne cyfrowe problemy? Na blogu TechFormator.pl czekają na Ciebie dziesiątki poradników, które podniosą Twoje umiejętności IT. Wskakuj po kolejną dawkę wiedzy!

Przeczytaj także...

Masowa wysyłka SMS w e-commerce – kiedy i jak działa najlepiej?

robot pisze

4 fundamentalne zasady przy dodawaniu stron do katalogów

Bezpieczny m-commerce

Bezpieczeństwo w m-commerce – jak kupować przez telefon, by nie stracić oszczędności życia

płatności online

Dlaczego w erze Apple Pay i portfeli kryptowalut użytkownicy nadal wybierają PayPal

content marketing

Lista stron akceptujących wpisy gościnne

na laptopie

SE Auditor – kolejne darmowe narzędzie do analizy SEO

zlinkowana kula ziemska

FeedBurner i CommentLuv, przekazywanie mocy linków

zakupy na mobile

Zakupy na urządzeniach mobilnych – przyszłość m-sklepów

porównanie dokumentów

Porównywanie 2 list, wyszukiwanie wspólnych elementów (Disavow)

marketing napis na laptopie

Co to jest marketing internetowy?

seo search engine optimization

Bezpłatny audyt SEO – wady i zalety

powrót do szkoły

Warsztaty Akademia Sempai: AdWords – Częstochowa (poziom podstawowy i średnio-zaawansowany)

O autorze

Mariusz Kołacz

Z zawodu mgr inż. informatyk, zwolennik nowoczesnych technologii i fan Nikoli Tesla. Prowadzi kilka blogów o tematyce technologicznej. Po godzinach lubi przeczytać dobrą książkę, pozwiedzać ciekawe miejsca w Polsce lub spędzić wolny czas na łonie natury.

14 komentarzy

  • Golum pisze:
    17 lutego 2012 o 19:37

    Nie znałem dodatku, ale świetnie się nadaje do budowania list katalogów.
    Świetny art. Dzięki.

  • Denis pisze:
    17 lutego 2012 o 22:10

    Korzystam z dodatku już jakiś czas i najbardziej podoba mi się funkcja eksportu do Google Docs, bo tam w chmurze mam wszelkie pliki.

    Jedynie co to wiele osób może mieć problem z konfiguracją dodatku, ale tak jest idealne.

  • Radek pisze:
    20 lutego 2012 o 22:36

    Dopiero jakiś czas jestem szczęśliwym użytkownikiem Chrome i coraz bardziej mnie to cieszy. Dodatek jak najbardziej się przyda, świetna sprawa. W ogóle widziałem kilka innych ciekawych artykułów, które jutro na spokojnie będę musiał przeczytać.

    Dzięki, pozdrawiam.

    • Mariusz Kołacz pisze:
      21 lutego 2012 o 09:53

      Dodatki XPath do Firefox również są więc porada jest uniwersalna. Natomiast Scraper dla Google Chrome jest na tyle funkcjonalny, że postanowiłem opisać ten wariant.

    • Radek pisze:
      21 lutego 2012 o 10:00

      Mam świadomość że do Firefoksa również są tego rodzaju dodatki, aczkolwiek nie tak dawno przesiadłem się na Chrome ze względu na dziwny problem z wydajnością FF. Do tego czasu głównie korzystałem właśnie z FF no a reszta przeglądarek okazjonalnie. Odkąd jednak w FF zaczęły się problemy to zmieniłem przeglądarkę (i dotychczasowe przyzwyczajenie) bo bardzo cenię sobie komfort pracy.
      Pozdrawiam i idę przejrzeć pozostałe artykuły.

    • Mariusz Kołacz pisze:
      21 lutego 2012 o 10:09

      To prawda, nawet optymalizacja Firefox nic już nie pomaga. Ostatnio proces firefox.exe zjadł u mnie prawie 2 giga ramu musiałem ubić żeby nie wykończyć systemu. Coraz nowsze wersje wychodzą a wciąż nie rozwiązano problemu. Dlatego podobnie jak Ty coraz częściej korzystam z Chrome – jedyna słuszna alternatywa dla pozycjonerów. Opera byłaby dobra ale za mało skryptów (dodatków) SEO jest dla niej.

  • Oprogramowanie pisze:
    6 marca 2012 o 07:36

    Super , nie miałem pojęcia o tym dodatku , serdeczne dzięki za poradnik .Pozdrawiam .

    Denis , możesz napisać coś więcej o konfiguracji dodatku ?Z góry dzięki .

  • Prawnik pisze:
    26 czerwca 2012 o 14:51

    Zainstalowałem dodatek i prawdę mówiąc nie widzę żadnej specjalnej konfiguracji, która mogłaby komuś sprawić problemy.
    A swoją drogą dodatek bardzo ciekawy. Właśnie sobie wyciągnąłem z jednej stronki około 2 tys. adresików. Super! 🙂

  • Paweł pisze:
    24 września 2012 o 09:31

    Czy jest jakieś darmowe albo płatne narzędzie, które by pozwalało wyciągać tekst umieszczony w danej klasie na stronie? Np. mam listę 50 podstron z jednego serwisu i z każdej z nich chcę wyciągnąć krótki fragment tekstu, który jest umieszczony zawsze w divie o tej samej klasie. Czy można zrobić to jakoś automatycznie?

    • Mariusz Kołacz pisze:
      24 września 2012 o 09:45

      Pewnie że da się 🙂
      Darmowego automatu nie znam dlatego musiałem wysilić się i zrobić swój program, który by automatycznie wyciągał ze stron pewne rzeczy bazując na wyrażeniach XPath. Programik prosty lecz piekielnie skuteczny, wystarczy mieć footprint xpath i można wszystko wyciągnąć.
      Być może w najbliższym czasie udostępnię program wszystkim lajkowiczom ale w okrojonej wersji bez trybu automatycznego.

      Wersję rozszerzoną (automat) mogę udostępnić wyłącznie odpłatnie lub w zamian za kilka multikodów do katalogów.

  • Mayer pisze:
    31 października 2013 o 01:05

    Ciekawy programik tylko jest jeden problem. A mianowicie przeczytajcie uprawnienia jakimi dysponuje program czy dodatek w waszym systemie. cyt „…możliwe pobieranie danych ze wszystkich twoich witryn”. Łącznie z hasłami i innymi rzeczami, których pilnujecie. Dlatego jest free. A za inne tego typu płacimy ;o)

    • Mariusz Kołacz pisze:
      2 listopada 2013 o 10:04

      @Mayer, a skąd wiesz że ma dostęp? Sprawdzałeś jak plugin komunikuje się z przeglądarką?

      W Androidzie pełno masz takich aplikacji, które instalujesz a które wymagają podwyższonych uprawnień i nikt z tego wielkiego problemu nie robi.

  • Tomek pisze:
    6 maja 2014 o 21:53

    Podany pattern XPath do wykorzystania w Serpach Googlowych coś mi teraz w Chromie nie działa (a dotychczas działał elegancko). W tej chwili poprawnie wyciąga linki dla:
    //h3[@class=’r’]/a/@href

    Tak poza tym wielki szacun!

  • Michał Sławiński pisze:
    14 listopada 2014 o 14:40

    Teraz ten dodatek nazywa się Data Miner

Kliknij tutaj aby skomentować

Kategorie

  • Aktualności177
  • Internet i bezpieczeństwo123
  • Marketing internetowy240
  • Oprogramowanie159
  • Sprzęt219
  • Systemy operacyjne129
  • Urządzenia mobilne167

Najczęściej czytane

Samsung is OK

Samsung Galaxy A35 5G – solidny średniak czy rozczarowanie roku?

kobieta prostuje włosy

Jak wybrać najlepszą prostownicę do włosów?

seo search engine optimization

Bezpłatny audyt SEO – wady i zalety

Instalacja kina domowego

Soundbary a tradycyjne systemy kina domowego

Wyszukaj

Reklama

Poradniki IT

montaż zaślepki

Czy laptop cię słucha – monitoring dostępu do kamery i mikrofonu

window

Koniec wsparcia dla Windows 10 – co dalej?

app crash

Jak naprawić niekompatybilność aplikacji z nowym lub zaktualizowanym systemem operacyjnym

długopis

Co to jest kwalifikowany podpis elektroniczny?

Poradniki eCommerce

Black Friday 2019

10 wskazówek jak nie dać się oszukać podczas Black Friday 2023 i Cyber Monday 2023

search

Dlaczego twoja strona potrzebuje mapy witryny

analytic managers

Jak zmniejszyć współczynnik odrzuceń, czyli zwiększamy zaangażowanie użytkowników

seo rocket

Jak uniknąć błędów i pułapek podczas pozycjonowania stron internetowych w Niemczech

Porady dla eCommerce

Jeżeli chcesz przeczytać więcej z zakresu marketingu internetowego dla e-commerce, zgłębić tajniki optymalizacji, pozycjonowania stron i sklepów internetowych, technicznych zagadnieniach SEO, narzędziach wykorzystywanych do zwiększania widoczności i sprzedaży, reklamach w Google i na Facebooku oraz marketingu treści, koniecznie odwiedź blog SocialTrends.pl

O blogu TechFormator

Na blogu poruszane są tematy związane z marketingiem internetowym i nowymi technologiami. Znajdziesz tutaj poradniki o pozycjonowaniu i optymalizacji stron, recenzje narzędzi SEO, oprogramowania użytkowego dla Windows, Linux i urządzeń mobilnych, recenzje sprzętu IT oraz poradniki komputerowe.

Copyright 2026 - Blog TechFormator.pl
  • Reklama
  • Archiwum
Wykorzystujemy pliki cookies. Przeglądając stronę wyrażasz zgodę na ich wykorzystanie zgodnie z ustawieniami przeglądarki [Polityka prywatności]