Wiedza o Internecie
W 2016 r. Google obsłużył ponad 3,2 biliona zapytań, ale wyniki wyszukiwania obejmowały jedynie ułamek dostępnych w sieci treści. Wielka część informacji pozostaje poza zasięgiem wyszukiwarek – tak zwany deep web. To ukryte zasoby, które mogą być nawet 5 000‑krotnie większe niż to, co można znaleźć tradycyjnymi metodami.
Ukryte strony można podzielić na kilka grup, zależnie od przyczyny ich niewidoczności dla robotów wyszukiwarek.
Niektóre witryny generują strony „w locie” w odpowiedzi na konkretne zapytania użytkownika. Przykładem są wyniki zakupów dostosowane do wybranych parametrów produktów. Takie dane są przechowywane w bazach i nie są indeksowane. Aby je odkryć, trzeba samodzielnie wprowadzić odpowiednie zapytanie na stronie lub skorzystać z wyszukiwarek bazodanowych, np. Bright Planet.
Strony, do których nigdzie nie prowadzi link, pozostają niewidoczne. Mogą to być tymczasowe wersje witryn w fazie rozwoju lub po prostu źle zaprojektowane serwisy. Jeśli plik został umieszczony na serwerze, ale nie ma do niego odnośnika, zarówno użytkownicy, jak i roboty nie będą go znały.
Wiele serwisów (np. serwisy subskrypcyjne) chroni zawartość za pomocą konta użytkownika. Projektanci oznaczają takie sekcje jako „noindex”, co całkowicie wyklucza je z wyników wyszukiwania. Dostęp uzyskuje się po założeniu konta i zalogowaniu.
Roboty przeszukują witrynę i indeksują jej zawartość. Właściciel może wykluczyć określone katalogi lub strony, umieszczając ich ścieżki w pliku robots.txt w katalogu głównym. Większość witryn posiada ten plik, nawet jeśli nie zawiera reguł.
Aby zobaczyć jego treść, wpisz w przeglądarce adres https://example.com/robots.txt (zamiast example.com wpisz właściwą domenę). Wiersze zaczynające się od Disallow: lub Noindex: wskazują, które części serwisu są ukryte przed wyszukiwarkami.
Poza analizą robots.txt można ręcznie przeszukiwać adresy URL. Jeśli zauważysz powtarzający się schemat nazw – np. gallery1.html, gallery2.html, gallery4.html – spróbuj otworzyć brakujący gallery3.html.
Podobnie, jeżeli strona używa katalogów (np. example.com/content/page1.html), wpisz sam katalog example.com/content/. Jeśli serwer nie zablokował listowania, przeglądarka pokaże listę plików i podkatalogów, co może ujawnić ukryte zasoby.
Kod pocztowy w Wielkiej Brytanii pełni taką samą rolę jak ZIP w USA – umożliwia szybkie sortowanie i dostarczenie listów. Brak kodu na przesyłce wydłuża czas doręczenia, ponieważ wymaga ręcznego sortowania. Dzięki kodowi pocztowemu można łatwo odnaleźć konkretne osoby, jeśli zna się ich adres.Experi
W erze informacji online kluczowe jest korzystanie ze źródeł, które są rzetelne i poparte autorytetem. Dobre strony internetowe dostarczają precyzyjnych danych, a ich autorzy są zmotywowani pasją do dzielenia się wiedzą, nie zaś komercyjnym zyskiem. Poniżej znajdziesz praktyczne wskazówki, które pom
Załóżmy, że potrzebujesz znaleźć stronę internetową konkretnej firmy. Czasem wystarczy proste wyszukiwanie, ale często przydają się katalogi online, drukowane źródła i sieci kontaktów. Krok 1 – Wyszukaj nazwę firmy Wpisz pełną lub częściową nazwę firmy w wyszukiwarkę. Jeśli nie pojawia się domena .c