StacklogBot

Na túto stránku ukazuje náš user agent. Je tu preto, že každý, na koho server siahneme, má právo vedieť presne, čo sme spravili a ako nás zastaviť.

Napísať nám

Kto za robotom stojí

ARLing s. r. o., Ivanská cesta 32E, 821 04 Bratislava, Slovensko. IČO 56583486, IČ DPH SK2122352100. Na poštu odpovedá jeden človek: andrej@arling.sk.

User agent

Každá naša požiadavka sa predstaví a ukáže späť na túto stránku.

StacklogBot/1.0 (+https://arling.sk/technologies/crawler/)

Čo sťahuje

  • Úvodnú stránku domény, najviac 512 KB HTML, len metódou GET.
  • robots.txt, číta sa ako prvý a drží sa 24 hodín. Keď odpovie chybou servera alebo spojenie padne, nesťahujeme vôbec nič: neprečítaný robots.txt je odmietnutie, nie súhlas.
  • sitemap.xml a manifest webovej aplikácie, metódou HEAD tam, kde to server dovolí.
  • Jednu požiadavku na náhodnú cestu, ktorá by nemala existovať, aby sme videli, či web odpovie skutočnou 404.
  • Nič iné. Žiadne POST, žiadne prihlasovanie, žiadne cookies, žiadne administračné cesty, žiadne /cpanel ani /webmail, žiadne skenovanie zraniteľností.

Ako často

V prieskume najviac raz za tridsať dní na doménu. Pri živej kontrole najviac jedno stiahnutie tej istej domény za šesťdesiat sekúnd naprieč všetkými návštevníkmi; ostatní dostanú výsledok z pamäte. Za celý prieskum robíme dokopy asi dve požiadavky za sekundu, v noci, s najviac dvoma opakovaniami a s odstupom.

Crawl-delay v robots.txt rešpektujeme do tridsiatich sekúnd.

Čo si necháme

Nálezy, ich riadky dôkazov, odtlačok odpovede a zoznam zmien. Obsah stránky si nenechávame, snímky nerobíme a neukladáme mená držiteľov domén, e-maily ani iné osobné údaje. V tomto reťazci nie je nič, z čoho by sa dal spraviť zoznam kontaktov.

Dve cesty, ako nás zastaviť, obe do 24 hodín

Pridajte si do robots.txt toto:

User-agent: StacklogBot
Disallow: /

Alebo napíšte jeden riadok na andrej@arling.sk s doménou. Tak či tak doménu odstránime do 24 hodín a API potom namiesto prehľadu odpovie opted_out. Žiadny formulár, žiadny účet, žiadny dôvod netreba.

Prečo robots.txt dodržiavame

Nie zo slušnosti. Meranie verejných stránok v EÚ stojí na výnimke pre vyťažovanie textov a dát podľa článku 4 smernice (EÚ) 2019/790, a tá platí len vtedy, keď si nositeľ práv použitie nevyhradil strojovo čitateľným spôsobom. robots.txt je práve tá výhrada, takže jeho dodržiavanie je základ nášho právneho postavenia, nie milé gesto.

Rovnako nevyťažujeme ani nepoužívame podstatnú časť cudzej databázy: naše čísla vznikajú z vlastného merania, nikdy kopírovaním cudzieho katalógu.

Skontrolovať webŠtatistikyPorovnania