Przejdź do treści

FlowhelpBot

FlowhelpBot to crawler flowhelp. Czyta strony internetowe, które klienci flowhelp dodają jako źródła wiedzy, żeby ich asystent AI mógł odpowiadać odwiedzającym na podstawie tych stron.

Które strony czyta

FlowhelpBot czyta witrynę dopiero wtedy, gdy jej adres zostanie dodany jako źródło wiedzy asystenta flowhelp, zwykle przez klienta flowhelp, który tego asystenta prowadzi. Nie przeszukuje internetu na własną rękę. flowhelp nie sprawdza, czy osoba, która dodała adres, jest właścicielem tej witryny; robots.txt, opisany niżej, działa bez względu na to, kto ją dodał.

Od tego adresu szuka podstron tej samej witryny: najpierw w mapach witryny wskazanych w robots.txt i pod /sitemap.xml, a gdy te nie dadzą żadnej strony, idąc za linkami ze strony startowej, najwyżej 3 kliknięcia w głąb. Ta sama witryna to ta sama nazwa hosta, z www. albo bez. Inne subdomeny i inne domeny pomija, tak samo jak linki do plików, takich jak obrazy, PDF-y i archiwa.

Jedno przejście po źródle wiedzy obejmuje najwyżej tyle stron, ile pozwala plan klienta: 25 w planie Trial, 200 w Starter, 2000 w Growth i 10 000 w Scale. W Enterprise jedno przejście obejmuje najwyżej 10 000 stron.

Wraca, gdy klient przetrenuje asystenta, ręcznie albo automatycznie co tydzień, co dzień lub co godzinę, zależnie od planu. Każda wizyta zaczyna się od nowa: od robots.txt i szukania podstron.

To, co przeczyta, staje się wiedzą asystenta tego klienta, który na jej podstawie odpowiada na pytania odwiedzających. flowhelp nie używa tego do trenowania modeli AI.

Jak go rozpoznać

Zapytania samego FlowhelpBot, o robots.txt, mapy witryny i strony, mają taki nagłówek User-Agent:

FlowhelpBot/0.1 (+https://flowhelp.ai/bot)

Każde jego własne zapytanie przechodzi najwyżej 5 przekierowań. Cel przekierowania jest pobierany także wtedy, gdy leży na innym hoście, i robots.txt nie jest dla niego sprawdzany ponownie.

Gdy strona zwraca kod błędu (na przykład 403, 404 albo 5xx), przekracza limit 5 przekierowań, nie da się z nią połączyć lub nie odpowiada na czas albo ma mniej niż 200 znaków tekstu, FlowhelpBot otwiera ją ponownie w przeglądarce Chromium bez interfejsu. Ta przeglądarka nie wysyła nagłówka User-Agent FlowhelpBot, tylko nagłówek Chrome bez interfejsu (zawiera HeadlessChrome), i jak każda przeglądarka pobiera też skrypty, style, obrazy i inne zasoby strony, także z innych hostów. Zaczyna wyłącznie od adresów, na które pozwala robots.txt, a za przekierowaniami idzie sama.

robots.txt

Przed każdym przejściem FlowhelpBot pobiera robots.txt z hosta dodanego adresu. Stosuje grupę dla User-agent: FlowhelpBot, bez względu na wielkość liter, a gdy jej nie ma, grupę dla *, i nie czyta stron, których te reguły zabraniają. Sam robots.txt i pliki map witryny pobiera niezależnie od Disallow.

Jeśli ta grupa ustawia Crawl-delay, FlowhelpBot czeka tyle między kolejnymi stronami z tego hosta, najwyżej 30 sekund; większa wartość liczy się jako 30. robots.txt i mapy witryny pobiera jedno po drugim, bez tej przerwy. Bez Crawl-delay może czytać kilka stron witryny naraz.

Jeśli robots.txt nie da się odczytać, na przykład gdy go nie ma, serwer zwraca błąd albo nie odpowiada na czas, FlowhelpBot traktuje całą witrynę jako dozwoloną.

Żeby FlowhelpBot nie czytał Twojej witryny wcale, dodaj do robots.txt:

User-agent: FlowhelpBot
Disallow: /

Żeby ominął tylko część witryny, wypisz te ścieżki w tej samej grupie:

User-agent: FlowhelpBot
Disallow: /account/
Disallow: /checkout/

FlowhelpBot czyta robots.txt od nowa na początku każdego przejścia, więc nowa reguła działa od następnej wizyty; strony już zakolejkowane w trwającym przejściu mogą jeszcze zostać przeczytane. Blokuj go w robots.txt, a nie samym nagłówkiem User-Agent na serwerze: stronę, która zwraca kod błędu, także wtedy, gdy serwer odmówił jej z powodu nagłówka User-Agent, FlowhelpBot otwiera ponownie w opisanej wyżej przeglądarce, która nie wysyła nagłówka FlowhelpBot.

Zapytania przy zakładaniu asystenta

Gdy klient wpisuje adres witryny przy zakładaniu asystenta, aplikacja flowhelp pobiera też tę stronę, a czasem ikonę, do której strona linkuje, żeby zaproponować kolor widgetu czatu. Te zapytania mają inny nagłówek User-Agent:

flowhelp-onboarding/1.0 (+https://flowhelp.ai)

Nie czytają robots.txt i przechodzą najwyżej 3 przekierowania. Ikona może leżeć na innym hoście. Zaproponowany kolor jest zapamiętywany na 24 godziny, więc w tym czasie ta sama witryna zwykle nie jest pobierana ponownie.

Kontakt

Masz pytanie albo FlowhelpBot sprawia kłopot na Twojej stronie? Napisz na hello@flowhelp.ai. Podaj domenę i, jeśli możesz, godzinę zapytań.