Zum Inhalt springen

FlowhelpBot

FlowhelpBot ist der Crawler von flowhelp. Er liest Websites, die Kunden von flowhelp als Wissensquellen hinzufügen, damit ihr KI-Assistent die Fragen der Besucher anhand dieser Seiten beantworten kann.

Welche Seiten er liest

FlowhelpBot liest eine Website erst, wenn ihre Adresse als Wissensquelle eines Assistenten von flowhelp hinzugefügt wurde, in der Regel von dem Kunden von flowhelp, der diesen Assistenten betreibt. Er durchsucht das Web nicht auf eigene Faust. flowhelp prüft nicht, ob die Person, die die Adresse hinzugefügt hat, Inhaber dieser Website ist; die unten beschriebene robots.txt wirkt unabhängig davon, wer sie hinzugefügt hat.

Von dieser Adresse aus sucht er Seiten derselben Website: zuerst in den Sitemaps, die in der robots.txt angegeben sind, und unter /sitemap.xml, und wenn diese keine Seiten liefern, über Links ab der Startseite, höchstens 3 Klicks tief. Dieselbe Website heißt derselbe Hostname, mit oder ohne www. Andere Subdomains und andere Domains lässt er aus, ebenso Links auf Dateien wie Bilder, PDFs und Archive.

Ein Durchlauf über eine Wissensquelle umfasst höchstens so viele Seiten, wie der Tarif des Kunden erlaubt: 25 bei Trial, 200 bei Starter, 2.000 bei Growth und 10.000 bei Scale. Bei Enterprise umfasst ein Durchlauf höchstens 10.000 Seiten.

Er kommt wieder, wenn der Kunde den Assistenten neu trainiert, von Hand oder automatisch jede Woche, jeden Tag oder jede Stunde, je nach Tarif. Jeder Besuch beginnt von vorn mit der robots.txt und der Suche nach Seiten.

Was er liest, wird zum Wissen des Assistenten dieses Kunden, der damit die Fragen der Besucher beantwortet. flowhelp verwendet es nicht zum Training von KI-Modellen.

So erkennen Sie ihn

Anfragen von FlowhelpBot selbst, für robots.txt, Sitemaps und Seiten, tragen diesen User-Agent:

FlowhelpBot/0.1 (+https://flowhelp.ai/bot)

Jede seiner eigenen Anfragen folgt höchstens 5 Weiterleitungen. Das Ziel einer Weiterleitung wird auch dann abgerufen, wenn es auf einem anderen Host liegt, und die robots.txt wird dafür nicht erneut geprüft.

Wenn eine Seite einen Fehlerstatus liefert (zum Beispiel 403, 404 oder 5xx), mehr als 5 Weiterleitungen braucht, nicht erreichbar ist oder nicht rechtzeitig antwortet oder weniger als 200 Zeichen Text hat, öffnet FlowhelpBot sie erneut in einem Chromium-Browser ohne Oberfläche. Dieser Browser sendet nicht den User-Agent von FlowhelpBot, sondern den von Chrome ohne Oberfläche (er enthält HeadlessChrome), und lädt wie jeder Browser auch Skripte, Stylesheets, Bilder und andere Ressourcen der Seite, auch von anderen Hosts. Er startet nur bei Adressen, die robots.txt erlaubt, und folgt Weiterleitungen selbst.

robots.txt

Vor jedem Durchlauf ruft FlowhelpBot die robots.txt vom Host der hinzugefügten Adresse ab. Er befolgt die Gruppe für User-agent: FlowhelpBot, unabhängig von Groß- und Kleinschreibung, oder, falls es keine gibt, die Gruppe für *, und liest keine Seiten, die diese Regeln verbieten. Die robots.txt selbst und Sitemap-Dateien ruft er unabhängig von Disallow ab.

Legt diese Gruppe Crawl-delay fest, wartet FlowhelpBot so lange zwischen den Seiten, die er von diesem Host liest, höchstens 30 Sekunden; ein größerer Wert zählt als 30. robots.txt und Sitemaps ruft er nacheinander ohne diese Pause ab. Ohne Crawl-delay kann er mehrere Seiten der Website gleichzeitig lesen.

Lässt sich die robots.txt nicht lesen, etwa weil es sie nicht gibt, der Server einen Fehler meldet oder nicht rechtzeitig antwortet, behandelt FlowhelpBot die ganze Website als erlaubt.

Um FlowhelpBot von Ihrer gesamten Website fernzuhalten, ergänzen Sie Ihre robots.txt so:

User-agent: FlowhelpBot
Disallow: /

Um nur einen Teil der Website auszuschließen, führen Sie diese Pfade in derselben Gruppe auf:

User-agent: FlowhelpBot
Disallow: /account/
Disallow: /checkout/

FlowhelpBot liest die robots.txt zu Beginn jedes Durchlaufs neu, eine neue Regel gilt also ab dem nächsten Besuch; Seiten, die in einem laufenden Durchlauf schon eingeplant sind, können noch gelesen werden. Sperren Sie ihn über die robots.txt und nicht nur über den User-Agent auf dem Server: Eine Seite mit Fehlerstatus, auch wenn der Server sie wegen des User-Agents ablehnt, öffnet FlowhelpBot erneut im oben beschriebenen Browser, der nicht den User-Agent von FlowhelpBot sendet.

Anfragen bei der Einrichtung eines Assistenten

Wenn ein Kunde bei der Einrichtung eines Assistenten die Adresse einer Website eingibt, ruft die Anwendung von flowhelp auch diese Seite ab und manchmal das Symbol, auf das sie verweist, um eine Farbe für das Chat-Widget vorzuschlagen. Diese Anfragen tragen einen anderen User-Agent:

flowhelp-onboarding/1.0 (+https://flowhelp.ai)

Sie lesen keine robots.txt und folgen höchstens 3 Weiterleitungen. Das Symbol kann auf einem anderen Host liegen. Die vorgeschlagene Farbe wird 24 Stunden lang gespeichert, sodass dieselbe Website in dieser Zeit normalerweise nicht erneut abgerufen wird.

Kontakt

Haben Sie Fragen, oder verursacht FlowhelpBot Probleme auf Ihrer Website? Schreiben Sie an hello@flowhelp.ai. Nennen Sie Ihre Domain und, wenn möglich, die Uhrzeit der Anfragen.