FlowhelpBot
FlowhelpBot est le robot d’indexation de flowhelp. Il lit les sites web que les clients de flowhelp ajoutent comme sources de connaissances, pour que leur assistant IA puisse répondre aux questions des visiteurs à partir de ces pages.
Quelles pages il lit
FlowhelpBot ne lit un site qu’après l’ajout de son adresse comme source de connaissances d’un assistant flowhelp, en général par le client de flowhelp qui gère cet assistant. Il ne parcourt pas le web de lui-même. flowhelp ne vérifie pas que la personne qui a ajouté l’adresse est propriétaire de ce site ; le fichier robots.txt décrit plus bas s’applique quelle que soit la personne qui l’a ajouté.
À partir de cette adresse, il cherche les pages du même site : d’abord dans les plans de site indiqués dans robots.txt et à /sitemap.xml puis, s’ils ne donnent aucune page, en suivant les liens depuis la page de départ, jusqu’à 3 clics de profondeur. Le même site signifie le même nom d’hôte, avec ou sans www. Les autres sous-domaines et les autres domaines sont ignorés, tout comme les liens vers des fichiers tels que des images, des PDF ou des archives.
Un passage sur une source de connaissances couvre au plus le nombre de pages que permet le forfait du client : 25 avec Trial, 200 avec Starter, 2 000 avec Growth et 10 000 avec Scale. Avec Enterprise, un passage couvre au plus 10 000 pages.
Il revient quand le client réentraîne l’assistant, à la main ou automatiquement chaque semaine, chaque jour ou chaque heure selon son forfait. Chaque visite repart de zéro avec robots.txt et la recherche des pages.
Ce qu’il lit devient la connaissance de l’assistant de ce client, qui s’en sert pour répondre aux questions des visiteurs. flowhelp ne s’en sert pas pour entraîner des modèles d’IA.
Comment le reconnaître
Les requêtes de FlowhelpBot lui-même, pour robots.txt, les plans de site et les pages, portent cet en-tête User-Agent :
FlowhelpBot/0.1 (+https://flowhelp.ai/bot)Chacune de ses propres requêtes suit au plus 5 redirections. La cible d’une redirection est récupérée même si elle se trouve sur un autre hôte, et robots.txt n’est pas vérifié à nouveau pour elle.
Quand une page renvoie un statut d’erreur (par exemple 403, 404 ou 5xx), demande plus de 5 redirections, est injoignable ou ne répond pas à temps, ou contient moins de 200 caractères de texte, FlowhelpBot la rouvre dans un navigateur Chromium sans interface. Ce navigateur n’envoie pas le User-Agent de FlowhelpBot mais celui de Chrome sans interface (il contient HeadlessChrome) et, comme tout navigateur, charge aussi les scripts, les feuilles de style, les images et les autres ressources de la page, y compris sur d’autres hôtes. Il ne part que d’adresses autorisées par robots.txt et suit lui-même les redirections.
robots.txt
Avant chaque passage, FlowhelpBot récupère robots.txt sur l’hôte de l’adresse ajoutée. Il suit le groupe « User-agent: FlowhelpBot », quelle que soit la casse, ou, s’il n’existe pas, le groupe « * », et ne lit aucune page que ces règles interdisent. Le fichier robots.txt lui-même et les plans de site sont récupérés quelles que soient les règles Disallow.
Si ce groupe fixe un Crawl-delay, FlowhelpBot attend ce délai entre les pages qu’il lit sur cet hôte, jusqu’à 30 secondes ; une valeur plus grande compte comme 30. robots.txt et les plans de site sont récupérés l’un après l’autre, sans cette pause. Sans Crawl-delay, il peut lire plusieurs pages du site en même temps.
Si robots.txt ne peut pas être lu, par exemple parce qu’il n’existe pas, que le serveur renvoie une erreur ou ne répond pas à temps, FlowhelpBot considère tout le site comme autorisé.
Pour tenir FlowhelpBot à l’écart de tout votre site, ajoutez ceci à votre robots.txt :
User-agent: FlowhelpBot
Disallow: /Pour l’écarter d’une partie du site seulement, indiquez ces chemins dans le même groupe :
User-agent: FlowhelpBot
Disallow: /account/
Disallow: /checkout/FlowhelpBot relit robots.txt au début de chaque passage, donc une nouvelle règle s’applique dès la visite suivante ; les pages déjà planifiées dans un passage en cours peuvent encore être lues. Bloquez-le dans robots.txt, pas seulement par son User-Agent sur le serveur : une page qui renvoie un statut d’erreur, y compris quand le serveur la refuse à cause du User-Agent, est rouverte dans le navigateur décrit plus haut, qui n’envoie pas le User-Agent de FlowhelpBot.
Requêtes lors de la configuration d’un assistant
Quand un client saisit l’adresse d’un site en configurant un assistant, l’application flowhelp récupère aussi cette page, et parfois l’icône vers laquelle elle pointe, pour proposer une couleur pour le widget de chat. Ces requêtes portent un autre en-tête User-Agent :
flowhelp-onboarding/1.0 (+https://flowhelp.ai)Elles ne lisent pas robots.txt et suivent au plus 3 redirections. L’icône peut se trouver sur un autre hôte. La couleur proposée est gardée en mémoire pendant 24 heures, donc le même site n’est normalement pas récupéré à nouveau pendant ce temps.
Contact
Une question, ou FlowhelpBot pose problème sur votre site ? Écrivez à hello@flowhelp.ai. Indiquez votre domaine et, si possible, l’heure des requêtes.