Vai al contenuto

FlowhelpBot

FlowhelpBot è il crawler di flowhelp. Legge i siti web che i clienti di flowhelp aggiungono come fonti di conoscenza, perché il loro assistente IA possa rispondere alle domande dei visitatori partendo da quelle pagine.

Quali pagine legge

FlowhelpBot legge un sito solo dopo che il suo indirizzo è stato aggiunto come fonte di conoscenza di un assistente flowhelp, di solito dal cliente di flowhelp che gestisce quell’assistente. Non esplora il web di sua iniziativa. flowhelp non verifica che chi ha aggiunto l’indirizzo sia il proprietario di quel sito; il robots.txt descritto sotto vale chiunque l’abbia aggiunto.

Da quell’indirizzo cerca le pagine dello stesso sito: prima nelle sitemap indicate in robots.txt e in /sitemap.xml e, se queste non danno nessuna pagina, seguendo i link dalla pagina di partenza fino a 3 clic di profondità. Lo stesso sito significa lo stesso nome host, con o senza www. Altri sottodomini e altri domini vengono esclusi, come i link a file quali immagini, PDF e archivi.

Un passaggio su una fonte di conoscenza copre al massimo tante pagine quante ne consente il piano del cliente: 25 con Trial, 200 con Starter, 2000 con Growth e 10.000 con Scale. Con Enterprise, un passaggio copre al massimo 10.000 pagine.

Torna quando il cliente riaddestra l’assistente, a mano o in automatico ogni settimana, ogni giorno o ogni ora, a seconda del piano. Ogni visita riparte da capo con robots.txt e la ricerca delle pagine.

Quello che legge diventa la conoscenza dell’assistente di quel cliente, che la usa per rispondere alle domande dei visitatori. flowhelp non lo usa per addestrare modelli di IA.

Come riconoscerlo

Le richieste di FlowhelpBot stesso, per robots.txt, sitemap e pagine, hanno questo User-Agent:

FlowhelpBot/0.1 (+https://flowhelp.ai/bot)

Ogni sua richiesta segue al massimo 5 reindirizzamenti. La destinazione di un reindirizzamento viene scaricata anche se si trova su un altro host, e robots.txt non viene ricontrollato per essa.

Quando una pagina restituisce uno stato di errore (per esempio 403, 404 o 5xx), richiede più di 5 reindirizzamenti, non è raggiungibile o non risponde in tempo, oppure ha meno di 200 caratteri di testo, FlowhelpBot la riapre in un browser Chromium senza interfaccia. Questo browser non invia lo User-Agent di FlowhelpBot ma quello di Chrome senza interfaccia (contiene HeadlessChrome) e, come ogni browser, carica anche script, fogli di stile, immagini e altre risorse della pagina, anche da altri host. Parte solo da indirizzi consentiti da robots.txt e segue da solo i reindirizzamenti.

robots.txt

Prima di ogni passaggio, FlowhelpBot scarica robots.txt dall’host dell’indirizzo aggiunto. Segue il gruppo User-agent: FlowhelpBot, senza distinguere maiuscole e minuscole, oppure, se non c’è, il gruppo *, e non legge le pagine vietate da quelle regole. Il file robots.txt stesso e le sitemap vengono scaricati indipendentemente da Disallow.

Se quel gruppo imposta Crawl-delay, FlowhelpBot aspetta quel tempo tra una pagina e l’altra dello stesso host, fino a 30 secondi; un valore più alto vale come 30. robots.txt e le sitemap vengono scaricati uno dopo l’altro, senza quella pausa. Senza Crawl-delay può leggere più pagine del sito contemporaneamente.

Se robots.txt non si può leggere, per esempio perché non esiste, il server restituisce un errore o non risponde in tempo, FlowhelpBot considera consentito tutto il sito.

Per tenere FlowhelpBot fuori da tutto il tuo sito, aggiungi questo al tuo robots.txt:

User-agent: FlowhelpBot
Disallow: /

Per escluderlo solo da una parte del sito, elenca quei percorsi nello stesso gruppo:

User-agent: FlowhelpBot
Disallow: /account/
Disallow: /checkout/

FlowhelpBot rilegge robots.txt all’inizio di ogni passaggio, quindi una nuova regola vale dalla visita successiva; le pagine già in coda in un passaggio in corso possono ancora essere lette. Bloccalo in robots.txt, non solo tramite lo User-Agent sul server: una pagina che restituisce uno stato di errore, anche quando il server la rifiuta per via dello User-Agent, viene riaperta nel browser descritto sopra, che non invia lo User-Agent di FlowhelpBot.

Richieste durante la configurazione di un assistente

Quando un cliente inserisce l’indirizzo di un sito mentre configura un assistente, l’applicazione flowhelp scarica anche quella pagina, e a volte l’icona a cui rimanda, per proporre un colore per il widget della chat. Queste richieste hanno un User-Agent diverso:

flowhelp-onboarding/1.0 (+https://flowhelp.ai)

Non leggono robots.txt e seguono al massimo 3 reindirizzamenti. L’icona può trovarsi su un altro host. Il colore proposto viene ricordato per 24 ore, quindi in quel tempo lo stesso sito di norma non viene scaricato di nuovo.

Contatti

Hai una domanda o FlowhelpBot crea problemi sul tuo sito? Scrivi a hello@flowhelp.ai. Indica il tuo dominio e, se puoi, l’orario delle richieste.