Crawler
Le Crawler explore le web à votre place. Il part d’une URL de départ, parcourt les pages, suit les liens sur plusieurs niveaux de profondeur et score chaque ressource avec l’IA pour ne retenir que ce qui compte vraiment. C’est le point d’entrée de toute chaîne d’acquisition de contenu.
Dans cette page
Objectif — à quoi ça sert
Le Crawler explore le web à votre place. Il part d’une URL de départ, parcourt les pages, suit les liens sur plusieurs niveaux de profondeur et score chaque ressource avec l’IA pour ne retenir que ce qui compte vraiment. C’est le point d’entrée de toute chaîne d’acquisition de contenu.
Idéal pour la veille concurrentielle, l’indexation d’un site, la collecte de fiches fournisseurs ou la documentation interne.
- Découvre automatiquement des ressources liées à votre sujet, sans les lister à la main.
- Évalue la pertinence de chaque page (scoring IA) avant de décider de l’extraire.
- Respecte robots.txt et limite le nombre de pages / la profondeur pour rester maître du périmètre.
- Alimente ensuite les Web/File Extractors pour transformer les pages en connaissances.
Utilisation — comment s'en servir
Le Crawler se configure dans le backoffice, dans l’onglet Crawlers. Chaque crawler porte une URL de départ, un périmètre (pages max, profondeur, délai) et un prompt d’évaluation qui guide le scoring. Une fois créé, vous pouvez le lancer manuellement ou le planifier en cron.
Côté backoffice
Backoffice → Acquisition → Crawlers / Planifications
C’est ici que vous définissez la source, le périmètre et le prompt de scoring.
Créer un crawler
Backoffice → Acquisition → Crawlers → « Créer un crawler ». Donnez-lui un nom, l’URL de départ et le prompt d’évaluation.
Régler le périmètre
Limitez maxPages, maxDepth et sameDomain pour borner l’exploration.
Lancer ou planifier
Lancez-le à la demande, ou créez une planification cron depuis l’onglet « Planifications ».
À l'écran