Générateur robots.txt pour crawlers IA
Choisissez quels crawlers IA autoriser ou bloquer, en 1 clic ou bot par bot. Sortie robots.txt, Nginx, .htaccess. Comparateur sur un site existant.
Cet outil produit un robots.txt (et ses équivalents Nginx et .htaccess) adapté à votre stratégie face aux crawlers IA, et analyse le robots.txt d'un site existant.
1. Création et fusion
Définissez votre stratégie en un clic (presets), par catégorie de bot (entraînement LLM, indexation, user-action) ou bot par bot. La sortie est fournie en trois formats : robots.txt, directives Nginx et .htaccess. Vous pouvez importer un robots.txt existant (par domaine ou en le collant) : ses blocs d'agents IA sont régénérés selon vos choix, pendant que vos autres règles (règles globales, Allow/Disallow sur des répertoires, Sitemap, autres robots) sont conservées. Le robots.txt reste éditable à la main, les règles Nginx et .htaccess se mettant à jour en conséquence. Le résultat se copie ou se télécharge.
2. Analyse d'un site
Saisissez un domaine : l'outil récupère son /robots.txt et dresse l'inventaire des crawlers IA de la veille, en séparant ceux déjà pris en compte (bloqués ou explicitement autorisés) de ceux non couverts. Les bots non couverts peuvent être ajoutés à votre configuration en un clic.
1. Choisissez un preset
2. Par type de bot
Applique l'action à tous les bots de la catégorie et les pré-sélectionne en partie 3. Les bots réglés à la main sont préservés.
3. Par bot (optionnel)
Les choix ici écrasent les choix par type. Laissez "Suivre le type" pour l'immense majorité des cas.
AddSearchBot
AgentDataBot
AgentTimes
AI2Bot
AI2Bot-DeepResearchEval
Ai2Bot-Dolma
aiHitBot
AIWebIndex
amazon-kendra
amazon-QBusiness
Amazonbot
AmazonBuyForMe
Amzn-SearchBot
Amzn-User
Andibot
Anomura
anthropic-ai
ApifyBot
ApifyWebsiteContentCrawler
Applebot
Applebot-Extended
Aranet-SearchBot
atlassian-bot
Awario
AzureAI-SearchBot
bedrockbot
bigsur.ai
BixelBot
Bravebot
Brightbot
Brightbot 1.0
BuddyBot
Bytespider
CCBot
Channel3Bot
ChatGLM-Spider
ChatGPT Agent
ChatGPT-User
Claude-Code
Claude-SearchBot
Claude-User
Claude-Web
ClaudeBot
Cloudflare-AutoRAG
CloudflareBrowserRenderingCrawler
CloudVertexBot
Code
cohere-ai
cohere-training-data-crawler
Cotoyogi
CragCrawler
Crawl4AI
Crawlspace
Cursor
Datenbank Crawler
DeepSeekBot
Devin
Diffbot
Diffbot-User
DoubaoBot
DuckAssistBot
Echobot Bot
EchoboxBot
ERNIEBot
ExaBot
ExaSearchBot
FacebookBot
facebookexternalhit
Factset_spyderbot
FirecrawlAgent
FriendlyCrawler
GeistHaus-PageFetcher
Gemini-Deep-Research
Google-Agent
Google-CloudVertexBot
Google-Extended
Google-Firebase
Google-Gemini-CLI
Google-NotebookLM
GoogleAgent-Mariner
GoogleAgent-URLContext
GoogleOther
GoogleOther-Image
GoogleOther-Video
GPTBot
HenkBot
iAskBot
iaskspider
iaskspider/2.0
ICC-Crawler
ImagesiftBot
imageSpider
img2dataset
ISSCyberRiskCrawler
kagi-fetcher
Kangaroo Bot
KeenableBot
Kimi-Agent
Kimi-SearchBot
Kimi-User
KimiBot
KlaviyoAIBot
KunatoCrawler
laion-huggingface-processor
LAIONDownloader
LCC
Lightpanda
LinerBot
Linguee Bot
LinkupBot
Manus-User
meta-externalagent
Meta-ExternalAgent
meta-externalfetcher
Meta-ExternalFetcher
meta-webindexer
MistralAI-Index
MistralAI-Training
MistralAI-User
MistralAI-User/1.0
Mozilla-Tabstack
MyCentralAIScraperBot
NagetBot
netEstate Imprint Crawler
newsai
NotebookLM
NovaAct
OAI-AdsBot
OAI-SearchBot
omgili
omgilibot
OpenAI
opencode
Operator
PanguBot
Panscient
panscient.com
Perplexity-User
PerplexityBot
PetalBot
PhindBot
Poggio-Citations
Poseidon Research Crawler
qodercli
QualifiedBot
Querit-SearchBot
QueritBot
QuillBot
quillbot.com
QwenBot
Reflectionbot
SBIntuitionsBot
Scrapy
SemrushBot-OCOB
SemrushBot-SWA
Shap-User
ShapBot
Sidetrade indexer bot
Spider
TavilyBot
Terra Cotta
TerraCotta
Thinkbot
TikTokSpider
Timpibot
TongyiBot
Trae
TwinAgent
UseAI
VelenPublicWebCrawler
WARDBot
Webzio-Extended
webzio-extended
wpbot
WRTNBot
YaK
YandexAdditional
YandexAdditionalBot
YiyanBot
YouBot
ZanistaBot
Analyser un site existant
Entrez un domaine : on récupère son /robots.txt et on liste les bots IA couverts / non couverts.