Perplexity respecte les directives robots.txt. Notre robot d’exploration, PerplexityBot, n’indexera pas le contenu textuel intégral ou partiel d’un site qui l’interdit via robots.txt. Toutefois, si une page est bloquée, nous pouvons toujours indexer le domaine, le titre et un bref résumé factuel.
Mon contenu sera-t-il utilisé pour l’entraînement de l’IA si je l’autorise à apparaître dans Perplexity ?
Non, PerplexityBot indexe les pages de manière similaire aux autres moteurs de recherche. Perplexity ne développe pas de modèles fondamentaux, donc votre contenu ne sera pas utilisé pour le pré-entraînement des modèles d’IA.
Pourquoi ai-je lu que les robots d’exploration de Perplexity ne respectent pas robots.txt ?
Auparavant, les utilisateurs pouvaient demander à Perplexity de résumer une URL spécifique, même si elle était bloquée par robots.txt. Cela permettait aux utilisateurs d’accéder au contenu comme s’ils l’avaient copié et collé eux-mêmes. Cependant, cette fonctionnalité a été désactivée afin d’éviter tout usage abusif.
Désormais, PerplexityBot n’explore le contenu qu’en conformité avec robots.txt.
De plus, Perplexity collabore avec des robots d’exploration tiers pour contribuer à la construction de notre index de recherche. Nous avons mis à jour nos accords afin de garantir que ces fournisseurs respectent également robots.txt, en particulier pour les sites des éditeurs d’actualités.

