Robot

Le robot de Plumatis

Vous avez trouvé « Plumatis » dans les journaux de votre serveur ? Voici qui nous sommes, ce que nous lisons, et comment nous refuser.

Pourquoi il visite votre site

Plumatis est un service de rédaction pour avocats. Il propose à ses utilisateurs un diagnostic de la visibilité d’un site : l’utilisateur enregistre dans son profil l’adresse qu’il présente comme celle de son site, puis lance l’analyse d’un clic. Plumatis ne vérifie pas que ce site lui appartient.

Le robot part de cette seule adresse. Si elle redirige vers un autre site, il suit la redirection et lit cet autre site de la même façon. Il n’explore pas le web et ne revient pas de lui-même.

Comment il se présente

Il annonce toujours son nom, Plumatis, et ne se fait jamais passer pour un navigateur. Son agent, au format conventionnel des robots déclarés (celui de Googlebot), est :

Mozilla/5.0 (compatible; Plumatis/1.0; +https://www.plumatis.com)

Si votre page d’accueil répond 403 à cette forme, il refait la même requête une seule fois, sous celle-ci :

Plumatis/1.0 (+diagnostic de visibilite demande par un utilisateur; plumatis.com)

Refusé de nouveau, il s’arrête. Accepté, il lit la suite (robots.txt, mentions légales) sous cette seconde forme. Certains pare-feux refusent l’une et acceptent l’autre. Il part de l’hébergement de Plumatis, en Irlande, dont les adresses IP ne sont pas fixes.

Ce qu’il lit, au plus

  • La page d’accueil.
  • Le fichier robots.txt, après la page d’accueil, pour dire à l’utilisateur si Google et les assistants IA peuvent la lire.
  • La page de mentions légales, seulement si un lien de la page d’accueil y mène, sur le même site, et que la page d’accueil ne cite pas le barreau de l’avocat.

Chaque réponse est lue sur au plus 1 000 000 caractères (environ 1 Mo), puis la connexion est coupée. Chaque requête est abandonnée après 8 secondes. Il suit au plus 5 redirections, vers les ports 80 et 443 seulement.

Si une adresse ne répond pas (domaine introuvable, délai dépassé, certificat invalide), il essaie l’autre forme du nom, avec ou sans www, puis la même adresse en http.

Il n’exécute pas de JavaScript, ne charge ni image, ni feuille de style, ni script, n’envoie aucun cookie, ne remplit aucun formulaire et ne suit aucun autre lien.

À quel rythme

  • Au plus 10 analyses par heure pour un même compte.
  • Un relevé fait pour un autre compte il y a moins de 10 minutes, sur la même adresse, est réutilisé au lieu de visiter à nouveau le site.
  • Sur 10 minutes, au plus 5 comptes différents peuvent faire analyser un même nom de site (avec ou sans www). Un compte de plus reçoit le relevé le plus récent, ou un refus.

Une analyse réussie envoie au moins deux requêtes (la page d’accueil, puis robots.txt), une troisième pour les mentions légales le cas échéant, plus une par redirection : quatre, par exemple, pour un domaine qui renvoie vers sa forme www. Au pire 36.

Ce qui est conservé

Le relevé seul : les constats du diagnostic et le titre de la page d’accueil, raccourci. Jamais la page elle-même.

Et votre fichier robots.txt ?

Le robot lit votre fichier robots.txt pour en rendre compte à l’utilisateur, mais ne s’y soumet pas : chaque visite est demandée par un utilisateur, comme une page qu’il ouvrirait dans son navigateur. Une règle robots.txt ne suffit donc pas à le refuser.

Comment le refuser

Répondez 403 aux requêtes dont l’en-tête User-Agent contient « Plumatis » : les deux formes le contiennent. L’analyse s’arrête, et l’utilisateur lit que votre site a refusé l’analyse automatique.

Le refus n’est pas mémorisé : une nouvelle analyse demandée enverra de nouveau ces deux requêtes, refusées de la même façon.

Nous écrire

Pour une question ou un signalement, écrivez-nous depuis la page Contact.