Vous avez trouvé « Plumatis » dans les journaux de votre serveur ? Voici qui nous sommes, ce que nous lisons, et comment nous refuser.
Plumatis est un service de rédaction pour avocats. Il propose à ses utilisateurs un diagnostic de la visibilité d’un site : l’utilisateur enregistre dans son profil l’adresse qu’il présente comme celle de son site, puis lance l’analyse d’un clic. Plumatis ne vérifie pas que ce site lui appartient.
Le robot part de cette seule adresse. Si elle redirige vers un autre site, il suit la redirection et lit cet autre site de la même façon. Il n’explore pas le web et ne revient pas de lui-même.
Il annonce toujours son nom, Plumatis, et ne se fait jamais passer pour un navigateur. Son agent, au format conventionnel des robots déclarés (celui de Googlebot), est :
Mozilla/5.0 (compatible; Plumatis/1.0; +https://www.plumatis.com)
Si votre page d’accueil répond 403 à cette forme, il refait la même requête une seule fois, sous celle-ci :
Plumatis/1.0 (+diagnostic de visibilite demande par un utilisateur; plumatis.com)
Refusé de nouveau, il s’arrête. Accepté, il lit la suite (robots.txt, mentions légales) sous cette seconde forme. Certains pare-feux refusent l’une et acceptent l’autre. Il part de l’hébergement de Plumatis, en Irlande, dont les adresses IP ne sont pas fixes.
Chaque réponse est lue sur au plus 1 000 000 caractères (environ 1 Mo), puis la connexion est coupée. Chaque requête est abandonnée après 8 secondes. Il suit au plus 5 redirections, vers les ports 80 et 443 seulement.
Si une adresse ne répond pas (domaine introuvable, délai dépassé, certificat invalide), il essaie l’autre forme du nom, avec ou sans www, puis la même adresse en http.
Il n’exécute pas de JavaScript, ne charge ni image, ni feuille de style, ni script, n’envoie aucun cookie, ne remplit aucun formulaire et ne suit aucun autre lien.
Une analyse réussie envoie au moins deux requêtes (la page d’accueil, puis robots.txt), une troisième pour les mentions légales le cas échéant, plus une par redirection : quatre, par exemple, pour un domaine qui renvoie vers sa forme www. Au pire 36.
Le relevé seul : les constats du diagnostic et le titre de la page d’accueil, raccourci. Jamais la page elle-même.
Le robot lit votre fichier robots.txt pour en rendre compte à l’utilisateur, mais ne s’y soumet pas : chaque visite est demandée par un utilisateur, comme une page qu’il ouvrirait dans son navigateur. Une règle robots.txt ne suffit donc pas à le refuser.
Répondez 403 aux requêtes dont l’en-tête User-Agent contient « Plumatis » : les deux formes le contiennent. L’analyse s’arrête, et l’utilisateur lit que votre site a refusé l’analyse automatique.
Le refus n’est pas mémorisé : une nouvelle analyse demandée enverra de nouveau ces deux requêtes, refusées de la même façon.
Pour une question ou un signalement, écrivez-nous depuis la page Contact.