Lundi 18 décembre 2006
Lors de la récente conférence Search Engine Strategies dans le froid glacial de Chicago, de nombreux Googlers ont été interrogés sur le contenu dupliqué. Nous sommes conscients des nuances et de la confusion qui entourent ce sujet, c’est pourquoi Alien Road souhaite clarifier la situation.
Qu’est-ce que le contenu dupliqué ?
Le contenu dupliqué désigne généralement des blocs de contenu substantiels, au sein d’un même domaine ou entre plusieurs domaines, qui correspondent exactement à d’autres contenus ou qui leur sont sensiblement similaires. La plupart du temps, cela est involontaire ou du moins sans intention malveillante : forums générant des pages classiques et des versions mobiles simplifiées, articles de boutique affichés (et pire encore, liés) via plusieurs URL distinctes, etc. Dans certains cas, le contenu est dupliqué sur plusieurs domaines pour tenter de manipuler le classement des moteurs de recherche ou d’attirer plus de trafic via des requêtes populaires ou de longue traîne.
Qu’est-ce qui n’est pas du contenu dupliqué ?
Bien que nous proposions
un outil de traduction pratique,
nos algorithmes ne considèrent pas le même article écrit en anglais et en espagnol comme du contenu dupliqué. De même, vous ne devriez pas vous inquiéter si des extraits occasionnels (citations ou autres) sont signalés comme contenu dupliqué.
Pourquoi Google s’intéresse-t-il au contenu dupliqué ?
Nos utilisateurs souhaitent généralement voir une diversité de contenus uniques lors de leurs recherches. À l’inverse, ils sont naturellement agacés lorsqu’ils voient essentiellement le même contenu dans les résultats de recherche. De plus, les webmasters sont déçus lorsque nous affichons une URL complexe
(example.com/contentredir?value=shorty-george〈=en) au lieu de l’URL propre qu’ils préfèrent (example.com/en/shorty-george).
Que fait Google à ce sujet ?
Lors de l’exploration et de la présentation des résultats de recherche, nous nous efforçons d’indexer et d’afficher des pages contenant des informations distinctes. Ce filtrage signifie, par exemple, que si votre site propose des versions “classique” et “imprimable” d’articles et qu’aucune n’est bloquée dans le robots.txt ou via une balise meta noindex, nous choisirons une version à lister. Dans les rares cas où nous percevons que le contenu dupliqué est utilisé dans le but de manipuler notre classement et de tromper nos utilisateurs, nous apporterons les ajustements nécessaires à l’indexation et au classement des sites concernés. Cependant, nous préférons nous concentrer sur le filtrage plutôt que sur des ajustements de classement… ainsi, dans la grande majorité des cas, le pire qui puisse arriver aux webmasters est de voir la version “la moins souhaitée” d’une page affichée dans notre index.
Comment les webmasters peuvent-ils traiter proactivement les problèmes de contenu dupliqué ?
- Bloquez de manière appropriée : Plutôt que de laisser nos algorithmes déterminer la “meilleure” version d’un document, vous pouvez nous guider vers votre version préférée. Par exemple, si vous ne souhaitez pas que nous indexions les versions imprimables de vos articles, interdisez ces répertoires ou utilisez des expressions régulières dans votre fichier robots.txt.
- Utilisez des redirections
301: Si vous avez restructuré votre site,
utilisez des redirections301
(RedirectPermanent) dans votre fichier.htaccesspour rediriger intelligemment les utilisateurs, le Googlebot et les autres robots. - Soyez cohérent : Efforcez-vous de maintenir une cohérence dans vos liens internes ; ne créez pas de liens vers
/page/,/pageet/page/index.htmsimultanément. - Utilisez des TLD : Pour nous aider à servir la version la plus appropriée d’un document, utilisez des domaines de premier niveau (TLD) chaque fois que possible pour gérer le contenu spécifique à un pays. Nous sommes plus susceptibles de savoir que
.deindique un contenu axé sur l’Allemagne, par exemple, plutôt que/deoude.example.com. - Syndiquez avec précaution : Si vous syndiquez votre contenu sur d’autres sites, assurez-vous qu’ils incluent un lien vers l’article original sur chaque article syndiqué. Même dans ce cas, notez que nous afficherons toujours la version (non bloquée) que nous jugeons la plus appropriée pour les utilisateurs lors de chaque recherche, ce qui peut correspondre ou non à la version que vous préférez.
- Utilisez la fonctionnalité de domaine préféré de la Search Console : Si d’autres sites renvoient vers le vôtre en utilisant à la fois la version avec et sans www de vos URL, vous pouvez nous indiquer la version que vous préférez voir indexée.
- Minimisez la répétition de texte standard : Par exemple, au lieu d’inclure un long texte de copyright au bas de chaque page, incluez un résumé très bref puis faites un lien vers une page contenant plus de détails.
- Évitez de publier des pages vides : Les utilisateurs n’aiment pas voir des pages “vides”, évitez donc les espaces réservés dans la mesure du possible. Cela signifie ne pas publier (ou au moins bloquer) les pages sans avis, sans annonces immobilières, etc., afin que les utilisateurs (et les robots) ne soient pas exposés à une multitude d’instances du type “Vous trouverez ci-dessous une superbe liste de toutes les opportunités de location à [insérer le nom de la ville]…” sans aucune annonce réelle.
- Comprenez votre CMS : Assurez-vous de bien connaître la manière dont le contenu est affiché sur votre site Web, en particulier s’il inclut un blog, un forum ou un système similaire qui affiche souvent le même contenu sous plusieurs formats.
- Ne vous inquiétez pas : Ne vous souciez pas trop des sites qui “scrapent” (détournent et republient) votre contenu. Bien que ce soit agaçant, il est très peu probable que de tels sites puissent impacter négativement la présence de votre site sur Google. Si vous repérez un cas particulièrement frustrant, vous pouvez déposer une
demande DMCA
pour revendiquer la propriété du contenu et nous laisser traiter le site indélicat.
En résumé, une sensibilisation générale aux problèmes de contenu dupliqué et quelques minutes de maintenance préventive réfléchie vous aideront à nous permettre de fournir aux utilisateurs un contenu unique et pertinent.
Comment nous l'appliquons
We archive Search Central announcements because client questions often trace back to a change that was announced years ago. Reading the original is faster than reconstructing it from second-hand summaries.
Services associés