[SPIP Zone] plugin Sitemap pour Spip

Hello,

Petite question : le plugin Sitemap existe t’il encore et a t’il été porté pour Spip 2 ?
J’ai beau chercher sur contrib, je ne le retrouve plus, je n’ai que la contrib de Marrabeh qui date de 2005…

Merci pour vos retours :wink:


Etienne B.
http://www.loiseau2nuit.net
Fred Allen - « California is a fine place to live - if you happen to be an orange. »

On Wed, Feb 18, 2009 at 10:48 AM, L’oiseau2nuit <l.oiseau2nuit@gmail.com> wrote:

Hello,

Petite question : le plugin Sitemap existe t’il encore et a t’il été porté pour Spip 2 ?
J’ai beau chercher sur contrib, je ne le retrouve plus, je n’ai que la contrib de Marrabeh qui date de 2005…

Merci pour vos retours :wink:


Etienne B.
http://www.loiseau2nuit.net
Fred Allen - « California is a fine place to live - if you happen to be an orange. »

Pardon pour le bruit, j’ai remis la main dessus :wink:

Etienne B.
http://www.loiseau2nuit.net
George Burns - « I would go out with women my age, but there are no women my age. »

Petite question : le plugin Sitemap existe t'il encore et a t'il été porté
pour Spip 2 ?

Je suis intéressé.

Je pense qu'il suffit de faire un squelette sitemap.html, et peut-être
un pipeline notifications pour envoyer un "ping" à google et yahoo
quand on publie un nouvel article.

La question est : que mettre dans la map. Doit-elle être exhaustive ?
Dans le cas d'un site avec 100 000 articles, est-ce que c'est
intéressant de se limiter à une map des (disons) 10 000 articles les
plus récents ? Autrement dit, est-ce que les pages non signalées dans
la map ont une chance d'être tout de même indexées ?

-- Fil

Le 18 févr. 09 à 12:13, Fil a écrit :

Petite question : le plugin Sitemap existe t'il encore et a t'il été porté
pour Spip 2 ?

Je suis intéressé.

Je pense qu'il suffit de faire un squelette sitemap.html, et peut-être
un pipeline notifications pour envoyer un "ping" à google et yahoo
quand on publie un nouvel article.

La question est : que mettre dans la map. Doit-elle être exhaustive ?
Dans le cas d'un site avec 100 000 articles, est-ce que c'est
intéressant de se limiter à une map des (disons) 10 000 articles les
plus récents ? Autrement dit, est-ce que les pages non signalées dans
la map ont une chance d'être tout de même indexées ?

Je pense que le sitemap ne doit pas être trop gros.

J'étais parti sur mon site sur un sitemap complet (un simple squelette) et j'ai finalement réduit à 50 articles par rubrique (je n'ai que deux rubriques, soit 100 articles max). J'ai donné une priorité de 1 à l'accueil, 0.9 aux rubriques, et 0.5 aux articles. On pourrait affiner en faisant dépendre la priorité de l'âge, parce qu'en général les articles publiés ne sont pas modifiés, si ce n'est par leurs contenus annexes comme les forums.

Mes contenus qui ne sont pas dans le sitemap sont bien indexés eux-aussi.

-Nicolas

--
Nicolas HOIZEY

2009/2/18 Fil <fil@rezo.net>

Petite question : le plugin Sitemap existe t’il encore et a t’il été porté
pour Spip 2 ?

Je suis intéressé.

Je pense qu’il suffit de faire un squelette sitemap.html, et peut-être
un pipeline notifications pour envoyer un « ping » à google et yahoo
quand on publie un nouvel article.

La question est : que mettre dans la map. Doit-elle être exhaustive ?
Dans le cas d’un site avec 100 000 articles, est-ce que c’est
intéressant de se limiter à une map des (disons) 10 000 articles les
plus récents ? Autrement dit, est-ce que les pages non signalées dans
la map ont une chance d’être tout de même indexées ?

Il est toujours sur la zone (stable/sitemap) et il semble déjà fonctionner comme cela.

Je n’ai juste pas encore mis le nez dans le squelette pour voir ce qu’il remontait.

Côté article, ca n’est peut être pas nécéssaire en effet de tout publier, l’important je pense est déjà qu’il remonte le mieux possible la structure rubriquée du site. Après, pour les articles, je trouve que même sans lui, le ref naturel se fait déjà plutôt bien dans Spip :slight_smile:

Moi ce qui m’intéresserait en revanche, c’est de savoir ce qu’est devenue l’idée du plugin SEO évoquée par Zerax au cours de l’été : http://www.mail-archive.com/spip-zone@rezo.net/msg09617.html

Bonne journée.

Etienne B.
http://www.loiseau2nuit.net
Katharine Hepburn - « Life is hard. After all, it kills you. »

PS : désolé Fil pour la doublette, j’avais fait un single-reply.

Côté article, ca n'est peut être pas nécéssaire en effet de tout publier,
l'important je pense est déjà qu'il remonte le mieux possible la structure
rubriquée du site.

Dans la doc que j'ai lue il n'y a aucune mention de structure.
Seulement des URLs et des priorités.

Et il faut voir comment et si on peut faire un "ping"

-- Fil

Et il faut voir comment et si on peut faire un "ping"

En plus on peut paraît-il annoncer le sitemap via robots.txt
http://www.quickonlinetips.com/archives/2007/04/the-correct-way-to-add-sitemap-link-to-robotstxt-file/

Pour cela il faudrait gérer robots.txt via spip (c'est une rewriterule
à ajouter)

-- Fil

Et il faut voir comment et si on peut faire un "ping"

OK le ping se fera avec une tâche cron (enfin, "génie")
http://www.google.com/support/forum/p/Webmasters/thread?tid=405f238a342db0bd&hl=en

sur le Web on trouve :

Ask.com: http://submissions.ask.com/ping?sitemap=http%3A//www.domain.com/sitemap.xml
Google: http://www.google.com/webmasters/sitemaps/ping?sitemap=http:%3A//www.domain.com/sitemap.xml
Yahoo: http://search.yahooapis.com/SiteExplorerService/V1/updateNotification?appid=YahooDemo&url=http://www.domain.com/sitemap.xml

Apparemment il faut encore demander une AppId à Yahoo

-- Fil

Tant qu’on est sur la SEO (plus ou moins), je viens de me tester sur un fichier robots.txt

robots.txt for http://www.loiseau2nuit.net/

User-agent: *
Disallow: /tmp/couteau-suisse/
Disallow: /tmp/dump/
Disallow: /tmp/upload/
Disallow: /config/
Disallow: /ecrire/
Disallow: /lib/
Disallow: /plugins/
Disallow: /prive/
Disallow: /squelettes-dist/
Disallow: /phpinfo.php

mes rubriques tests

Disallow: /tests-et-ressources/

Est-ce que ca vous parait cohérent comme réglages ?

J’étais tenté de mettre /tmp/ tout court mais j’ai eu un doute sur le fait qu’à prioris, c’est bien les pages contenues dans /tmp/cache/ que le user-agent voit, non ?

Merci pour vos retours.


Etienne B.
http://www.loiseau2nuit.net

Katharine Hepburn - « Life is hard. After all, it kills you. »

J'étais tenté de mettre /tmp/ tout court mais j'ai eu un doute sur le fait
qu'à prioris, c'est bien les pages contenues dans /tmp/cache/ que le
user-agent voit, non ?

Non, tout tmp/ est interdit en lecture

La question c'est peut-être d'interdire aussi local/ (la recherche
d'images peut se contenter des images de IMG/)

-- Fil

Voila, un peu de lecture : http://docs.abondance.com/robots.html

Tu y es presque :slight_smile:

Pascal-JPM

________________________________________
De : L'oiseau2nuit [mailto:l.oiseau2nuit@gmail.com]
Envoyé : mercredi 18 février 2009 14:27
Cc : SPIP Zone
Objet : Re: [SPIP Zone] plugin Sitemap pour Spip

Tant qu'on est sur la SEO (plus ou moins), je viens de me tester sur un
fichier robots.txt

# robots.txt for http://www.loiseau2nuit.net/

User-agent: *
Disallow: /tmp/couteau-suisse/
Disallow: /tmp/dump/
Disallow: /tmp/upload/
Disallow: /config/
Disallow: /ecrire/
Disallow: /lib/
Disallow: /plugins/
Disallow: /prive/
Disallow: /squelettes-dist/
Disallow: /phpinfo.php

# mes rubriques tests
Disallow: /tests-et-ressources/

Est-ce que ca vous parait cohérent comme réglages ?

J'étais tenté de mettre /tmp/ tout court mais j'ai eu un doute sur le fait
qu'à prioris, c'est bien les pages contenues dans /tmp/cache/ que le
user-agent voit, non ?

Merci pour vos retours.

--
Etienne B.
http://www.loiseau2nuit.net

Katharine Hepburn - "Life is hard. After all, it kills you."

__________ Information provenant d'ESET NOD32 Antivirus, version de la base
des signatures de virus 3864 (20090218) __________

Le message a été vérifié par ESET NOD32 Antivirus.

http://www.eset.com

@Fil : Apparament, le plugin ne gère en effet pas le ping. La contrib de Marrabeh par contre semble le faire : http://www.spip-contrib.net/Sitemap-Google

Sinon, si tout /tmp est interdit en lecture, alors d’où provirennent les pages que voit le spider ???

@Pascal : merci pour le lien :wink:
Le coup des lignes blanches, c’est c** quand même, j’aime bien aérer mon code moi …

Pour le bots.txt j’avais pas pensé à /local/ effectivement, ni à un autre truc d’ailleurs :

robots.txt for http://www.loiseau2nuit.net/

User-agent: *
Disallow: /tmp/
Disallow: /config/
Disallow: /ecrire/
Disallow: /lib/
Disallow: /plugins/
Disallow: /prive/
Disallow: /local/
Disallow: /squelettes-dist/
Disallow: /phpinfo.php # Personne n’a besoin de savoir ca !!!
Disallow: /tests-et-ressources/ # Mes rubriques de tests.
User-agent: Mediapartners-Google # Recherche sur le contenu AdSense, m’en fout j’en ai pas !
Disallow : /


Etienne B.
http://www.loiseau2nuit.net
Fred Allen - « California is a fine place to live - if you happen to be an orange. »

L'oiseau2nuit a écrit :

Sinon, si tout /tmp est interdit en lecture, alors d'où provirennent les pages que voit le spider ???

ce que voit le bot ce ne sont pas les fichiers de tmp/cache/ mais ce qu'en traduit spip.php

Disallow: /phpinfo.php # Personne n'a besoin de savoir ca !!!

mais que fait-il là ?
et ?exec=info alors ! c'est du pâté ?

On Wed, Feb 18, 2009 at 3:23 PM, denisb <denisb@laposte.net> wrote:

L’oiseau2nuit a écrit :

Sinon, si tout /tmp est interdit en lecture, alors d’où provirennent les pages que voit le spider ???

ce que voit le bot ce ne sont pas les fichiers de tmp/cache/ mais ce qu’en traduit spip.php

Disallow: /phpinfo.php # Personne n’a besoin de savoir ca !!!

mais que fait-il là ?
et ?exec=info alors ! c’est du pâté ?

Arf, comment dire… je l’avais un peu squizzé celui-ci. :stuck_out_tongue:


Etienne B.
http://www.loiseau2nuit.net
Katharine Hepburn - « Life is hard. After all, it kills you. »

J'ai mis un truc un peu semblable dans le core (nécessite d'utiliser
.htaccess) : la page robots.txt est désormais générée par le squelette
robots.txt.html ; futur point d'entrée pour le plugin "robots/sitemap"
?

J'insiste déjà sur la réponse à la question que tout le monde va poser
: OUI si robots.txt existe déjà à la racine il passe en priorité sur
la version squelettisée.

# robots.txt for http://www.loiseau2nuit.net/

User-agent: *
Disallow: /tmp/couteau-suisse/
Disallow: /tmp/dump/

...

# mes rubriques tests
Disallow: /tests-et-ressources/

-- Fil

Merci Fil :slight_smile:

Par contre, je viens de constater que Ask n’a visiblement pas l’air d’encaisser les adresses de sitemap en spip.php?page=sitemap et qu’il lui faut impérativement du final en sitemap.xml ???

Comment peut-on générer ceci en Spip ??


Etienne B.
http://www.loiseau2nuit.net

Par contre, je viens de constater que Ask n'a visiblement pas l'air
d'encaisser les adresses de sitemap en spip.php?page=sitemap et qu'il lui
faut impérativement du final en sitemap.xml ???

Comment peut-on générer ceci en Spip ??

Toujours avec les RewriteRule, comme dans
http://trac.rezo.net/trac/spip/changeset/13769#file0

-- Fil

L'oiseau2nuit a écrit :

Merci Fil :slight_smile:

Par contre, je viens de constater que Ask n'a visiblement pas l'air d'encaisser les adresses de sitemap en spip.php?page=sitemap et qu'il lui faut impérativement du final en sitemap.xml ???

Comment peut-on générer ceci en Spip ??

et à propos, comment est-ce qu'on peut générer un .htaccess ?

JL

concernant http://trac.rezo.net/trac/spip/browser/spip/squelettes-dist/robots.txt.html?rev=13769

on n’interdit plus le crawl de /tmp/ finalement ???

On Mon, Feb 23, 2009 at 5:46 PM, JLuc <jluc@no-log.org> wrote:

L’oiseau2nuit a écrit :

Merci Fil :slight_smile:

Par contre, je viens de constater que Ask n’a visiblement pas l’air d’encaisser les adresses de sitemap en spip.php?page=sitemap et qu’il lui faut impérativement du final en sitemap.xml ???

Comment peut-on générer ceci en Spip ??

et à propos, comment est-ce qu’on peut générer un .htaccess ?

JL


spip-zone@rezo.net - http://listes.rezo.net/mailman/listinfo/spip-zone


Etienne B.
http://www.loiseau2nuit.net
Vince Lombardi - « Winning is habit. Unfortunately, so is losing. »

L'oiseau2nuit a écrit :

concernant
http://trac.rezo.net/trac/spip/browser/spip/squelettes-dist/robots.txt.html?rev=13769
on n'interdit plus le crawl de /tmp/ finalement ???

ben non.
ni de config/
puisqu'ils ne sont ni l'un ni l'autre accessible en http
(protégés qu'ils sont par leur .htaccess respectif)

même un robot ne peut accéder à un rép sous htaccess "deny from all"