rechercher dans les pdf

Bonjour,

J'ai appris qu'on pouvait avoir des scripts, tel que celui-ci
(http://www.perlfect.com/freescripts/search/) pour chercher les mots y
compris dans les pdf.

Maos comment s'y prendre pour ajouter cette fonctionnalité à SPIP ?
Quelqu'un a-t-il une idée ?
Merci d'avance
Thomas

Salut Thomas,

Il existe plusieurs moteurs de recherche capable de rechercher dans les PDF,
dans excel, word et powerpoint comme PHPdig
(PhpDig.net - French Section) ou htsearch
(http://www.htdig.org/htsearch.html) ce dernier est plus difficile à
configurer (en tout cas pour moi) ou encore mngosearch
(http://www.mnogosearch.ru/).

La difficulté réside souvent dans l'installation des librairies nécessaires
à leur fonctionnement, et donc si tu n'est pas root sur le serveur, c'est
presque impossible.
De plus, celui que tu indiques est en perl, et certains hébergeurs n'offrent
pas ce language.
Si tu es chez un hebergeur privé, alors là tu peux faire ce que tu veux.

Je vais me repencher là dessus, ça m'intéresse aussi, je ferai une contrib.
si je parviens à installer un tel moteur pour SPIP.

@+

Paul Sanches
paul@1formatik.com

"Thomas EGLI" <thomas_perso@freesurf.ch> a écrit dans le message de news:
cn9uf0$s6j$1@sea.gmane.org...

Bonjour,

J'ai appris qu'on pouvait avoir des scripts, tel que celui-ci
(http://www.perlfect.com/freescripts/search/) pour chercher les mots y
compris dans les pdf.

Maos comment s'y prendre pour ajouter cette fonctionnalité à SPIP ?
Quelqu'un a-t-il une idée ?
Merci d'avance
Thomas

--------------------------------------------------------------------------------

Salut Thomas,

Il existe plusieurs moteurs de recherche capable de rechercher dans les PDF, dans excel, word et powerpoint comme PHPdig (PhpDig.net - French Section) ou htsearch (http://www.htdig.org/htsearch.html) ce dernier est plus difficile à configurer (en tout cas pour moi) ou encore mngosearch (http://www.mnogosearch.ru/).

tout ces softs sont basé sur le même principe, ils utilisent une appli pour lire les PDF (pdf2txt) et les words (catdoc ou antiword)

La difficulté réside souvent dans l'installation des librairies nécessaires à leur fonctionnement, et donc si tu n'est pas root sur le serveur, c'est presque impossible.
De plus, celui que tu indiques est en perl, et certains hébergeurs n'offrent pas ce language.
Si tu es chez un hebergeur privé, alors là tu peux faire ce que tu veux.

Je vais me repencher là dessus, ça m'intéresse aussi, je ferai une contrib. si je parviens à installer un tel moteur pour SPIP.

Le but n'est pas d'installé un moteur par dessus Spip, mais dans Spip. L'architecture du moteur de recherche est suffisement souple pour intégrer ça.
Donc oui c'est possible, oui ça marche ici,
J'ai proposé du code sur spip-dev.
Ce qui manque, c'est un extracteur de PDF en PHP qui marche bien, là j'ai des pétouilles avec les retours à la ligne. Avec cet extracteur, il sera possible d'indexer du PDF, du RTF et les formats d'openOffice. Pour les autres, il faut forcement des binaires pour les lires.

M.

Salut mathieu,

Je trouve pas ton lien vers le code?

Merci,

Paul Sanches
paul@1formatik.com

"Mathieu Lecarme" <mlecarme@linagora.com> a écrit dans le message de news:
41989D6C.4050706@linagora.com...

Salut Thomas,

Il existe plusieurs moteurs de recherche capable de rechercher dans les
PDF,
dans excel, word et powerpoint comme PHPdig
(PhpDig.net - French Section) ou htsearch
(http://www.htdig.org/htsearch.html) ce dernier est plus difficile à
configurer (en tout cas pour moi) ou encore mngosearch
(http://www.mnogosearch.ru/).

tout ces softs sont basé sur le même principe, ils utilisent une appli
pour lire les PDF (pdf2txt) et les words (catdoc ou antiword)

La difficulté réside souvent dans l'installation des librairies nécessaires
à leur fonctionnement, et donc si tu n'est pas root sur le serveur, c'est
presque impossible.
De plus, celui que tu indiques est en perl, et certains hébergeurs
n'offrent
pas ce language.
Si tu es chez un hebergeur privé, alors là tu peux faire ce que tu veux.

Je vais me repencher là dessus, ça m'intéresse aussi, je ferai une contrib.
si je parviens à installer un tel moteur pour SPIP.

Le but n'est pas d'installé un moteur par dessus Spip, mais dans Spip.
L'architecture du moteur de recherche est suffisement souple pour
intégrer ça.
Donc oui c'est possible, oui ça marche ici,
J'ai proposé du code sur spip-dev.
Ce qui manque, c'est un extracteur de PDF en PHP qui marche bien, là
j'ai des pétouilles avec les retours à la ligne. Avec cet extracteur, il
sera possible d'indexer du PDF, du RTF et les formats d'openOffice. Pour
les autres, il faut forcement des binaires pour les lires.

M.

Je viens de trouver le lien :
http://article.gmane.org/gmane.comp.web.spip.devel/22511

Par contre la mise en place me dépasse.
Si tu pouvais nous donner des pistes ...

Merci,

Paul Sanches
paul@1formatik.com

"Paul Sanches" <paul@1formatik.com> a écrit dans le message de news:
cna79n$jr6$1@sea.gmane.org...

Salut mathieu,

Je trouve pas ton lien vers le code?

Merci,

Paul Sanches
paul@1formatik.com

"Mathieu Lecarme" <mlecarme@linagora.com> a écrit dans le message de news:
41989D6C.4050706@linagora.com...

Salut Thomas,

Il existe plusieurs moteurs de recherche capable de rechercher dans les
PDF,
dans excel, word et powerpoint comme PHPdig
(PhpDig.net - French Section) ou htsearch
(http://www.htdig.org/htsearch.html) ce dernier est plus difficile à
configurer (en tout cas pour moi) ou encore mngosearch
(http://www.mnogosearch.ru/).

tout ces softs sont basé sur le même principe, ils utilisent une appli
pour lire les PDF (pdf2txt) et les words (catdoc ou antiword)

La difficulté réside souvent dans l'installation des librairies
nécessaires
à leur fonctionnement, et donc si tu n'est pas root sur le serveur, c'est
presque impossible.
De plus, celui que tu indiques est en perl, et certains hébergeurs
n'offrent
pas ce language.
Si tu es chez un hebergeur privé, alors là tu peux faire ce que tu veux.

Je vais me repencher là dessus, ça m'intéresse aussi, je ferai une
contrib.
si je parviens à installer un tel moteur pour SPIP.

Le but n'est pas d'installé un moteur par dessus Spip, mais dans Spip.
L'architecture du moteur de recherche est suffisement souple pour
intégrer ça.
Donc oui c'est possible, oui ça marche ici,
J'ai proposé du code sur spip-dev.
Ce qui manque, c'est un extracteur de PDF en PHP qui marche bien, là
j'ai des pétouilles avec les retours à la ligne. Avec cet extracteur, il
sera possible d'indexer du PDF, du RTF et les formats d'openOffice. Pour
les autres, il faut forcement des binaires pour les lires.

M.

--------------------------------------------------------------------------------

Paul Sanches wrote:

Je viens de trouver le lien : http://article.gmane.org/gmane.comp.web.spip.devel/22511

Par contre la mise en place me dépasse.
Si tu pouvais nous donner des pistes ...

Merci,

Dés que l'indexation PDF fonctionne en PHP, je fais un post plus joli. Là, c'etait surtout pour montrer que ça marche, et que c'est facilement intégrable dans Spip-core.

M.