Help:PDF/fr

 The article PDF/fr on Wikipedia projects:
 Wikidata contains data entry Q42332 related to these Wikipedia articles.

PDF est un format de fichier pour les documents. Cette page partage quelques conseils sur l'utilisation des PDF.


Recherche des fichiers PDF dans Wikimedia Commons

Essayez le bouton de recherche ci-dessus pour limiter les résultats de recherche aux PDF. Ceci est réalisé en incluant filemime:pdf dans les mots clés de recherche.

Utiliser PDF dans les projets Wikimedia

Page

Boléro: page 2 de la partition

Habituellement c'est la page 1 du fichier PDF ou DjVu qui sert à générer la vignette. Vous pouvez choisir une page différente en l'indiquant dans le paramètre |page= : [[File:IMSLP01578-Ravel - Bolero Full Score Durand 1929.pdf|thumb|page=2|''Boléro'': page 2 de la partition]] :


Logiciel PDF

Voir la liste des logiciels PDF. Par exemple vous pouvez utiliser le logiciel libre Okular pour lire les fichiers PDF, LibreOffice Draw pour les éditer et ImageMagick pour les modifier.

Voir aussi Commons:Extracting images from PDF.

Créer des fichiers PDF

See also: Help:Converting.

Traitement d'images issues de scanners

Les images issues de scanners nécessitent généralement un certain traitement avant d'être converties en PDF ou en DJVU : recadrage, rotation, séparation, réduction de taille, conversion au format TIFF, etc. L'application open source ScanTailor-Universal est conçue à cet effet. Elle peut être téléchargée depuis la page des versions du projet.

Créer un fichier PDF à partir d'images

  • Si ImageMagick est installé, vous pouvez exécuter convert ./page*.png ./output.pdf pour convertir les images nommées par exemple page_1.png (exemple) en PDF selon le tri.
  • img2pdf, un programme en ligne de commande open source, est conçu pour convertir des images au format PDF sans perte de qualité. Il permet également de définir des métadonnées (telles que le titre et l'auteur) ainsi que la manière dont le fichier PDF généré doit être affiché par un logiciel de visualisation de PDF.

La commande suivante prendra en compte tous les fichiers du dossier actuel et les convertira en un seul PDF nommé test.pdf avec les métadonnées du titre et de l'auteur :

img2pdf --title "My First PDF" --author "Jack Example" --output test.pdf *

Notez que cela suppose que le répertoire courant ne contient ni fichiers autres que des images ni sous-dossiers. Si tous vos fichiers sources sont d'un même type, comme des JPEG, vous pouvez spécifier *.jpg comme entrée à la place. Vous pouvez également spécifier plusieurs fichiers d'entrée individuellement.

Voir img2pdf --help pour connaître tout ce que img2pdf peut faire.

img2pdf est disponible depuis le Python Package Index et figure également dans les dépôts de nombreuses distributions Linux. Un exécutable pour Windows est aussi proposé via le projet Appveyor.

La commande suivante utilisera l'outil mogrify d'ImageMagick pour convertir tous les fichiers JPEG en fichiers PDF individuels et les placer dans un sous-dossier nommé « pdf » :

mogrify -format pdf -path pdf/ *.jpg

Sur certaines distributions Linux, la politique de sécurité par défaut d'ImageMagick empêche le programme de traiter les fichiers PDF. Consultez cette question sur StackOverflow pour savoir comment modifier la politique de sécurité.

Créer un PDF à partir d'images bitonales

Les images bitonales (c'est-à-dire les images ne comportant qu'une seule nuance de noir et de blanc) constituent un moyen très efficace de stocker des documents numérisés contenant uniquement du texte ou d'autres éléments simples ne nécessitant que deux couleurs pour être représentés clairement. Une page de texte bitonale de haute qualité ne pèse généralement que quelques dizaines de kilo-octets.

Deux méthodes de compression binaire sont utilisées dans les fichiers PDF : la compression CCITT Groupe 4 (utilisée pour les télécopies) et la compression JBIG2. Cette dernière est plus efficace, mais elle soulève des questions de brevets ; par conséquent, la fonctionnalité d'encodage JBIG2 est souvent absente ou désactivée dans les logiciels de création de PDF. Il est toutefois parfois possible d'activer cette fonctionnalité en installant soi-même l'encodeur.

Il existe plusieurs outils permettant de convertir des images pour utiliser une compression bitonale. ScanTailor-Universal est un outil open source de traitement de pages numérisées capable de générer des images bitonales. ImageMagick et GraphicsMagick permettent également de réaliser cette opération grâce à l'option -threshold.

La commande ImageMagick suivante convertit tous les fichiers .jpg d'un dossier en fichiers TIF bitonaux utilisant la compression Group 4 et les place dans un dossier nommé « bitonal » :

mogrify -format tif -compress Group4 -path bitonal/ -threshold 50% *.jpg

Essayez plusieurs valeurs de -threshold pour trouver celle qui fournit les meilleurs résultats pour votre contenu.

Conversion JBIG2

OCRmyPDF est un programme en ligne de commande open source conçu principalement pour ajouter une couche de texte OCR aux fichiers PDF numérisés. L'une de ses fonctionnalités supplémentaires est sa capacité à optimiser les fichiers PDF, notamment en convertissant d'autres formats d'images bitonales au format JBIG2. Cela nécessite l'installation de l'encodeur jbig2enc. Les instructions de compilation et d'installation pour les utilisateurs de Linux sont disponibles ici, et un exécutable Windows tiers est disponible ici. La version pour MacOS distribuée via Homebrew inclut déjà jbig2enc.

Consultez ici pour savoir comment installer OCRmyPDF sous Windows. De nombreuses distributions Linux incluent un paquet OCRmyPDF dans leurs dépôts, bien que celui-ci puisse être obsolète. OCRmyPDF est également disponible sur pip.

La commande suivante utilise OCRmyPDF pour ajouter une couche de texte OCR à un fichier PDF et organise ce dernier de manière à permettre à un navigateur web de commencer à l'afficher avant qu'il ne soit entièrement téléchargé :

ocrmypdf --output-type pdf --fast-web-view 0 test.pdf test-OCR.pdf

Par défaut, OCRmyPDF optimise le PDF sans perte ; ainsi, les images bitonales sont automatiquement converties au format JBIG2 si jbig2enc est installé.

Si vous souhaitez ignorer le processus d'OCR parce que vous n'avez pas besoin d'effectuer une reconnaissance optique de caractères sur le PDF, utilisez --tesseract-timeout 0 pour sauter complètement l'étape d'OCR.

Consultez la documentation d'OCRmyPDF pour d'autres exemples d'utilisation.

Voir aussi

Category:Digitisation help/Translations Category:PDF files Category:Commons help/fr#/Translations}} Category:Commons document resources/fr#/Translations}}
Category:Commons document resources/fr Category:Commons help/fr Category:Digitisation help/Translations Category:PDF files