Waarom PDF naar HTML converteren?
Een PDF achter een link vereist een reader-plugin of een download; een .HTML-pagina wordt direct geïndexeerd door zoekmachines en opent in elke browser zonder plugins. Teams hebben ook HTML nodig voor CMS-workflows waarbij redacteuren inhoud moeten bijwerken zonder een PDF-editor. Toegankelijkheid is een andere drijfveer - HTML-tekst past zich aan op kleine schermen en werkt met schermlezers op manieren die een PDF met vaste pagina's niet kan.
Hoe PDF naar HTML te converteren
Command line - pdf2htmlEX CLI
Voer pdf2htmlEX document.pdf uit om een zelfstandig document.html te krijgen met via CSS gepositioneerde tekst en ingesloten lettertypen.
Adobe Acrobat PAID
Open de PDF en kies Bestand > Exporteren naar > HTML-webpagina; Acrobat slaat een HTML-bestand op plus een map met bijbehorende afbeeldingen en CSS.
Microsoft Word PAID
Open de PDF rechtstreeks in Word, ga naar Bestand > Opslaan als en kies Webpagina (htm) als uitvoerformaat.
Calibre FREE
Voeg de PDF toe aan uw bibliotheek, klik er met de rechtermuisknop op en kies Boeken converteren - stel het uitvoerformaat in op HTML.
Programma's die PDF converteren
Over deze formaten
Een PDF (Portable Document Format) is een document met een vaste lay-out dat er op elk apparaat identiek uitziet - lettertypen, afbeeldingen en lay-out zijn allemaal ingesloten. Open het…
Open .PDF details →Een HTML-bestand is een webpagina - platte tekst met markup-tags die een browser omzet in de opgemaakte pagina die u ziet. Om het te bekijken, dubbelklikt u erop en het opent in uw browser…
Open .HTML details →Kwaliteit & waar op te letten
- Geen enkele converter kan de vaste lay-out van een PDF volledig nabootsen in HTML - kolommen kunnen samensmelten, tabellen kunnen breken en voetnoten kunnen in de verkeerde volgorde verschijnen.
- Gescande PDF's produceren HTML die alleen afbeeldingsblokken bevat zonder selecteerbare tekst; voer eerst OCR uit op de PDF om een tekstlaag toe te voegen.
- pdf2htmlEX sluit lettertypen in als base64-gegevens, waardoor uitvoerbestanden groot kunnen zijn - een PDF van 2 pagina's kan resulteren in een HTML-bestand van meer dan 1 MB.
Veelgestelde vragen
Zal de HTML-uitvoer bewerkbaar zijn als een normale webpagina?
DOCX converteren en vervolgens vanuit Word opslaan als HTML.Kan ik een gescande PDF converteren en selecteerbare tekst krijgen?
Is PDF naar HTML-conversie lossless?
Werkt pdf2htmlEX op Windows?
sudo apt install pdf2htmlex) of een vooraf gebouwde Windows-binary van de GitHub-releasespagina van het project.