なぜ WHTML を TXT に変換するのですか?
.whtml から .txt を抽出することは、インデックス作成、引用、または他のツールへの入力のために、タグ、スタイリング、スクリプトを除いた読み取り可能なテキストのみが必要な場合に便利です。
WHTML から TXT への変換方法
Pandoc OPEN-SOURCE
pandoc page.whtml -t plain -o page.txt を実行して、すべてのマークアップを取り除き、読み取り可能なプレーンテキストを出力します。
任意のテキストエディタ(リネーム)
メモ帳や VS Code でファイルを開くと生の HTML が表示されます。この方法ではマークアップが削除されずに残るため、手動でタグを削除する必要があります。
これらの形式について
品質と注意点
- すべての画像、リンク、スタイリング、レイアウトは失われ、テキストコンテンツのみが残ります。
- 生のファイルをテキストエディタで開くと HTML タグが表示されるため、クリーンな文章を得るには Pandoc やコピー&ペーストを使用してください。
- 表やリストは構造が失われたり、プレーンテキストでは不自然に改行されたりすることがあります。
よくある質問
なぜ .whtml を .txt にリネームするだけではいけないのですか?
リネームしただけでは、ファイル内のすべての HTML タグが残ったままになります。実際にマークアップを削除するには、Pandoc やコピー&ペーストが必要です。
Pandoc はリンクを保持しますか?
-t plain 出力ではリンクと画像が削除されます。リンクの URL を保持したい場合は、代わりに -t markdown を使用してください。絵文字や特殊文字は残りますか?
はい、
.txt を UTF-8 として保存すれば保持されます。Pandoc はデフォルトで UTF-8 を使用します。何もインストールせずにオフラインで行う方法はありますか?
はい、ブラウザでページを開き、表示されているテキストを任意のテキストエディタにコピーしてください。