HTML一括PDF変換ソフトは、保存済みの.HTML、.HTM、.XHTMLページが格納されたフォルダを読み込み、Windows PC上でPDFを一括作成します。各ページの隣にあるリソースフォルダも自動で認識するため、画像も含めてPDFに出力されます。
「一括 HTML PDF 変換ツール」をダウンロードし、変換したい保存済みページをまとめてドラッグ&ドロップします。関連リソースのフォルダーは元の場所のままにしておいてください。ソフトがフォルダー名から自動的に判別し、各ページとセットの状態で処理を継続します。
[出力]設定内にチェックボックスがあり、その直下に[結合ファイル名]の入力欄が用意されています。ここにファイル名を入力すると、登録されたすべてのページが1つのドキュメントにまとまります。結合順序は画面上のリストの上から下への並び順に従います。ソフト側で自動ソートは行われませんので、あらかじめ希望する順序でページを追加してください。
[出力形式]にはPDFとTXTの2種類があります。ファイルの結合機能はPDF形式専用です。結合のチェックを入れたままTXTを選択した場合、結合処理は行われず、画面上に理由が表示されます。設定後、変換後のファイルを保存したい出力フォルダーを指定します。
変換がリスト順に進むにつれて、各行に処理ステータスが表示されます。正常に描画できないページがあっても処理全体が停止することはなく、該当ページのみがスキップされてマークされます。スキップされた件数は処理完了時にまとめて確認できます。
HTML形式でデータを出力する業務アプリケーションは、短時間に大量のファイルを生成します。レポーティングツールなら期間ごとに1ファイル、会計ソフトなら顧客ごとに1枚の請求書、チャットツールならスレッドごとにログが出力されます。サポートフォーラムでも、50個以上の.HTMファイルを手作業で1つずつ開いて処理していたユーザーから、マクロ等で自動化できないかという相談が見られました。ブラウザ自体にはこうした一括処理の機能は備わっていません。対象フォルダーをまとめて登録して実行するだけで、すべての変換が完了します。
一般のWebサイトから保存したページであれば、オンライン上にアップロードしても問題ありません。しかし、給与データのエクスポートや証拠開示資料、社内Wikiのダンプデータとなると話は別です。また、セキュリティ以前に実用面での問題もあります。Webフォームは単一ファイルしか受け付けないのに対し、保存したWebページはHTMLファイルと関連フォルダーで構成されているため、変換したいファイルごとに手作業でZIP圧縮しなければなりません。このフォルダーが欠けると、元のレイアウトや見た目が大きく崩れてしまいます。さらに無料のWebサービスでは、1ファイルあたり20ページまで、あるいは1時間に3回までといった制限も課されます。一括HTML・PDF変換ソフトなら手元のPC内で処理が完結し、パケット解析ツールで監視しても外部への通信は一切発生しません。
サポート掲示板では、判を押したように同じトラブルが報告されています。「Webページを変換したところ、写真があった場所に青いクエスチョンマークが表示されてしまう」という現象です。原因としては、変換ツールが ./images/header.jpg のような相対パスで指定された背景画像を解決できなかったケースもありますが、多くは単に関連フォルダーがファイルと一緒に読み込まれなかったことによります。変換時には何の警告も出ないため、完成したPDFを開いて初めて欠落に気づくことになり、その時にはすでに元ファイルを削除してしまっていることさえあります。
「すべてのページを1つのPDFに結合」にチェックを入れると、各ページがまず個別にレンダリングされ、画面の一覧に表示された順序どおりに1つのファイルへ結合されます。途中で変換に失敗したページがあっても結合処理から除外されるだけで、残りのページは正常にPDFとして出力されます。
ブラウザーで保存したWebページは、画像やスタイルシートがHTMLファイルと同じ階層のフォルダーに格納されます。このフォルダー名はブラウザーや言語環境によって、page_files、page.files、page-files、_fichiers、_dateien など様々です。本ソフトは固定の名前リストに頼るのではなく、ファイル名との規則性を判別して対象を特定するため、構造をそのまま維持してページと一緒に読み込みます。また、フォルダー内のジャンクションポイントはスキップされるため、リンクによってドライブ内の無関係なデータまで巻き込まれる心配もありません。実際に同じページを変換した場合、関連フォルダーを含めると2ページで77,415バイト、フォルダーを含めない場合は1ページで64,042バイトとなりました。
プロジェクトフォルダ、日付、元のURLに基づくスラッグなどにより、HTMLファイルは階層の深いパスに保存されがちです。パスの長さが約260文字を超えると、レンダラーは白紙を出力してしまいます。「HTML・PDF変換ソフト」はパス長が200文字に達していないかを監視し、関連リソースとともに「page.html」というシンプルなファイル名で短いパスの一時フォルダへ退避させてから処理を行います。生成されるPDFは正常に出力され、一時フォルダが表示されることもありません。
Wordからの保存時や、各種コンテンツ管理システム(CMS)から記事をエクスポートする際、.XHTML形式で出力されるケースがあります。レンダラーはこのマークアップを通常のHTMLとして処理し、退避処理の段階で拡張子を.htmlに変更するため、後続の処理で拡張子の不一致による問題が発生しません。.HTML、.HTM、.XHTMLはすべて同一のキューで処理され、同一の設定が適用されます。
「出力形式」には、2つ目の選択肢として「TXT」が用意されています。ページのデザインや装飾を取り除き、テキストデータのみを抽出します。人が目を通す文書の作成ではなく、過去3年分にわたるエクスポート済みチケットをgrep検索するような用途に適しています。なお、この形式では結合機能は適用されず、TXTファイルは1ページにつき1ファイルずつ出力されます。
HTMLの一括処理ツールの多くは、いまだにwkhtmltopdfに依存しています。しかし同プロジェクトは2023年1月2日にアーカイブされており、最終ビルド以降セキュリティパッチが提供されておらず、深刻度9.8のSSRF脆弱性(CVE-2022-35583)が残されたままです。本ソフトでは代わりに、Windows 11に標準搭載され、Windows 10にもMicrosoft Update経由で提供されるChromiumランタイム「WebView2」を使用してレンダリングを行います。一括処理の開始時に約1.9秒で一度だけ起動し、その後はドキュメント1件あたり約1秒で処理します。万が一応答しなくなったページがあっても、120秒の待機後に処理を打ち切り、自動的に次のファイルへ進みます。
明細書、請求書、定期レポートなどは、会計パッケージからHTML形式で出力されるケースが多々あります。文書管理においては、90個の関連フォルダと90ページのバラバラなファイルではなく、月ごとに1本にまとまったPDFファイルが求められます。
静的ドキュメントのビルド成果物は、各ファイルに関連アセットが紐づいたHTMLディレクトリとして構成されます。クライアント向けの校正データも同様です。これらをZIPにまとめてレビュー担当者へ送る場合、メールに「まずどのファイルを開くべきか」を書き添えなければなりません。PDF形式に変換しておけば、そうした案内をする手間も省けます。
ブラウザで調査を行うと、関連フォルダを伴う無数の保存ページがドライブに残されます。しかし、そのPCドライブはいずれ初期化や再セットアップの時期を迎えます。案件フォルダ内に日付付きのPDFとして保存しておけば、ドライブが刷新された後も手元に残り、2年後でも確実な引用資料として活用できます。
Batch HTML to PDF Converter
18.5 メガバイト
3.2
08/08/26