田舎人の書斎作ったり、試したり、書き留めたり。

田舎人、後輩の困りごとをOCRで解く。

大量のPDFを一括でテキスト化するOCRアプリの製作記

公開

この記事は2022年に書いたものです。ソフトウェアのバージョンや配布状況など、いまとは異なる場合があります。

大量のPDFを一度にテキストへ変換するアプリを作り、Vectorで無料公開しました。

作ったきっかけ

仕事でプログラマーをしているのですが、職場の後輩から「PDFのテキスト化が大変で困っている」と相談されたのが始まりです。

調べてみると、PDFからテキストを取り出すのは技術的にもなかなか難しいものでした。そこで目を付けたのが、画像から文字を読み取るOCRです。

OCRにもいろいろありますが、今回はWindows 10以降に標準で入っているMicrosoftのOCRを使いました。プログラムから呼び出さないと使えないため、あまり知られていない機能です。使う人に別のソフトを入れてもらう必要がないのも利点でした。

画面と使い方

Convert PDF to text with OCRの画面。PDFを登録するリストとStartボタンがある

変換したいPDFを放り込んで、Startボタンを押すだけです。

精度について

できるだけ良くなるよう調整を重ねましたが、結局は元のPDFの状態しだいです。完璧な精度を求める用途には物足りないかもしれません。それでも、手作業を少しでも減らしたい場面では役に立つと思います。