画像やスキャンしたPDFからテキストを抽出 — 無料・非公開・ブラウザベースのOCR
- 画像またはスキャンしたPDFをアップロードする
- OCR言語と任意の前処理を選択する
- 抽出したテキストを確認、編集、エクスポートする
Proof: 14言語に対応し、クライアントサイドで処理します。ファイルがブラウザの外に出ることはありません。
写真、スクリーンショット、スキャン文書、PDFからテキストを抽出できます — サーバーへのアップロードなしで、すべてブラウザ内で完結します。
- 14言語に対応: 英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、ほか8言語。
- 複数ページのスキャンPDFに対応し、ページごとにテキストを抽出してページ区切りを付けます。
- 前処理を内蔵: グレースケールと高コントラストモードで、状態の悪いスキャンでも精度向上に役立ちます。
多くの無料OCRツールはファイルを不明なサーバーにアップロードしたり、1ページに制限したり、広告や登録の壁の裏に結果を隠したりします。このツールはWebAssemblyを使用して完全にブラウザ内で動作するため、ファイルがデバイスの外に出ることはありません。
GoogleやLibreOfficeでも使われている、同じオープンソースのOCRエンジンであるTesseract.jsを採用しています。
OCR抽出
以下に画像またはPDFをアップロードしてください。処理はブラウザ内でローカル実行されます。
画像とスキャンしたPDFからテキストを抽出する方法
1. ファイルをアップロードする
JPEG、PNG、TIFF、WebP、BMP、またはスキャンしたPDFをドラッグ&ドロップするか選択してください。20 MBまで対応しています。複数ページのPDFは最大20ページまで、出力内で明確な区切りを付けてページごとに処理されます。
2. 言語と設定を選ぶ
14言語から選択できます。状態の悪いスキャンで精度を高めるには、グレースケールまたは高コントラストの前処理を有効にしてください。
3. テキストはローカルで抽出される
Tesseract OCRエンジンはWebAssembly経由でブラウザ内で動作します。ファイルがどこかに送信されることはありません。
4. 編集してエクスポートする
抽出されたテキストを確認し、OCRの誤りがあればその場で修正した後、クリップボードにコピーするか .txt ファイルとしてダウンロードします。
OCRのベストプラクティス
高解像度のスキャンを使う
OCRの精度は解像度によって大きく向上します。300 DPI以上を目安にしてください。スキャンする場合は、利用可能な最高品質の設定を使ってください。
色あせた文字には前処理を試す
レシート、古い文書、色あせた印刷物には高コントラストモードを有効にしてください。OCRを混乱させる色付き背景にはグレースケールが役立ちます。
信頼度スコアを確認する
60%未満の信頼度スコアは、通常スキャン品質が低すぎることを意味します。より高解像度で再スキャンするか、前処理設定を調整してみてください。
共有前に結果を整える
OCRが100%正確になることはありません。特に、OCRが誤読しやすい数字、固有名詞、特殊文字は、必ず出力を確認してください。
内容に基づいて文書を整理する
文書からテキストを抽出したら、renamed.to を使って内容に基づきファイルを自動で整理・リネームできます。
最初は50件まで無料でリネームできます。クレジットカードは不要です。
よくある質問
このOCRツールの精度はどのくらいですか?
精度は画像品質によって異なります。鮮明で高解像度の印刷文字のスキャンでは、通常90-98%の精度になります。手書き文字、低解像度の画像、特殊なフォントでは精度が低くなります。難しいスキャンでは、前処理オプションを使うと結果の改善に役立ちます。
ファイルはサーバーにアップロードされますか?
いいえ。すべてのOCR処理はWebAssembly(Tesseract.js)を使ってブラウザ内でローカル実行されます。ファイルがデバイスの外に出ることはありません。唯一のネットワークリクエストは、初回利用時にOCRエンジンと言語データを公開CDNから読み込むためのものです。
対応している画像形式は何ですか?
JPEG、PNG、TIFF、WebP、BMP画像に対応しており、20ページまでのスキャンPDF文書にも対応しています。最大ファイルサイズは20 MBです。
他の言語のテキストもOCRできますか?
はい。このツールは14言語に対応しています: 英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、オランダ語、ポーランド語、ロシア語、中国語(簡体字)、日本語、韓国語、アラビア語、トルコ語です。最適な結果を得るには、OCR実行前に言語を選択してください。
OCRの精度を改善するにはどうすればよいですか?
特に効果が大きいのは次の3点です: (1) 高解像度のスキャンを使う(300+ DPI)、(2) グレースケールや高コントラストなどの前処理オプションを有効にする、(3) 文書が十分に明るく、傾いていないことを確認する。複数ページのPDFでは、各ページが個別に処理されます。