すべての記事
Translation6 min

光学文字認識(OCR)とは?

光学文字認識が画像をテキストに変換する仕組み、精度の要因、多言語対応、翻訳ワークフローとの統合について解説します。

CAMB.AI

東京でレストランのメニューの写真を撮ります。テキストは日本語です。スマートフォンが文字を認識し、それをデジタルテキストに変換し、英語に翻訳します。そのプロセスはOCRから始まります。

光学文字認識は、テキストの画像を機械で読み取れるテキストに変換します。スキャンした文書、写真、PDFファイル、さらには動画フレーム内のテキストまで、すべて処理して含まれる単語を抽出できます。いったんデジタル化されると、テキストは検索、編集、翻訳が可能になり、静的な画像では決して実現できない方法でアクセスできるようになります。

OCRの仕組み

OCRは本質的に、「この画像にはどんなテキストがあるのか」という単純な問いに答えます。その答えを支える技術は、過去10年間で劇的に進化しました。

画像の前処理

文字認識が行われる前に、元画像には準備が必要です。OCRシステムは、明るさとコントラストを調整し、傾きと回転を補正し、ノイズとアーティファクトを除去し、画像を二値化します(白背景に黒文字へ変換します)。前処理の不備はOCRエラーの最も一般的な原因の一つであり、だからこそ画像品質は最終的な精度に大きく影響するのです。

文字と単語の認識

従来のOCRは、文字の形を既知のテンプレートのライブラリと照合していました。最新のOCRはディープラーニングモデルを使い、文脈に沿って文字を認識します。個々の文字の形だけでなく、文字がどのように組み合わさって単語になり、単語が文になるのかを理解します。ニューラルネットワークベースのOCRは、フォント、サイズ、スタイルの違い、さらには部分的な隠れにも、テンプレート照合よりもはるかにうまく対応します。

後処理と言語モデリング

生の文字認識にはエラーが生じます。後処理では言語モデルを使って明らかな誤りを修正します。「teh」は「the」に、「recieve」は「receive」になります。高度なシステムは書式も扱い、元のレイアウトから段落構造、表、見出しを復元します。

OCRの精度を左右する要因

OCRはすべてが同じではありません。抽出されたテキストが使えるものになるか、エラーだらけになるかは、いくつかの要因で決まります。

画像の品質と解像度

鮮明で高解像度のスキャンは、暗い照明下で斜めに撮影されたぼやけた写真よりも、はるかに優れたOCR結果を生み出します。本番のOCRワークフローでは、画像の取り込みを標準化する(フラットベッドスキャナー、書画カメラ、適切に設定されたスマートフォン撮影を使う)ことで、品質に起因するエラーの大半を発生前に防げます。

フォントの多様性と手書き

一般的なフォント(Arial、Times New Roman、Calibri)の印刷テキストは、最新のOCRエンジンによってほぼ完璧な精度で認識されます。装飾的なフォント、様式化されたタイポグラフィ、手書きテキストは、依然としてより難しいものです。手書き認識はディープラーニングによって大幅に向上しましたが、精度は依然として書き方の明瞭さ、言語、文字体系によって変わります。

文書レイアウトの複雑さ

1段組みのビジネスレターはOCRにとって簡単です。複数の段組み、見出し、キャプション、画像、抜粋引用のある新聞ページははるかに難しくなります。表、チェックボックス付きのフォーム、テキストとグラフィックが混在した領域を持つ文書には、単純なテキスト抽出を超えるレイアウト解析が必要です。最新のOCRシステムには、構造要素を識別して保持する文書理解モデルが含まれています。

劣化した文書や歴史的文書

退色したインク、黄ばんだ紙、折り目など、歴史的文書によく見られる損傷は、OCRを大幅に難しくします。歴史的コレクションを扱う図書館では、専用のOCRシステムに加えて手作業による修正ワークフローが必要になることがよくあります。

多言語コンテンツ向けのOCR

複数言語にまたがるテキスト認識は、文字の形の照合をはるかに超える複雑さをもたらします。

ラテン、キリル、アラビア、CJKの文字体系

文字体系のファミリーごとに固有の課題があります。ラテン文字(英語、フランス語、ドイツ語)は最も広くサポートされ、最も正確に認識されます。キリル文字(ロシア語、ウクライナ語)はよくサポートされていますが、テストの範囲は狭めです。アラビア文字は右から左へ書かれ、位置に応じて形が変わる連結文字を持ちます。中国語、日本語、韓国語(CJK)は数千の異なる文字を含み、認識の課題を根本的に大きくします。

文字体系が混在した文書

インドのビジネス文書には、英語の見出し、ヒンディー語の本文、数値データが含まれることがあります。欧州連合の文書は、同じページ上でフランス語、ドイツ語、ポーランド語を混ぜることがあります。単一の文書内で文字体系を検出して切り替えられるOCRシステムは、多言語を扱う組織にとって不可欠です。テキストが抽出されれば、CAMB.AIの翻訳ツールがそれを150以上の対象言語に変換できます。

言語固有の後処理

後処理での修正は、各対象言語について優れた言語モデルを持っているかどうかに左右されます。英語のスペルチェックは、言語モデルが成熟しているため簡単です。リソースの少ない言語のスペルチェックでは修正が少なくなり、最終的な出力により多くのエラーが残ることがあります。多言語文書向けのOCRソリューションを選ぶ際は、集計指標に頼るのではなく、言語ごとの精度を評価しましょう。

コンテンツワークフローにおけるOCR

OCRが単独で存在することはめったにありません。抽出されたテキストは、その精度に依存する後続のワークフローに送られます。

文書のデジタル化と検索

OCRの最も一般的なユースケースは、紙の文書を検索可能にすることです。契約書でいっぱいのキャビネットをスキャンしてOCRを実行すると、検索可能なデジタルアーカイブが作成されます。全文インデックス作成と組み合わせれば、従業員は特定の条項や日付を数秒で見つけられます。多言語アーカイブについては、CAMB.AIの翻訳ツールが抽出されたテキストを150以上の言語に変換できます。

翻訳とローカライゼーションのパイプライン

OCRは多言語コンテンツパイプラインの最初のステップであることがよくあります。日本語の製品マニュアルをスキャンし、OCRがテキストを抽出し、翻訳がそれを英語に変換し、CAMB.AIのTTSが翻訳されたテキストをアクセシビリティのために音声に変換できます。

アクセシビリティとコンテンツ変換

スキャンした文書は、コンテンツが画像形式に閉じ込められているため、スクリーンリーダーにはアクセスできません。OCRはそのコンテンツを解放し、支援技術が読み上げられる選択可能なテキストとして利用できるようにします。その後、CAMB.AIのTTSツールが、抽出されたテキストを視覚障害や読字困難のあるユーザーのために音声へ変換でき、EUのアクセシビリティ準拠を支援します。

データ入力とフォーム処理

保険金請求、医療記録、請求書には、いずれもデジタルシステムに取り込む必要のある構造化データが含まれています。OCRとインテリジェント文書処理を組み合わせると、フォームから特定の項目を抽出し、手作業のデータ入力を削減できます。数字を1つ読み間違えるだけで実際の金銭的影響が生じるため、精度要件は高くなります。

大規模なOCR

数千、数百万ページを処理するには、単一文書向けのOCRツールが提供する範囲を超えたインフラとワークフロー設計が必要です。

バッチ処理アーキテクチャ

大規模なOCR運用では、各段階で自動品質チェックを行いながら、文書をバッチで処理します。文書は取り込まれ、前処理され、認識され、後処理され、後続システムへルーティングされます。エラー率のモニタリングにより、エラー件数の多いバッチを人による確認のためにフラグ付けします。

大量処理における品質保証

大規模になると、すべてのページを手作業で確認するのは現実的ではありません。統計的サンプリングは、ボトルネックを生むことなく品質保証を提供します。機械学習ベースの信頼度スコアリングが信頼度の低いページをフラグ付けし、対象を絞った確認を行うことで、人の注意を最も重要な箇所に集中させます。

翻訳と音声AIとの統合

複数言語にわたってコンテンツをデジタル化、翻訳、音声化する必要がある組織にとって、OCRは入り口です。スキャンした文書はOCRによってデジタルテキストになり、CAMB.AIのWebサイト翻訳や手作業のワークフローを使って対象言語に翻訳され、CAMB.AIの音声AIを使ってアクセシビリティのために音声に変換できます。各ステップは、その前のステップの精度に依存しています。

コストの考慮事項

クラウドOCRの価格設定は、通常ページ単位または画像単位です。少量ではコストはわずかです。月に数百万ページになるとコストが積み上がり、セルフホスト型のソリューションの方が経済的になる場合があります。元画像の保存、後処理の修正、OCR出力を後続システムに接続するための統合コストも考慮に入れましょう。

OCRは、ニッチな文書管理技術から、コンテンツのデジタル化、翻訳、アクセシビリティのワークフローにおける基盤的な機能へと変わりました。多言語コンテンツパイプラインを構築する組織にとって、OCRは他のすべてを可能にする決定的な最初のステップであることがよくあります。

FAQs

Frequently Asked Questions

CAMB.AIでコンテンツをローカライズ

150以上の言語で、メディアの吹き替え・翻訳・音声化を行えます。

無料で始める