C#を使用したプログラムでPDFからテキストを抽出

MESCIUS Document Solutions for PDFを使用すると、インデックス作成や検索などのためにPDFからテキストを自動的に抽出可能

C#を使用したプログラムでPDFからテキストを抽出

Document Solutions for PDF(DsPdf)は、Adobe Acrobatへの依存がない、高速で機能豊富な、.NET向けのサーバーサイドPDF APIライブラリです。DsPdfを使用すると、開発者はデスクトップおよびWebアプリケーションにおいて、AcroFormsを含むPDFドキュメントを大規模にプログラムで作成、操作、インポート/エクスポート、およびデプロイできます。 .NETの完全なサポートにより、.NET、Mono、Xamarin.iOS、Xamarin.Androidアプリ内でPDFを直接生成、読み込み、変更、変換できます。また、JavaScriptベースの高速なクライアントサイド・ビューア/エディタも含まれており、ユーザーはデスクトップ/WebアプリケーションでPDFドキュメントを表示し、必要に応じて編集することができます。

このブログ記事では、MESCIUSのプロダクトマーケティングスペシャリストMackenzie Albitzが、DsPdfを使って、PDFからテキストを解析して抽出することで、さまざまなシナリオにおいてPDFコンテンツの活用をシームレスに実現する方法を紹介します。対象には以下が含まれます:

  • PDFファイルからすべてのテキストを抽出する
  • 特定のPDFページからテキストを抽出する
  • PDF内の事前定義した範囲からテキストを抽出する
  • PDFからフォントを抽出する 

サンプルコードが用意されており、開始に役立つQuick Start Demoへのリンクと、完全なサンプルアプリケーションも用意されています。

全文のブログを読むことで、PDFコンテンツの活用方法を学べます。

Document Solutions for PDFは開発者ごとのライセンスで提供されており、配布ニーズの違いに応じて複数のライセンスオプションがあります。また、同じ組織内で複数の開発者に対応するチームライセンスも利用可能です。詳細は、Document Solutions for PDFライセンシングページをご覧ください。

詳細は、Document Solutions for PDFの製品ページをご覧ください。