C#を使用したプログラムでPDFからテキストを抽出
MESCIUS Document Solutions for PDFを使用すると、インデックス作成や検索などのためにPDFからテキストを自動的に抽出可能

Document Solutions for PDF(DsPdf)は、Adobe Acrobatへの依存がない、高速で機能豊富な、.NET向けのサーバーサイドPDF APIライブラリです。DsPdfを使用すると、開発者はデスクトップおよびWebアプリケーションにおいて、AcroFormsを含むPDFドキュメントを大規模にプログラムで作成、操作、インポート/エクスポート、およびデプロイできます。 .NETの完全なサポートにより、.NET、Mono、Xamarin.iOS、Xamarin.Androidアプリ内でPDFを直接生成、読み込み、変更、変換できます。また、JavaScriptベースの高速なクライアントサイド・ビューア/エディタも含まれており、ユーザーはデスクトップ/WebアプリケーションでPDFドキュメントを表示し、必要に応じて編集することができます。
このブログ記事では、MESCIUSのプロダクトマーケティングスペシャリストMackenzie Albitzが、DsPdfを使って、PDFからテキストを解析して抽出することで、さまざまなシナリオにおいてPDFコンテンツの活用をシームレスに実現する方法を紹介します。対象には以下が含まれます:
- PDFファイルからすべてのテキストを抽出する
- 特定のPDFページからテキストを抽出する
- PDF内の事前定義した範囲からテキストを抽出する
- PDFからフォントを抽出する
サンプルコードが用意されており、開始に役立つQuick Start Demoへのリンクと、完全なサンプルアプリケーションも用意されています。
全文のブログを読むことで、PDFコンテンツの活用方法を学べます。
Document Solutions for PDFは開発者ごとのライセンスで提供されており、配布ニーズの違いに応じて複数のライセンスオプションがあります。また、同じ組織内で複数の開発者に対応するチームライセンスも利用可能です。詳細は、Document Solutions for PDFライセンシングページをご覧ください。
詳細は、Document Solutions for PDFの製品ページをご覧ください。