PDFテキスト抽出

PDFのテキスト層をページ番号付きで取り出し、AIへの入力や検索用のTXT・JSONにします。画像だけのPDFはOCRが必要だと判定します。

WebMCP 試験対応

入力 → 設定 → 確認・保存

入力と設定
またはここへドロップ

PDFを1件。抽出結果はページ単位で最大200万文字です。 素材は1件60MB、合計120MB・30件まで。

設定を保存・読み込む

ファイルの中身や素材IDは含めず、現在の設定をJSONで保存します。

結果

ここに仕上がりが表示されます

ファイルを追加するか、サンプルで試せます。

コピー・保存する前に、内容を確認できます。

入力・処理・結果はこのブラウザ内。ページ移動でも素材を使えます。再読み込み・タブ終了で消えるため、必要な結果は保存してください。

AIエージェントから使うWebMCP 試験対応

このブラウザではWebMCPが有効になっていません。通常のツール操作と下の実行テストはそのまま使えます。

「PDFテキスト抽出でPDFから文字を取り出す。結果を確認できる形で残してください。」

WebMCPは試験中のWeb標準です。利用には対応ブラウザと対応エージェントが必要です。MCPサーバーの接続URLではありません。AIサービスへ渡す内容は、そのサービスのデータ方針も確認してください。対応状況と使い方

入力仕様を見る · chinouken_pdf_to_text
{
  "type": "object",
  "additionalProperties": false,
  "required": [
    "assetIds"
  ],
  "properties": {
    "pages": {
      "type": "string",
      "description": "ページ。1始まり。例: 1,3-5。空欄は全ページ。",
      "maxLength": 4000,
      "default": ""
    },
    "maxChars": {
      "type": "integer",
      "description": "最大文字数。超えた場合はそのページの途中で打ち切り、結果へ注意を表示します。",
      "minimum": 1000,
      "maximum": 2000000,
      "default": 2000000
    },
    "outputName": {
      "type": "string",
      "description": "出力名",
      "maxLength": 120,
      "default": "抽出テキスト"
    },
    "assetIds": {
      "type": "array",
      "minItems": 1,
      "maxItems": 30,
      "uniqueItems": true,
      "items": {
        "type": "string",
        "maxLength": 100
      },
      "description": "IDs of files already imported in this browser tab, in processing order. No URLs, paths or base64."
    }
  }
}
通常実行はローカルテストです。入力・結果が画面に反映されます。
このPCのMCPと接続する

ローカルMCPアダプターの utilities_connect が返した接続コードを使います。ファイルの受け渡しはこのPC内で行います。

未接続
接続方法とダウンロード

文字層のないPDFを読む

スキャンや写真だけのPDFは、この方法では文字を取り出せません。画像から文字を起こすには、OCRや文書AIの仕組みが要ります。DoclingやUnstructuredのように無料で使えるものも、同じ一覧に入っています。

抽出結果

ページごとの本文とJSONを返します。PDFの文字層がないスキャンはOCR候補として警告します。

日本語

フォントの埋め込みやToUnicode情報によって、文字の順序や欠落が変わる場合があります。

AIエージェントへの頼み方

Claude CodeやCodexなど、MCPやWebMCPに対応したエージェントに、このページのURLを添えて次のように頼めます。ファイルは会話に添付せず、手元のパスや条件を伝えます。

  • 「contract.pdf のテキストを抜き出して、1ページ目から5ページ目の内容を要約して。」
  • 「この PDF から本文だけを取り出して、最大2万文字まで読んで要点を3つにまとめて。」