PDFテキスト抽出
PDFのテキスト層をページ番号付きで取り出し、AIへの入力や検索用のTXT・JSONにします。画像だけのPDFはOCRが必要だと判定します。
結果
ここに仕上がりが表示されます
ファイルを追加するか、サンプルで試せます。
コピー・保存する前に、内容を確認できます。
入力・処理・結果はこのブラウザ内。ページ移動でも素材を使えます。再読み込み・タブ終了で消えるため、必要な結果は保存してください。
AIエージェントから使うWebMCP 試験対応
このブラウザではWebMCPが有効になっていません。通常のツール操作と下の実行テストはそのまま使えます。
「PDFテキスト抽出でPDFから文字を取り出す。結果を確認できる形で残してください。」
WebMCPは試験中のWeb標準です。利用には対応ブラウザと対応エージェントが必要です。MCPサーバーの接続URLではありません。AIサービスへ渡す内容は、そのサービスのデータ方針も確認してください。対応状況と使い方
入力仕様を見る · chinouken_pdf_to_text
{
"type": "object",
"additionalProperties": false,
"required": [
"assetIds"
],
"properties": {
"pages": {
"type": "string",
"description": "ページ。1始まり。例: 1,3-5。空欄は全ページ。",
"maxLength": 4000,
"default": ""
},
"maxChars": {
"type": "integer",
"description": "最大文字数。超えた場合はそのページの途中で打ち切り、結果へ注意を表示します。",
"minimum": 1000,
"maximum": 2000000,
"default": 2000000
},
"outputName": {
"type": "string",
"description": "出力名",
"maxLength": 120,
"default": "抽出テキスト"
},
"assetIds": {
"type": "array",
"minItems": 1,
"maxItems": 30,
"uniqueItems": true,
"items": {
"type": "string",
"maxLength": 100
},
"description": "IDs of files already imported in this browser tab, in processing order. No URLs, paths or base64."
}
}
}このPCのMCPと接続する
抽出結果
ページごとの本文とJSONを返します。PDFの文字層がないスキャンはOCR候補として警告します。
日本語
フォントの埋め込みやToUnicode情報によって、文字の順序や欠落が変わる場合があります。
AIエージェントへの頼み方
Claude CodeやCodexなど、MCPやWebMCPに対応したエージェントに、このページのURLを添えて次のように頼めます。ファイルは会話に添付せず、手元のパスや条件を伝えます。
- 「contract.pdf のテキストを抜き出して、1ページ目から5ページ目の内容を要約して。」
- 「この PDF から本文だけを取り出して、最大2万文字まで読んで要点を3つにまとめて。」