スキャンしたPDFをExcelに変換する
スキャンしたPDFをExcelに変換する方法。各ページを画像として構造化フィールドに読み取り、元画像と照合してスポットチェックしたうえで、Excelできれいに開けるUTF-8 BOM付きCSVに書き出します。
スキャンしたPDFは、ファイルの中に表計算データが隠れているわけではありません。それはドキュメントを撮った「画像」です。各ページは行・列・合計が並んだ画像で、人間の目には表に見えても、コンピューターにとってはただのピクセルの集まりにすぎません。スキャンに「Excelへエクスポート」ボタンがほとんど用意されていないのはそのためです。エクスポートすべきセルなど存在せず、あるのは画像だけだからです。本物の行を取り出すには、ページを構造化されたフィールドとして読み戻し、それをExcelで開けるファイルとして書き出す必要があります。
ここで紹介するのは、まさにそのワークフローです。ドキュメント画像(スキャンしたページ、スマホで撮った写真、FAXで届いたレシートなど)を取り込み、その値を名前付きフィールドとして抽出し、Excelでそのまま開けるCSVとして書き出します。CSVはBOM(バイトオーダーマーク)付きのUTF-8なので、日本語・韓国語・中国語のテキストも文字化けせず、正しい列にきちんと収まります。「スキャンPDFをExcelに変換する」という作業の成果物が、このCSVです。
なぜスキャンはそのままExcelにできないのか
紙の請求書をスキャンすると、出力されるのはラスター画像です。JPEG写真とまったく同じ種類のファイルです。space-ocrはこうしたラスター形式をそのまま受け付けます。対応形式はJPEG、PNG、GIF、BMP、TIFF、WebPです。元データが複数ページのPDFの場合は、2つの方法があります。PDFをそのままspace-ocrアプリにドロップすれば、各ページを自動的に画像へレンダリングしてくれます。あるいは、REST APIを直接呼び出すなら、先に各ページを画像(PNGまたはTIFF)として書き出して送信します。いずれの場合も、OCRはページ画像に対して実行されます。
エンジンは各画像を読み取って値を見つけ、その値をページのどこから読んだのかという出典座標を、特定できた分について返します。0〜1000に正規化した軸並行のboxと、紙面の傾きに追従する4点のquadです。領域を特定できなかった値や、印字された文字との突合が合わなかった値は、そのまま通過させず検討対象として提示されます。ページがフィールドへと構造化されてしまえば、あとはCSVをダウンロードするだけでExcel化は完了です。難しく、そして手を抜いてはいけないのは「読み取り」であって、エクスポートではありません。
ドキュメント画像から構造化フィールドへ
ドキュメント画像をアップロード — あるいは写真やPDFをそのままドロップするだけ — で、値は文字の羅列ではなく名前付きフィールドとして出てきます。いちばん速いのは、アプリにフィールドを提案させる方法です。ページをドロップすれば、設定不要で自動的にスキーマを提案してくれます。必要な列があらかじめ決まっているなら、自分で列(スキーマ)を定義することもできます。列名と型を一度決めておけば、そのシートに追加する各ページが同じ定義で読み取られます。スキャンがラベル付きの列へと変わる様子をご覧ください。
請求書の明細行やレシートの商品一覧のように、繰り返し現れる行を含むドキュメントには、子列を持つarrayフィールドを宣言します。ページ上の各行がそれぞれ独立した行になり、合計を計算する必要がある表ではまさにこれが求められます。こうした繰り返し行を専門的に扱いたい場合は、フィールド仕様の詳細を解説した請求書から明細行を抽出するを参照してください。
{
"image": "https://example.com/scanned-page-01.png",
"imageType": "url",
"fields": [
{ "name": "vendor", "type": "string" },
{ "name": "invoice_date", "type": "string" },
{ "name": "total", "type": "string" },
{
"name": "line_items", "type": "array",
"children": [
{ "name": "description", "type": "string" },
{ "name": "unit_price", "type": "string" },
{ "name": "qty", "type": "string" }
]
}
]
}値はこちらで正規化しません。 印字された7,855は7,855のまま返ります。カンマ、小数点、全角文字も読み取った表記のまま保持し、標準的な数値表記へ書き換えることはないので、紙面との突合が取れます。アプリ上で見える通貨記号はUI上の装飾であって、値の一部ではありません。フィールドのdescriptionに何を書いてもこれは変わりません — 座標と突合が意味を持つためには、値が印字に沿っている必要があるからです。ただしvaluesはモデルがページを読み取ったテキストなので、印字との文字単位の厳密照合が必要なら、その座標における生のOCR文字であるevidence.printed_textを使ってください。計算に使う数値が必要なら、APIが印字された値の隣にそれを返せます。フィールドのtypeにnumber・integer・dateを宣言すると、valuesと並んで解釈済みのnormalizedが付いてきます。
確認してから、Excelへ書き出す
Excelに取り込む前に、読み取り結果を念のため確認しましょう。値にマウスを乗せると、元画像上の該当箇所がハイライトされるので、スキャン全体を見直さなくても、視線がそのまま正しい場所へ向かいます。
全件を目で追う必要もありません。読み取り結果には確認対象の一覧が同梱されます。data.review.flaggedには、確認が必要な値ごとに、その値のpathとフラグのreasonsが入ります。印字との突合が合わなければtext_mismatch、出典領域を特定できなければnobox、必須と宣言したフィールドが空で返ればmissingです。セルのverifiedはその判定で、何かフラグが立った時点でfalseになります。この一覧だけを処理し、残りはそのままで構いません。evidence.match_ratioはセルに付く補助的な材料であって、しきい値で機械的に足切りするための数値ではありません。
Excelで開けるCSVを書き出す
フィールドが正しく見えたら、シートを書き出します。出力されるのは<sheetName>.csvで、列名を並べたヘッダー行が付きます。arrayフィールドはcolumn.childという列に展開され、繰り返しの明細行はサブ行として展開されます。ファイルはBOM付きのUTF-8で、これこそがダブルクリックしたときにExcelがCJKテキストをきれいに開いてくれる決め手です。手動で修正した内容は、エクスポート時に元のOCR値を上書きします。
書き出しそのものは、FreeとPay-as-you-goのプランでは1クレジットを消費します。StarterとProではダウンロードは無料です。同じデータの再ダウンロードは、どのプランでも費用がかかりません。
Excelで開くには、.csvをダブルクリックするだけです。BOMがあるおかげで、Excelは自動的にUTF-8として読み込みます。テキストファイルウィザードも、文字化けもありません。そこから、ネイティブのワークブックが必要なら名前を付けて保存 → .xlsxへ。最終的なゴールがExcelそのものではなくシンプルなCSVパイプラインであれば、姉妹ガイドのスキャン文書をCSVにするが同じエクスポートを最初から最後までカバーしています。
APIで大量に処理する
スキャンのフォルダーをまとめて処理するには、まず列スキーマを持つシートを一度作成し、そのシートにページ画像をアップロードします。各画像はそのスキーマに沿って読み取られ、行として追加されていくので、あとでまとめて1つのCSVとして書き出せます。
POST /uploadの上限は、1リクエストあたり20ファイル、1ファイル20MB、リクエスト全体で28MBです(超過すると413が返ります)。料金は1ページあたり1クレジット(¥10、税込)。呼び出しは既定で非同期で、レスポンスにはjobs[]が入り、結果はocr.completedウェブフックかGET /jobs/{jobId}のポーリングで受け取ります。下のリクエストのようにwait=trueを付けると同期で待ち受けになり、待機は1画像あたり最大30秒、間に合わなかった項目はstatus: "pending"で返るので後から回収します。リトライする場合はIdempotency-Keyを付けておくと、再送時にキャッシュ済みのレスポンスが返り、二重にスキャンされません。リクエスト/レスポンスの完全な形式はAPIドキュメントにあります。
curl -X POST https://api.space-ocr.com/upload \
-H "Authorization: Bearer $SPACE_OCR_API_KEY" \
-F "path=/Invoices 2026" \
-F "files=@scan-page-01.png" \
-F "files=@scan-page-02.png" \
-F "wait=true"スキャンしたPDFをExcelに変換する手順
- PDFまたはページ画像を追加するspace-ocrアプリでは、PDFをドロップするだけです。各ページが自動的に画像へラスタライズされるので、変換するものは何もありません。REST APIを直接呼び出す場合は、エンジンがPDFのバイトではなくラスター画像(JPEG、PNG、GIF、BMP、TIFF、WebP)を読み取るため、先に各ページをラスター画像として書き出してください。
- ページをフィールドとして読み取る値を名前付きフィールドとして抽出します。いちばん速いのは、アプリにページからフィールドを自動提案させる方法です。必要な列が決まっていれば、自分で列(スキーマ)を定義することもできます。繰り返しの明細行にはarrayフィールドを宣言します。
- 値を確認するフィールドにマウスを乗せると、元のスキャンのどこから読み取られたかがハイライトされます。確認は、読み取りが検討対象として立てた値だけで足ります。APIでは理由付きで data.review.flagged に返るので、その一覧を処理し、残りはそのままにします。
- CSVを書き出すシートをCSVとして書き出します。BOM付きのUTF-8で、arrayの明細行はサブ行に展開され、手動での修正があれば元のOCR値を上書きします。
- Excelで開くCSVをダブルクリックします。ExcelはBOMを読み取り、列が揃いCJKテキストもそのままの状態で行を開きます。ネイティブのワークブックが必要なら、名前を付けて保存で.xlsxにします。