space ocr
ガイド・記事
領収書・請求書など、あらゆる書類を構造化された検証可能なデータに変えるための実践ガイド。すべての値が出典までたどれます。
developer
最難関の8枚でMistral Document AIを走らせた。スコア表に出ないもの
space-ocrとMistral Document AIに同じ書類8枚、同じフィールドスキーマ、同じ採点スクリプトを与えた。スコアの差も大きかったが、構造の差はもっと大きかった。
developer
検証をオフにして測ってみた — OCR パイプラインは仕事をしているか (2026)
「自ら検証する」は、切ってみるまでは主張にすぎません。切ってみました — 直したセル 22、壊したセル 0、そして 4 回に 3 回当たるフラグ。この測り方は、どの抽出パイプラインにもそのまま持ち込めます。
developer
画像を Markdown に変換する OCR — 構造も座標も落とさずに
多くの画像→Markdown 変換は文字列だけを返し、確かめる手段をくれません。要素ごとに座標が残る Markdown OCR とは。
developer
OCR でプレーンテキストを取り出す — 難所は「読み順」
素の OCR は段落を検出順で返すため、二段組みのページは入り混じって出てきます。実際に索引化できるテキストにするには何が要るか。
documents
書類の写真をスプレッドシート化 | space-ocr
書類の写真を見ながらの手入力はもうやめましょう。space-ocrなら、傾いた画像や複数言語が混在する書類でも、JPEGやPNGから直接、きれいなスプレッドシートの行データを作成します。
なぜ space-ocr は他の LLM OCR と違うのか:検証できる構造化抽出
GPT-4o や Gemini に書類を読ませても、返ってくるのは検証もクエリもできないテキストだけだ。space-ocr は値ごとに検証済みのボックスと match_ratio、そしてクエリできる行を返す。
PDFを検索可能なCSVに変換する — 構造化データ抽出の実践ガイド
構造化されていないPDFを機械可読なCSVに変える方法。各ページを画像に変換し、ページ上の位置(バウンディングボックス)が検証された名前付きフィールドを抽出して、そのままデータベースに投入できる整ったUTF-8のCSVを書き出す。
バウンディングボックス付き構造化フィールドOCR APIを2026年に実装する
バウンディングボックス付きの構造化フィールドOCR APIを2026年にどう実装するか。0〜1000の正規化座標、match_ratioによる検証、そして実際に信頼できる監査対応のデータパイプラインまでを解説する。
スタートアップ向け低コストOCR:ムダを削ぎ落とした書類処理の実践ガイド
スタートアップに合う低コストOCRを探すためのガイド。席課金や企業向けの余分な機能を抱え込まず、使った分だけ払うスケーラブルな書類処理パイプラインの作り方をまとめた。
documents
画像内の表からCSVへデータ抽出 | space-ocr
画像からの面倒なコピペはもう不要です。一度カラムを定義すれば、space-ocrが各行を構造化されたCSVデータに変換し、インポート可能な状態にします。
developer
OCR APIとWebhookで買掛金管理を自動化する | space-ocr
ポーリングはもうやめましょう。最新の買掛金管理ワークフローを構築しませんか。space-ocrの非同期APIに請求書をアップロードすれば、署名付きWebhookによって構造化データが直接エンドポイントにプッシュされます。
workspace
スキャンした書類を検索可能なフォルダとシートに整理する方法
混沌としたJPEGフォルダから、構造化されたワークスペースへ。スキャンした書類をシートに整理すれば、スキャン1枚が1行になり、全てのデータが検証可能で、検索も自由自在です。
documents
スキャンしたレシートをGoogleスプレッドシートに。検証可能なデータで取り込む方法
レシートのスプレッドシートへの手入力はもうやめましょう。書類をスキャンし、構造化データを抽出し、監査可能なきれいなデータ行としてGoogleスプレッドシートにインポートできます。
developer
Pythonで請求書を解析し、検証可能なJSONを取得する方法
複雑なOCRライブラリとの格闘はもうやめましょう。このガイドでは、シンプルなPythonスクリプトと単一のREST APIコールだけで、あらゆる請求書画像を構造化JSONに変換する方法を解説します。
receipts
紙の領収書をデジタル化し、経費精算を高速化する方法(CSVエクスポート対応)
たまった紙の領収書の山を、検証可能なきれいなCSVデータに変えましょう。画像上で確認しながら領収書をデジタル化する、実用的なガイドです。
verification
バウンディングボックスでOCR結果を検証する方法
項目ごとのバウンディングボックスとマッチ率を使えば、OCRを再実行せずに抽出データをすばやく抜き取りチェックできます。
receipts
請求書から明細行を自動で抽出する方法 | space-ocr
明細テーブルを配列フィールドとして宣言すれば、1明細につき構造化・検証可能な行が1つ返ってくる。あとはそのままCSVへ展開するだけ。
convert
スキャンしたPDFをExcelに変換する:ページ画像からCSVへ
スキャンしたページは表計算データではなく、ただの画像です。それを構造化された行として読み取り、Excelでそのまま開けるCSVに書き出す方法を解説します。
comparison
Amazon Textract の代替:検証可能なOCR API(2026年版)
Textract の代替が理にかなう場面——値ごとに検証可能な座標、日本語・韓国語・中国語対応、クエリ可能なシート、AWSアカウント不要で1枚あたりの明朗な料金——と、Textract が今なお光る場面を整理します。
developer
バウンディングボックス付きOCR API:すべての値を検証する(2026年版)
OCR APIの多くはバウンディングボックスを返します。ただし座標系はまちまちで、ボックスが教えてくれるのは「どこか」だけ。ソース座標と、値ごとに検証できるマッチ率を手に入れる方法を紹介します。
convert
スキャンしたPDFをExcelに変換する(日本語・文字化け対策)|表をCSVで取り込む
スキャンPDFは「表の画像」。手入力もコピペも要らず、各ページを構造化フィールドに読み取って、Excelでそのまま開けるCSV(UTF-8 BOM)に書き出す実務手順。