space ocr
ガイド・記事
領収書・請求書など、あらゆる書類を構造化された検証可能なデータに変えるための実践ガイド。すべての値が出典までたどれます。
developer
回転し、シワが寄り、夜に撮られた写真でMistral OCRともう一度勝負した
第1ラウンドは「難しい書類」を選んだ。しかし現場から届くのはもっと条件の悪い「写真」だ。横向きのドットプリンタ伝票、重なったカーボン複写、暗い場所で撮られたシワだらけの伝票、夜のクリップボード、同じ¥711が4回印字されたレシート。全部足して測り直した。
developer
最難関の8ケースでMistral Document AIを走らせた。スコア表に出ないもの
space-ocrとMistral Document AIに同じ8ケース、同じフィールドスキーマ、同じ採点スクリプトを与えた。スコアの差も大きかったが、構造の差はもっと大きかった。
developer
検証をオフにして測ってみた — OCR パイプラインは仕事をしているか (2026)
「自ら検証する」は、切ってみるまでは主張にすぎません。切ってみました — 直したセル 22、壊したセル 0、そして 4 回に 3 回当たるフラグ。この測り方は、どの抽出パイプラインにもそのまま持ち込めます。
developer
画像を Markdown に変換する OCR — 構造も座標も落とさずに
組み立て済み Markdown と構造要素を分け、要素や表セルを原稿へ戻し、flagged path だけを確認する現在の API 構成。
developer
OCR でプレーンテキストを取り出す — 難所は「読み順」
素の OCR では二段組みが交錯します。現在の values・cells・review・image・source 契約を使い、索引化と原文確認を両立します。
documents
書類の写真をスプレッドシート化 | space-ocr
書類の写真を見ながらの手入力はもうやめましょう。space-ocrなら、傾いた画像や複数言語が混在する書類でも、JPEGやPNGから直接、きれいなスプレッドシートの行データを作成します。
なぜ space-ocr は他の LLM OCR と違うのか:検証できる構造化抽出
GPT-4o や Gemini に書類を読ませても、返ってくるのは検証もクエリもできないテキストだけだ。space-ocr は値ごとに box と quad、verified 判定、そして確認すべき項目を並べた review.flagged を返す。
PDFを検索可能なCSVに変換する — 構造化データ抽出の実践ガイド
構造化されていないPDFを機械可読なCSVに変える方法。各ページを画像に変換し、ページ上の位置(バウンディングボックス)が検証された名前付きフィールドを抽出して、そのままデータベースに投入できる整ったUTF-8のCSVを書き出す。
バウンディングボックス付き構造化フィールドOCR APIを2026年に実装する
バウンディングボックス付きの構造化フィールドOCR APIを2026年にどう実装するか。0〜1000の正規化座標、値ごとの verified 判定、そして review の要確認リストまでを解説する。
スタートアップ向け低コストOCR:ムダを削ぎ落とした書類処理の実践ガイド
スタートアップに合う低コストOCRを探すためのガイド。席課金や企業向けの余分な機能を抱え込まず、使った分だけ払うスケーラブルな書類処理パイプラインの作り方をまとめた。
documents
画像内の表からCSVへデータ抽出 | space-ocr
画像からの面倒なコピペはもう不要です。一度カラムを定義すれば、space-ocrが各行を構造化されたCSVデータに変換し、インポート可能な状態にします。
developer
OCR APIとWebhookで買掛金管理を自動化する | space-ocr
ポーリングはもうやめましょう。最新の買掛金管理ワークフローを構築しませんか。space-ocrの非同期APIに請求書をアップロードすれば、署名付きWebhookによって構造化データが直接エンドポイントにプッシュされます。
workspace
スキャンした書類を検索可能なフォルダとシートに整理する方法
混沌としたJPEGフォルダから、構造化されたワークスペースへ。スキャンした書類をシートに整理すれば、スキャン1枚が1行になり、全てのデータが検証可能で、検索も自由自在です。
documents
スキャンしたレシートをGoogleスプレッドシートに。検証可能なデータで取り込む方法
レシートのスプレッドシートへの手入力はもうやめましょう。書類をスキャンし、構造化データを抽出し、監査可能なきれいなデータ行としてGoogleスプレッドシートにインポートできます。
developer
Pythonで請求書を解析し、検証可能なJSONを取得する方法
複雑なOCRライブラリとの格闘はもうやめましょう。このガイドでは、シンプルなPythonスクリプトと単一のREST APIコールだけで、あらゆる請求書画像を構造化JSONに変換する方法を解説します。
receipts
紙の領収書をデジタル化し、経費精算を高速化する方法(CSVエクスポート対応)
たまった紙の領収書の山を、検証可能なきれいなCSVデータに変えましょう。画像上で確認しながら領収書をデジタル化する、実用的なガイドです。
verification
バウンディングボックスでOCR結果を検証する方法
review.flagged から cells[path] を開き、元画像上の box または quad と照合して値を確認します。
receipts
請求書から明細行を自動で抽出する方法 | space-ocr
明細テーブルを配列フィールドとして宣言すれば、1明細につき1行が返ります。行も各値も data.cells のパスで座標と判定を引け、確認すべき値は review.flagged に並びます。
convert
スキャンしたPDFをExcelに変換する:ページ画像からCSVへ
スキャンしたページは表計算データではなく、ただの画像です。それを構造化された行として読み取り、Excelでそのまま開けるCSVに書き出す方法を解説します。
comparison
Amazon Textract の代替:検証可能なOCR API(2026年版)
Textract の代替が理にかなう場面——パスで引ける出所座標、何を確認すべきかを示す検討リスト、日本語・韓国語・中国語対応、クエリ可能なシート、AWSアカウント不要で1枚あたりの明朗な料金——と、Textract が今なお光る場面を整理します。
developer
バウンディングボックス付きOCR API:すべての値を検証する(2026年版)
OCR API の多くはバウンディングボックスを返しますが、座標系はまちまちで、ボックスだけでは「どこか」しか分かりません。宣言したフィールドごとに box と quad を受け取り、data.review.flagged を確認リストとして使う方法です。
convert
スキャンしたPDFをExcelに変換する(日本語・文字化け対策)|表をCSVで取り込む
スキャンPDFは「表の画像」。手入力もコピペも要らず、各ページを構造化フィールドに読み取って、Excelでそのまま開けるCSV(UTF-8 BOM)に書き出す実務手順。