Amazon Textract の代替をお探しですか?
Amazon Textract の代替を選ぶべき場面を、事実検証済みの公平な視点で解説します——値ごとの出所座標、確認対象を明示する検討リスト、CJK(日本語・韓国語・中国語)対応、クエリ可能なシート、明朗な料金、AWSのセットアップ不要。
Amazon Textract は実力のある成熟したOCRサービスで、英語の書類を大規模に処理するAWSネイティブなパイプラインなら、妥当な既定の選択肢です。しかし「実力がある」ことと「あなたの業務にちょうど合う」ことは別物で、いくつかの現実的な制約から Amazon Textract の代替を探す人も少なくありません。
- CJK は対応言語一覧にありません。 Textract の印刷テキスト・フォーム・テーブルの各機能は、ラテン文字系の一群(英語、フランス語、ドイツ語、イタリア語、ポルトガル語、スペイン語)を対象とし、手書き、請求書・領収書(AnalyzeExpense)、身分証(AnalyzeID)、Queries は英語のみと明記されています。日本語・韓国語・中国語はその一覧に入っていません。
- AWSへの引力。 利用にはAWSアカウント、IAM、SDK、対応リージョン、そしてたいていはS3が必要です——画像を送ってフィールドを受け取りたいだけなら、これは実質的なセットアップコストです。
- 機能を重ねるページ単位の料金。 料金はページ単位で、呼び出す機能(プレーンテキスト/フォーム/テーブル/クエリ/エクスペンス)によって単価が変わり、機能を組み合わせるとコストが積み上がります。
- 値ごとの確認は別サービスです。 Textract は信頼度スコアを返しますが、人手による確認(human-in-the-loop)は Amazon Augmented AI(A2I)で、自分で組み込む必要があります。
このガイドは公平な比較です——Textract が強い場面と、space-ocr のような代替が合う場面——を整理します。
Textract の代替を評価するときに比べるべきこと
どちらのツールも書類を読み取り、座標付きの構造化データを返します。違いは、値をどうやって検証するか、どの言語に対応するか、データがどうやってツールの外に出るか、そして始めるのにいくらかかるか、にあります。下の表は両者の検証済みの事実を並べたものです——ご自身のワークロードのチェックリストとしてお使いください。
| 機能 | Amazon Textract | space-ocr |
|---|---|---|
| バウンディングボックス | あり——ブロックごとに0〜1正規化の BoundingBox と Polygon | あり——値ごとに box({ xmin, ymin, xmax, ymax })と4点の quad。いずれも0〜1000正規化 |
| 値ごとの検証シグナル | ブロックごとの認識信頼度(%) | 判定の verified、引っかかった理由をランク順に並べた review.reasons、裏付けの evidence(text_match・source・match_ratio) |
| 値ごとのレビューUIが組み込み | Textract 自体にはなし。人手確認は別サービス(Amazon A2I) | アプリに組み込み——セルをクリックすると、その正確な領域が元画像上で光る |
| 領収書・請求書フィールド | AnalyzeExpense(別API)、英語のみ | 欲しい項目を fields で宣言するか、autoFields にスキーマを提案させる——エンジンが読む言語ならどれでも |
| 明細行 | AnalyzeExpense の明細行(ITEM / QUANTITY / PRICE) | children を持つ array フィールド。各セルが自分のパス(items[0].price)で引ける |
| 日本語・韓国語・中国語 | 記載なし(ラテン文字系6言語。Expense/ID/手書きは英語のみ) | 一つのエンジンが日本語・韓国語・中国語・英語などを自動判定 |
| クエリ可能なストレージ | 結果は自分で保存・クエリ | 保存済みシートを GET /view(where、sort、select)でサーバー側からクエリ——再OCRも追加料金もなし |
| CSVエクスポート | JSONから自分で組み立てる | ワンクリック——UTF-8 BOM、明細行は展開済み |
| 料金モデル | ページ単位、機能ごとに課金。機能を組み合わせるとコストが積み上がる。さらにAWSアカウント前提 | 一律 1枚あたり¥10。無料枠は月100クレジット、カード不要。Pro は月額¥8,980 |
| セットアップ | AWSアカウント + IAM + SDK、リージョン依存サービス、たいていS3 | Bearerキー1本でHTTPSを1回呼ぶだけ。同じAPIはAIエージェント向けのMCPエンドポイントとしても開いています |
「検証可能」について:座標はモデルの言い分を鵜呑みにしていません。 言語モデルは各フィールドのテキストと、どの単語トークンを使ったかのヒントを返しますが、ボックスそのものは決して返しません。エンジンはそのテキストを、ビジョンOCRがページ上で実際に検出したシンボルと文字単位で照合します。だからこそボックスは、それらの文字が見つかった実際のピクセルに配置されます。照合が走った値には、どれだけ照合できたかを示す evidence.match_ratio が付き(0.85以上で確実にマッチしたものとして扱います)、照合できなかった場合はそのキー自体がありません。モデルのトークンヒントはノイズを含むことがあり——繰り返し行の間で取り違えることがあります——そのため鵜呑みにするのではなく、列・行の整合性チェックで検証します。要点は、AIが間違えないということではありません。二つの仕組みが同じ誤読で一致することもあります。要点は、黙って通り過ぎる不一致が表に出るということです——セルの review の理由として、そして data.review.flagged の一行として。
Textract のほうが優れている場面
公平な比較なら、既存サービスが勝る場面もきちんと挙げるべきでしょう。次のような場合は Textract を選んでください。
- すでにAWSに深く根を張っており、運用中のIAMやSNSとともに S3 → Lambda → Textract に組み込めるOCRが欲しいとき。
- 書類が英語/ラテン文字系で、フォーム・テーブル・クエリを超大規模に処理する必要があるとき。
- 自社の書類タイプで学習したカスタムアダプターや、AWSネイティブなコンプライアンス・データレジデンシーの保証が欲しいとき。
これに当てはまるなら、Textract はよく合っており、代替に乗り換えても得られるものはわずかです。
代わりに space-ocr が合う場面
Textract の代替が本領を発揮するのは、次のいずれかが重要なときです。
- 日本語・韓国語・中国語の書類を処理する。 space-ocr はCJKとラテン文字系を一つのエンジンで処理し、言語は自動判定します——設定する言語パラメータはありません。
- 信じるのではなく、検証したい。 業務データは
data.valuesに入り、同じパスでdata.cellsを引くと、box・quad・判定のverified・理由のreview・裏付けのevidenceが並びます。要確認の一覧はdata.review.flaggedで、アプリでセルをクリックすればどこから読み取られたかが正確にハイライトされます。 - ストレージを立ち上げたくない。 結果はサーバー側でクエリできるシート(
GET /view)に入り、ワンクリックでCSVにエクスポートできます——データベースもAWSアカウントも不要です。 - 予測できる料金が欲しい。 一律1枚あたり¥10、カード不要の月100クレジット無料枠、そして月額¥8,980のProプラン——機能ごとにページ料金が積み上がることはありません。
- AIエージェントで開発する。 同じAPIを
https://mcp.space-ocr.com/mcpのMCPエンドポイントとして開いています——claude mcp add --transport httpの1行か、mcp.jsonにURLとBearerヘッダーを1組。インストールするものはありません。
呼び出し全体がHTTPリクエスト1回です——SDKは不要。エンジンはラスター画像を読むので、PDFはページを画像に変換してから送ります(Webアプリではその変換を自動で行います)。
curl -s https://api.space-ocr.com/ocr/fields \
-H "Authorization: Bearer $SPACE_OCR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"image": "https://example.com/invoice.jpg",
"imageType": "url",
"fields": [
{ "name": "invoice_no", "type": "string", "required": true },
{ "name": "date", "type": "date" },
{ "name": "items", "type": "array",
"children": [
{ "name": "name", "type": "string" },
{ "name": "qty", "type": "string" },
{ "name": "price", "type": "string" }
] },
{ "name": "total", "type": "number", "required": true }
]
}'値は送ったスキーマそのままの形で data.values に返ります。その形の各パス——total、items[0].price——がそのまま data.cells のキーになり、box(0〜1000グリッド上の { xmin, ymin, xmax, ymax })と、傾いたスマホ写真に沿う4点の quad、さらに verified・review・evidence が並びます。座標の基準となる紙面の幅と高さは data.image です。確認すべきものは data.review.flagged に一箇所へまとまり、各項目が path と reasons の組になっています。date と total にスカラー型を宣言したので、解釈済みの値が疎な data.normalized として値の隣に届きます。座標モデルの全体像はバウンディングボックス付きOCR APIを、非同期・Webhook主導の側面は請求書データ抽出APIガイドをご覧ください。
言語:最もはっきりした分かれ目
書類が日本語の領収書、韓国語の請求書、中国語のフォームなら、たいていこれが決め手になります。Textract の印刷テキスト・フォーム・テーブルの各機能はラテン文字系6言語に対応し、手書き、AnalyzeExpense、AnalyzeID、Queries の各機能は英語のみで——日本語・韓国語・中国語は対応リストに入っていません。space-ocr は複数の文字体系を一つのエンジンで正規化し(全角・半角、ハイフンの異体、CJKの字間、縦書き漢字、混在文字)、言語を自動判定するため、渡すヒントはありません。
料金:機能ごとのページ課金 vs. 1枚あたりの一律料金
Textract は、機能によって単価が変わるページ単位の従量課金です——プレーンテキスト検出はフォーム、テーブル、クエリ、AnalyzeExpense とは別に課金され、1ページで複数機能を呼び出すとコストが積み上がります——しかもすべてAWSアカウントの上にです。space-ocr は、いくつフィールドを取り出しても一律 1枚あたり¥10で、カード不要の月100クレジット無料枠があり、Pro は月額¥8,980で1,100クレジット、シート無制限、100GBのストレージが付きます。抽出に失敗したものは課金されず、保存済みシートへのクエリ(GET /view)は無料です。
Textract の代替として space-ocr を試す手順
- キーを取得する——AWSアカウント不要無料枠(カード不要、月100クレジット)に登録して spocr_ APIキーを取得します。設定すべきIAMもリージョンもS3もありません。
- 画像を送信する書類を imageType 'url' または 'base64' で /ocr/fields へPOSTします。エンジンはラスター画像を読むので、PDFはページを画像に変換してから送ってください。言語は自動判定されます。
- フィールドを宣言する欲しい項目を fields に並べます——それぞれ name と type を与え、明細行には children を持つ array フィールドを使います。書かずに済ませたい場合は autoFields を true にすると、モデルが書類からスキーマを提案します。
- 各値を検証するパスごとに data.cells[path] を読みます——読み取り元の領域は box と quad、判定は verified、理由は review、裏付けは evidence です。要確認リストはスコアのしきい値ではなく data.review.flagged から組み立てます。アプリではセルをクリックすると、それが読み取られた場所が正確にハイライトされます。
- クエリまたはエクスポート——ストレージの構築不要/upload で画像をシートに投入し、GET /view(where、sort、select)でサーバー側からクエリするか、明細行を展開したCSVをダウンロードします——データベースも再OCR料金もありません。