jp-invoice-reader-2b-GGUF — 日本語帳票リーダー

日本語帳票(請求書・見積書・納品書・領収書)の読み取りに特化した jp-invoice-reader-2b のGGUF版です。llama.cppでWindows/LinuxのCPU・GPUで動きます。

ファイル

ファイル サイズ 用途
jp-invoice-reader-2b-Q8_0.gguf 1.7GB 推奨(抽出・QAとも)
jp-invoice-reader-2b-Q4_K_M.gguf 1.0GB QA用途向け(下記注意)
jp-invoice-reader-2b-f16.gguf 3.2GB 参照用
mmproj-jp-invoice-reader-2b-f16.gguf 781MB 視覚エンコーダ(必須・どの量子化とも組み合わせ可

実測(公開中のbf16版と同一プロトコル: 未見評価100枚・QA400問・抽出700フィールド)

指標 bf16(MLX公開版) Q8_0 Q4_K_M
ja-docs QA(実写風6問) 6/6 6/6 6/6
帳票QA 93.5% 91.8% 90.5%
抽出フィールド一致(厳密) 90.1% 84.3% 67.3%

厳密一致の低下について実態を補足します(同一100枚で追加検証):

  • Q8_0の低下分はほぼ形式ゆれです。 消費税額を{"rate": 10, "amount": 1449000}のようにネストで返す揺れが増え、厳密一致では×になりますが、税額の値ベースでは99/100が正解でした。金額の読み取り能力自体は維持されています。後段でJSONを受けるときはネスト形式も許容してください。
  • Q4_K_MはJSON構文の崩れが100枚中15件発生します。 抽出(長い構造化出力)には非推奨で、QA用途向けです。

使い方

llama-server -m jp-invoice-reader-2b-Q8_0.gguf --mmproj mmproj-jp-invoice-reader-2b-f16.gguf \
  --port 8080 --jinja -c 8192 --image-min-tokens 64 --image-max-tokens 4096

運用上の注意(いずれも実測に基づく):

  1. APIでは画像をテキストより先に置いてください(contentの並びを[image_url, text]にする)。逆順は精度が下がります。
  2. -c 8192等でコンテキスト長を指定してください。 無指定はモデル宣言の262Kで確保しようとしてメモリ不足になります。
  3. --image-max-tokens 4096を推奨します。 帳票は高解像度のため、既定では画像が過剰に縮小され数値の読み取りが落ちます。

プロンプト例: 抽出は「この帳票から主要項目を抽出してJSONで出力してください。」、QAは「この請求書の合計金額は?」等の自由質問です。

制約

合成帳票ドメインで学習しています。実写スキャン・手書き・特殊レイアウトは未検証で、写真由来の帳票では精度が下がる可能性があります。

ライセンスと帰属


Developed by tokimoa — データを外に出さないAI活用を支援しています

Downloads last month
94
GGUF
Model size
2B params
Architecture
qwen3vl
Hardware compatibility
Log In to add your hardware

4-bit

8-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tokimoa/jp-invoice-reader-2b-GGUF

Quantized
(86)
this model