How to use from
Pi
Start the llama.cpp server
# Install llama.cpp:
brew install llama.cpp
# Start a local OpenAI-compatible server:
llama serve -hf tokimoa/shokuba-probe-2b-GGUF:
Configure the model in Pi
# Install Pi:
npm install -g @mariozechner/pi-coding-agent
# Add to ~/.pi/agent/models.json:
{
  "providers": {
    "llama-cpp": {
      "baseUrl": "http://localhost:8080/v1",
      "api": "openai-completions",
      "apiKey": "none",
      "models": [
        {
          "id": "tokimoa/shokuba-probe-2b-GGUF:"
        }
      ]
    }
  }
}
Run Pi
# Start Pi in your project directory:
pi
Quick Links

shokuba-probe-2b-GGUF

職場点検OSS shokuba-lens の追加確認(probe)用2B VLM shokuba-probe-2b のGGUF版です。llama.cppでWindows/Linuxの現場PCでも動きます。写真に対する点検質問12種(ヘルメット・安全ベスト・安全帯・火/煙・消火器・転倒・マスク・ヘアネット・手袋・フォークリフト・パレットトラック・カゴパレット)に短い構造化回答で答えます。

ファイル

ファイル サイズ 用途
shokuba-probe-2b-Q8_0.gguf 1.7GB 推奨
shokuba-probe-2b-Q4_K_M.gguf 1.0GB 省メモリ
shokuba-probe-2b-f16.gguf 3.2GB 参照用
mmproj-shokuba-probe-2b-f16.gguf 781MB 視覚エンコーダ(必須・どの量子化とも組み合わせ可

MLX版との同等性(検証セット12ドメイン・約1,200枚で突合)

点検質問 指標 MLX版 Q8_0 Q4_K_M
ヘルメット F1 0.854 0.851 0.817
安全ベスト F1 0.932 0.940 0.940
マスク 一致率 0.583 0.558 0.583
火・煙 一致率 0.850 0.858 0.867
消火器 一致率 0.942 0.950 0.942
転倒 F1 1.000 1.000 1.000
ヘアネット F1 0.955 0.955 0.966
手袋 F1 0.857 0.857 0.875
安全帯 一致率 0.675 0.667 0.650
フォークリフト 一致率 0.680 0.600 0.590
パレットトラック 一致率 0.608 0.608 0.642
カゴパレット 一致率 0.900 0.883 0.900
総合 0.820 0.811 0.814

総合で誤差圏の同等です。フォークリフトのみ-0.08の低下があり、それ以外は±0.02以内です。GGUF版はLoRAをbf16ベースへ融合してから変換しています(学習アダプタはテキスト側のみで視覚塔は無改変・融合による劣化は検証セットで未検出)。テストデータでの確定値は本体repoの表を参照してください。

使い方

# CLIで1枚
llama-mtmd-cli -m shokuba-probe-2b-Q8_0.gguf --mmproj mmproj-shokuba-probe-2b-f16.gguf \
  --image site.jpg --temp 0 -n 60 \
  -p "この画像に写っている人を数えてください。全体の人数、そのうちヘルメット(保護帽)を着用している人数、着用していない人数を「人数:N人、着用:N人、未着用:N人」の形式で答えてください。"

# サーバ(OpenAI互換API)
llama-server -m shokuba-probe-2b-Q8_0.gguf --mmproj mmproj-shokuba-probe-2b-f16.gguf \
  --port 8080 --jinja -c 8192 --image-min-tokens 64 --image-max-tokens 2048

運用上の注意3点(いずれも実測で確認済み):

  1. APIでは画像をテキストより先に置いてください。 contentの並びを[image_url, text]にします。逆順だと細部の判定(ヘアネット等)が大きく劣化します(F1 0.955→0.633)。
  2. -c 8192等でコンテキスト長を指定してください。 無指定はモデル宣言の262Kで確保しようとしてメモリ不足になります。
  3. --image-min-tokens 64 --image-max-tokens 2048を推奨します。 無指定だと画像が過剰に縮小され、小さな対象の判定が落ちます。

質問文は上の形式(「人数:N人、着用:N人、未着用:N人」等の回答形式指定つき)が最も安定します。12種の質問文は本体repoを参照してください。

データと帰属

学習・評価データの出典は本体repoの「データと帰属」を参照してください(SHEL5K・Roboflow各種・Kitchen Hygiene Gear・CAUCAFall・D-Fire・LOCO・MEVA等、CC BY 4.0/CC0中心)。ベースは Qwen/Qwen3-VL-2B-Instruct(Apache-2.0)です。


Developed by tokimoa — データを外に出さないAI活用を支援しています

Downloads last month
96
GGUF
Model size
2B params
Architecture
qwen3vl
Hardware compatibility
Log In to add your hardware

4-bit

8-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tokimoa/shokuba-probe-2b-GGUF

Quantized
(86)
this model