laeta-bioclip-onnx — encoder de imagen del detector de araña de rincón

Torre visual de BioCLIP-2 (ViT-L/14) exportada a ONNX y cuantizada a int8 (~293 MB) para correr en el navegador (ONNX Runtime Web), dentro de la PWA aranaderincon.manuelsilva.cl.

La foto nunca sale del teléfono: el modelo se descarga una vez y toda la inferencia es local.

Cómo funciona

Clasificación zero-shot. El encoder produce un embedding L2-normalizado de 768-d que se compara por producto punto contra los vectores de texto precalculados de las 26 clases (text_embeddings.json), seguido de softmax. No se entrena con fotos de arañas: se midió que entrenar con fotos chilenas de iNaturalist mejora en iNaturalist y empeora en otra fuente (ROC 0.79 vs 0.93 sobre ejemplares de museo).

Archivos

Archivo Qué es
image_encoder.onnx Torre visual de BioCLIP-2, int8. Entrada pixel_values [N,3,224,224], salida image_embedding [N,768] (ya normalizada).
text_embeddings.json 26×768 vectores de texto de las clases + logit_scale.
labels.json Nombres científicos/comunes, target_index y umbrales calibrados (🔴 0.9012 / 🟡 0.0458).

Preprocesamiento: center-crop a 224 y normalización OpenCLIP (mean [0.4815, 0.4578, 0.4082], std [0.2686, 0.2613, 0.2758]).

Aviso

Estimación automática, no un diagnóstico. Nunca afirma que una araña sea inofensiva. Código y mediciones: github.com/msilvav/laeta.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support