laeta-bioclip-onnx — encoder de imagen del detector de araña de rincón
Torre visual de BioCLIP-2 (ViT-L/14) exportada a ONNX y cuantizada a int8 (~293 MB) para correr en el navegador (ONNX Runtime Web), dentro de la PWA aranaderincon.manuelsilva.cl.
La foto nunca sale del teléfono: el modelo se descarga una vez y toda la inferencia es local.
Cómo funciona
Clasificación zero-shot. El encoder produce un embedding L2-normalizado de 768-d que se compara
por producto punto contra los vectores de texto precalculados de las 26 clases
(text_embeddings.json), seguido de softmax. No se entrena con fotos de arañas: se midió que
entrenar con fotos chilenas de iNaturalist mejora en iNaturalist y empeora en otra fuente
(ROC 0.79 vs 0.93 sobre ejemplares de museo).
Archivos
| Archivo | Qué es |
|---|---|
image_encoder.onnx |
Torre visual de BioCLIP-2, int8. Entrada pixel_values [N,3,224,224], salida image_embedding [N,768] (ya normalizada). |
text_embeddings.json |
26×768 vectores de texto de las clases + logit_scale. |
labels.json |
Nombres científicos/comunes, target_index y umbrales calibrados (🔴 0.9012 / 🟡 0.0458). |
Preprocesamiento: center-crop a 224 y normalización OpenCLIP
(mean [0.4815, 0.4578, 0.4082], std [0.2686, 0.2613, 0.2758]).
Aviso
Estimación automática, no un diagnóstico. Nunca afirma que una araña sea inofensiva. Código y mediciones: github.com/msilvav/laeta.