OpenCode Senses: capa de visión local y gratuita para modelos de texto en OpenCode

Fuentes: OpenCode Senses: a local vision plugin that lets text-only models truly see images

OpenCode Senses es un complemento (plugin) para OpenCode que añade una capa de visión a modelos de programación que solo trabajan con texto. Permite adjuntar imágenes (capturas, mockups o URL web) y obtener información estructurada: OCR exacto, ubicación de objetos, colores en píxeles, recortes, zoom de regiones, búsqueda inversa por hash perceptual y metadatos. Todo se ejecuta en local sobre GPU del usuario mediante el modelo Moondream 2 (unos 4,5 GB de VRAM), sin claves de API ni envío de imágenes a servidores externos.

El sistema combina un plugin en TypeScript dentro de la sesión de OpenCode con un runtime en Python que se comunica por JSON-RPC sobre stdio. En el primer uso aprovisiona automáticamente su propio entorno virtual (preferentemente con uv) y descarga los pesos del modelo desde Hugging Face. Cuando se adjunta una imagen, Senses la analiza y añade un bloque con la evidencia antes de la respuesta del modelo; el usuario también puede invocar hasta 13 herramientas (senses_inspect, ocr, detect, point, segment, crop, zoom, colors, diff, annotate, metadata, reverse, status).

Requisitos: Linux x86_64/aarch64, Windows AMD64 o macOS; GPU NVIDIA (Ampere o posterior) o Apple Silicon con al menos 6 GB de VRAM; Python 3.10–3.14. La instalación es vía npm (opencode-senses) y se activa añadiendo el plugin en opencode.jsonc. El proyecto se distribuye como código abierto bajo una licencia referenciada en el repositorio.