Jpicturereader
jing-hy/picturereader
"Lectura" de imágenes para modelos de solo texto: reduce la escala + reduce la profundidad de color + convierte huellas de estructura/color en cuadrículas de texto que se devuelven a la conversación, permitiendo que el modelo haga zoom, muestreo y OCR de forma autónoma como un modelo multimodal; totalmente local y sin dependencia de modelos externos, incluye una skill de metodología de lectura de imágenes y PaddleOCR opcional.
37hace 3 díasVisión, voz y multimodalMIT