Jpicturereader
jing-hy/picturereader
"Leitura" de imagens para modelos somente de texto: reduz a escala + reduz a profundidade de cor + converte impressões digitais de estrutura/cor em grades de texto devolvidas à conversa, permitindo que o modelo faça zoom, amostragem e OCR de forma autônoma como um modelo multimodal; totalmente local, sem dependência de modelo externo, inclui uma skill de metodologia de leitura de imagem e PaddleOCR opcional.
37há 3 diasVisão, voz e multimodalMIT