Jpicturereader
jing-hy/picturereader
«Чтение» изображений для текстовых моделей: уменьшение масштаба + снижение глубины цвета + отпечатки структуры/цвета преобразуются в текстовые сетки, возвращаемые в диалог, что позволяет модели самостоятельно масштабировать, сэмплировать и распознавать текст (OCR), как мультимодальная модель; полностью локально, без зависимости от внешних моделей, поставляется с навыком методологии чтения изображений и опциональным PaddleOCR.
373 дня назадЗрение, голос и мультимодальностьMIT