Jpicturereader
jing-hy/picturereader
«Lettura» delle immagini per modelli solo testo: riduzione della scala + riduzione della profondità colore + impronte di struttura/colore convertite in griglie di testo restituite alla conversazione, permettendo al modello di ingrandire, campionare ed eseguire OCR in autonomia come un modello multimodale; completamente locale, senza alcuna dipendenza da modelli esterni, include una skill di metodologia di lettura delle immagini e PaddleOCR opzionale.
373 giorni faVisione, voce e multimodaleMIT