Jpicturereader
jing-hy/picturereader
Bild-„Lesen“ für reine Textmodelle: Herunterskalieren + Reduzierung der Farbtiefe + Struktur-/Farb-Fingerabdrücke werden in Textraster umgewandelt und in das Gespräch zurückgespeist, sodass das Modell wie ein multimodales Modell autonom zoomen, sampeln und OCR durchführen kann; vollständig lokal ohne Abhängigkeit von externen Modellen, enthält einen Skill zur Bild-Lese-Methodik sowie optional PaddleOCR.
37vor 3 TagenVision, Sprache & MultimodalMIT