Institutional Books - Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections Paper • 2608.18957 • Published 9 days ago
Institutional Books - Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections Paper • 2608.18957 • Published 9 days ago
Institutional Books - Enriched Text: A customizable multilingual open-source pipeline for denoising, deduplicating, and annotating OCR text at scale Paper • 2608.19026 • Published 9 days ago • 1
Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers Paper • 2608.18972 • Published 9 days ago
Institutional Books Collection A growing corpus of public domain books from library collections, seeded by Harvard Library. • 12 items • Updated 7 days ago • 8
Institutional Newspapers Collection A growing corpus of newspapers, parsed and optimized for computational access. • 6 items • Updated 7 days ago
Institutional Newspapers Collection A growing corpus of newspapers, parsed and optimized for computational access. • 6 items • Updated 7 days ago
institutional/institutional-newspapers-crop-classifier-image-yolo26m-cls Image Classification • Updated 8 days ago
institutional/institutional-newspapers-crop-classifier-text-model2vec Text Classification • 32.4M • Updated 8 days ago • 10
Institutional Books Collection A growing corpus of public domain books from library collections, seeded by Harvard Library. • 12 items • Updated 7 days ago • 8
institutional/institutional-books-visual-elements-orientation Image Classification • Updated 8 days ago