Refine
Document Type
Has Fulltext
- yes (3)
Is part of the Bibliography
- no (3)
Keywords
- Digitalisierung (1)
- Informationsrecherche (1)
- OCR-D (1)
- Ope-Source-Software (1)
- Projekt-Governance (1)
- RDS (1)
- Resource Discovery System (1)
- Solr (1)
- VuFind (1)
Language
- German (3)
Das DFG-geförderte Projekt OCR-D (https://ocr-d.de/) befasst sich seit 2015 konzeptionell und praktisch mit der Verbesserung von Verfahren zur automatischen Text- und Strukturerfassung von digitalisierten historischen Drucken aus dem 16.-19. Jahrhundert. Übergeordnetes Ziel ist es, elektronisch lesbaren, wissenschaftlich verwertbaren Volltext für Titel der "Verzeichnisse der im deutschen Sprachraum erschienenen Drucke” (VD) zu gewinnen.Dazu wurden in der ersten Projektphase Verbesserungspotenziale ermittelt, die in der zweiten Projektphase bis zum Frühjahr 2020 von insgesamt acht zusätzlichen DFG-geförderten Modulprojekten bearbeitet werden. Die entwickelte quelloffene, modular aufgebaute Software wird zwischen November 2019 und Januar 2020 erstmals in neun Pilotbibliotheken getestet. Dabei werden die OCR-D-Software und die zugehörige Dokumentation auf ihre Praxistauglichkeit und Akzeptanz bei ihren potentiellen künftigen Nutzern hin getestet, indem sie in unterschiedlichen Bibliotheksumgebungen an verschiedenartigen Korpora angewendet werden. In der öffentlichen Arbeitssitzung werden die Ergebnisse dieser ersten Praxisphase sowie ggf. offene Desiderate der Pilotbibliotheken an die OCR-D-Software vorgestellt und diskutiert. Zudem wird die weitere geplante Entwicklung der Software und die Verfügbarkeit und Standardisierung von geeigneten Trainings- und Evaluationsdaten besprochen. Die Sitzung richtet sich neben den Projektbeteiligten an alle bestandshaltenden Einrichtungen wie Bibliotheken, Archive, etc., die Interesse an der OCR-D-Software haben und diese vielleicht in ihren eigenen Häusern testen und implementieren möchten. Die Veranstaltung schließt an die letztjährige Projektsitzung auf dem Bibliothekartag an, bei der mit Dienstleistern und Anwendern über die künftige Implementierung der OCR-D-Software in bestehende Workflows und Systeme diskutiert wurde.
Die DFG-Förderinitiative OCR-D (https://ocr-d.de/) befasst sich sowohl konzeptionell als auch praktisch mit der Verbesserung von Verfahren zur automatischen Text- und Strukturerfassung von digitalisierten Drucken aus dem 16.-19. Jahrhundert. Übergeordnetes Ziel ist es, für Titel der "Verzeichnisse der im deutschen Sprachraum erschienenen Drucke” (VD) maschinenlesbaren, wissenschaftlich verwertbaren Volltext zu generieren. In einer ersten Projektphase wurden hierfür zunächst Bedarfe ermittelt, die in einer zweiten Projektphase von insgesamt acht DFG-geförderten Modulprojekten bearbeitet wurden. Wie erste Teststellungen um die Jahreswende 2019/2020 und im Sommer 2020 gezeigt haben, ist der vorhandene Prototyp der OCR-D Software bereits sehr robust; für den produktiven Einsatz in der (bibliothekarischen) Praxis muss dieser jedoch noch im Rahmen einer 2021 anlaufenden dritten Projektphase implementiert und optimiert werden. Der Vortrag beschreibt den aktuellen Stand der OCR-D-Software und die vielfältigen geplanten Anwendungsszenarien in bestandshaltenden und -verarbeitenden Einrichtungen mit ihren Anforderungen. Dabei wird auch auf die Desiderate eingegangen, die bei einer Pilotierung im Vorfeld der Implementierungsphase festgestellt wurden und in der dritten Projektphase bearbeitet werden.
Seit Juni 2023 entwickeln zwölf Max-Planck-Institute mit zentraler Finanzierung im Rahmen der Open-Source-Förderlinie der MPG-Software-Grundversorgung zusammen mit einem externen Dienstleister ein multiinstanzfähiges Resource Discovery System, MPG.Discovery. Dabei handelt es sich um eine Suchmaschine für wissenschaftliche Informationsressourcen, derzeit schwerpunktmäßig Literatur, die auf bewährten Open-Source-Softwarekomponenten (VuFind/Solr) basiert. Kernstück ist ein MPG-eigener Solr-Index, in dem erstmals in großem Umfang Datenbestände aus bisher disparaten MPG-Ressourcen (Bibliothekskataloge der beteiligten Institute, MPG.PuRe, MPG.eBooks, MPG.ReNa) und ausgewählten externen Datenquellen (z.B. Open-Access-Ressourcen, eingebunden über die "Bielefeld Academic Search-Engine") zusammengeführt werden. Auf dieser Basis kann jedes am Projekt beteiligte Institut eine eigene MPG.Discovery-Instanz erstellen, über die eine Suche in ausgewählten Teilbeständen des Gesamtindexes möglich ist und deren Suchoberfläche über ein MPG-spezifisches VuFind-Basis-Template an das Corporate Design des jeweiligen Instituts angepasst werden kann. Spezifische Funktionen der lokalen Bibliothekssysteme, wie z.B. die Ausleihverwaltung können schnittstellenbasiert genutzt werden, so dass MPG.Discovery u.a. die lokalen Bibliothekskataloge ersetzen kann. Eine ergänzende Einbindung weiterer Solr-Indizes ist konzeptionell möglich. Der Vortrag skizziert die Ziele und Inhalte des Projekts, streift Ideen für eine zukünftige funktionale Weiterentwicklung, wirft einen Blick auf die Anbindung an die entsprechende Open-Source-Communities und geht vor allem auch auf die Governance-Strukturen des Projekts sowie das für die Nachprojektphase vorgesehene Betriebsmodell und die damit verbundenen Herausforderungen ein – letzteres auch vor dem Hintergrund, dass insgesamt 40 Institute sektionsübergreifend an der Nutzung von MPG.Discovery interessiert sind.