Refine
Document Type
Has Fulltext
- yes (4)
Is part of the Bibliography
- no (4)
Keywords
- Abgeleitete Textformate (1)
- Derived Text Format (1)
- Digitalisierung (1)
- Korpora (1)
- Literatur (1)
- Metadaten (1)
- NFDI (1)
- Normdaten (1)
- Survey (1)
- Text+ (1)
Language
- German (4)
Dank fortschreitender Digitalisierung und Vernetzung stehen immer größere Textbestände öffentlich zur Verfügung. Die aktuellen Entwicklungen im Bereich großer Sprachmodelle und künstlicher Intelligenz verdeutlichen deren Bedeutung als Wissensressourcen. Bibliotheken, zu deren Kernaufgaben die Bereitstellung und Aufbereitung dieser Daten gehören, gewinnen dadurch weiter an gesellschaftlicher Relevanz. Für innovative Forschungsmethoden bilden solche Daten ebenfalls eine essentielle Grundlage. Urheberrecht oder Datenschutz schränken jedoch die Zugänglichkeit vieler, insbesondere neuerer Texte ein. Dies führt mithin zu einer Unterrepräsentierung zeitgenössischer Texte in wissenschaftlichen Korpora. Eine Möglichkeit, dem entgegenzuwirken, bieten abgeleitete Textformate (ATF). Sie entstehen, indem der Informationsgehalt in Texten nach einer ersten Anreicherung derart reduziert wird, dass das Ergebnis einerseits nicht mehr (urheber)rechtlich relevant ist, andererseits aber noch die Beantwortung mindestens einer Forschungsfrage ermöglicht. Solche ATFs können also frei veröffentlicht werden. So können Texte in großem Umfang nutzbar gemacht werden, die der Wissenschaft bisher nur bedingt zur Verfügung standen. Die im NFDI-Konsortium Text+ aktiven Bibliotheken erforschen und erproben daher gemeinsam mit Forschenden Nutzungsszenarien für ATFs. Neben juristischen Untersuchungen entsteht im Rahmen von Text+ derzeit eine DIN-Norm für ATFs. Zudem wird die Eignung spezifischer Formate für bestimmte Forschungsfragen evaluiert und eine Komponente zur Herstellung von ATFs für die Natural-Language-Processing-Pipeline MONAPipe entwickelt. Auch die pilothafte Veröffentlichung ausgewählter ATFs z.B. im TextGrid Repository erfolgt in diesem Zusammenhang.Der Vortrag präsentiert konkrete Beispiele für rechtlich unbedenkliche ATFs sowie für Forschungsprojekte, die mit solchen Formaten gearbeitet haben. Ziel ist es, Bibliotheken zur Bereitstellung von ATFs für die Wissenschaft zu ermutigen.
Sammlungen vernetzen und für die Forschung nutzbar machen – eine Aufgabe (auch) für Bibliotheken
(2024)
Text+ ist ein NFDI-Konsortium, das sich auf die langfristige Erhaltung und breite wissenschaftliche Nutzung von sprach- und textbasierten Forschungsdaten fokussiert. Daraus ergibt sich auf ganz natürliche Weise ein enger Bezug zu Bibliotheken. Dieser zeigt sich unter anderem daran, dass sowohl die Deutsche Nationalbibliothek (DNB) als auch die Niedersächsische Staats- und Universitätsbibliothek Göttingen (SUB) als mitantragstellende Einrichtungen sowie drei weitere Bibliotheken aktiv an der Ausgestaltung der Ziele von Text+ beteiligt sind. Um diese zu erreichen, baut Text+ eine ortsverteilte Infrastruktur auf, in die sich unterschiedlichste Partner mit Daten, Tools und Services einbringen. So sind in dieser Infrastruktur bereits eine Vielzahl von Editionen, Wörterbüchern und Sammlungen zu finden. Diese werden z.B. über eine übergreifende Volltextsuche miteinander verbunden. Text+ ist sehr daran interessiert, digital vorliegende Daten aus Forschungsprojekten und Bibliotheken in dieses Netzwerk zu integrieren, mit anderen Daten zu vernetzen und insgesamt einem möglichst breiten Publikum im Sinne der FAIR-Prinzipien zugänglich zu machen.
Zur Integration in die verteilte Infrastruktur steht neben der Registry als Nachweissystem die übergreifende Volltextsuche zur Verfügung, die über offene Schnittstellen an die lokalen Systeme angebunden werden können. Um eine optimale Vernetzung und Interoperabilität der verfügbaren Daten zu ermöglichen, setzt Text+ auf den Einsatz von Linked Data Techniken, gemeinsamer Vokabulare, Klassifikationssysteme und Normdaten. Zudem bietet Text+ einen umfassenden Support bei der Integration und Aufbereitung der Daten (z.B. bei der Konzeptionvon abgeleiteten Textformaten oder den Vorschlag für neue Entitäten in der Gemeinsamen Normdatei (GND), etwa durch entityXML).
Dieser Vortrag zeigt anhand konkreter Beispiele die Möglichkeiten der Datenintegration in Text+ auf und geht insbesondere auf den Einsatz der GND und der Basisklassifikation ein.
Forschende in der Literaturwissenschaft arbeiten mehr und mehr mit digitalen Sammlungen und Korpora. Bei der Zusammenstellung spielen Bibliotheken und digitale Repositorien eine wichtige Rolle. Leider entsprechen die Informationen in Katalogen und ähnlichen Infrastrukturen nicht den Interessen der Forschung. Es gibt wenig Informationen u.a. zu literarischen Werken, ihre Gattung, der Originalsprache und dem Entstehungsdatum.
Um diesem Desiderat zu begegnen, haben die Infrastrukturkonsortien Text+ (inkl. GND), CLS-Infra und das DFG Schwerpunktprogramm SPP 2207, eine Umfrage zu den Kriterien bei der Zusammenstellung literarischer Korpora durchgeführt.
Die Struktur der Umfrage orientierte sich an dem FRBR-orientierten Modell zu Autor, Werk und Text. Welche Kriterien abgefragt wurden, richtete sich nach den im Vorfeld geäußerten Wünschen von Forschenden aus den beteiligten Projekten. Die optionalen Fragen zum persönlichen Hintergrund der Teilnehmenden dienten ausschließlich der Verdeutlichung einseitiger Beteiligung.
Insgesamt erhielten wir 111 vollständig ausgefüllte Antworten aus 19 verschiedenen Ländern (die Hälfte aus Deutschland). Die Ergebnisse zeigen, dass sich eine Mehrheit der Befragten bei Autoren und Werken primär für die Zeit, die Sprache und die Gattung interessieren. Bei Werken sind detaillierte Informationen nach Untergattungen und der Unterscheidung von fiktional oder nicht-fiktional gewünscht. Bei den einzelnen Texten sind vor allem die digitale Verfügbarkeit, die Qualität, die Sprache und das Format (TEI, TXT) ausschlaggebend.
Die Frage, welche dieser Informationen letztlich von Bibliotheken, Archiven, Repositorien und Normdatenressourcen bereitgestellt werden sollten, muss auch vor dem Hintergrund persönlich relevanter Kategorien diskutiert werden . Spannend für eine mögliche Umsetzung ist die Nutzung von KI und NLP sowie die Frage, wie diese Metadaten in Einklang mit der vorhandenen Katalogisierung zu bringen sind.
Die stetig wachsende Datenflut der digitalen Welt stellt Forschungseinrichtungen vor die Herausforderung, Informationen gezielt zugänglich zu machen. Dabei leisten Klassifikationssysteme wie die Basisklassifikation (BK) einen entscheidenden Beitrag. Die BK ist eines der am häufigsten verwendeten Systeme im deutschsprachigen Raum für bibliothekarische Ressourcen wie Kataloge oder Repositorien.
Ein wesentlicher Schwachpunkt der BK liegt bislang in der ausschließlichen Verwendung deutschsprachiger Klassenbezeichnungen, was ihre Einbettung in internationale Informationsumgebungen erheblich einschränkt.
Um dieses Potenzial zu erweitern, initiierte die Verbundzentrale des GBV (VZG) und die Niedersächsischen Staats- und Universitätsbibliothek Göttingen (SUB Göttingen) das BK-Übersetzungsprojekt.
Ziel ist es, die deutschen Klassenbenennungen zunächst ins Englische zu übersetzen und anschließend in die Normdaten zu integrieren. Hierbei kamen sowohl computergestützte Verfahren als auch das Fachwissen von Expert*innen zum Einsatz.
Jede Klassenbenennung wurde mithilfe verschiedener computerunterstützter Algorithmen übersetzt. Darüber hinaus wurden automatisch weitere Informationen aus dem K10plus-Katalog sowie aus Wikipedia als Hilfsmittel gesammelt, um ein optimales Ergebnis zu erzielen. Die Ergebnisse wurden anschließend von Fachexpert*innen zur Überprüfung bewertet.
Die Fachexpert:innen orientieren sich an Übersetzungsrichtlinien, die in Zusammenarbeit mit dem Fachinformationsdienst Anglo-American Culture (FID AAC) erstellt wurden. Insgesamt haben fast 50 Fachpersonen (viele Fachreferent*innen) aus mehr als 20 Bibliotheken und weiteren Institutionen an dem Projekt mitgewirkt. Viele von ihnen sind in Leibniz-Zentren, FIDs oder NFDI-Konsortien tätig.
Die Präsentation gibt Einblick in den Projektansatz, den Übersetzungs- und Qualitätssicherungsprozess sowie die ersten Ergebnisse und Perspektiven für die zukünftige Weiterentwicklung der BK im internationalen Kontext.