Text+: Sprach- und textbasierte Forschungsdateninfrastruktur (Text+)
Coordinator
Professor Dr. Erhard W. Hinrichs ; Professor Dr. Philipp Wieder ; Professor Dr. Andreas Witt ; Professorin Dr. Hanna Fischer ; Philippe Genêt ; Privatdozent Dr. Alexander Geyken ; Dr. Peter Leinen ; Professorin Vivien Petras Ph.D. ; Professorin Dr. Andrea Rapp ; Professor Dr. Andreas Speer ; Regine Stein ; Professorin Dr. Elke Teich ; Professor Dr. Philipp Wieder ; Professor Dr. Andreas Witt ; Professorin Dr. Angelika Zirker
Grant period
2021 - 2031
Funding body
Deutsche Forschungsgemeinschaft
DFG
Identifier
G:(GEPRIS)460033370
Note: Text+ ist eine Forschungsdateninfrastruktur, die sprach- und textbasierte Forschung in den Geistes- und Sozialwissenschaften unterstützt. Aufbauend auf den Erfolgen der ersten Förderphase, startet Text+ in Phase II mit einer geschärften Strategie, die auf Nachhaltigkeit, Innovation und Inklusivität fokussiert. Das Konsortium vereint 41 Partnereinrichtungen mit Expertise in der Verwaltung, Bewahrung und Wiederverwendung diverser Forschungsdatentypen, darunter Bibliotheksbestände, Korpora, lexikalische Ressourcen und Editionen. Zentral ist der Text+ Data Space, eine interoperable, zertifizierte föderierte Infrastruktur zur Speicherung, Auffindung und Verarbeitung sprach- und textbasierter Daten. Alle Dienste basieren auf den FAIR-Prinzipien und sind auf nationale und europäische Rahmenwerke wie CLARIN, DARIAH und EOSC abgestimmt. Phase II reagiert auf eine transformierte Forschungslandschaft durch KI, große Sprachmodelle (LLMs) und die wachsende Bedeutung von Sprache als universelle Datenschnittstelle. Text+ definiert hierfür vier strategische Themen: (1) Sprache/Text als dominante Datenschnittstelle; (2) das dynamische Zusammenspiel von strukturierten und unstrukturierten Daten; (3) eine menschenzentrierte Forschungskultur mit Ethik und Nachhaltigkeit; und (4) die langfristige Nachhaltigkeit von Infrastruktur und Diensten. Diese Themen werden in vier datendomänenspezifischen Aufgabenbereichen – 1) Bibliotheksbestände als Forschungsdaten, 2) Sprachkorpora und Elicited Data, 3) Lexikalische Ressourcen und 4) Editionen – und zwei Querschnittsaufgabenbereichen – 5) Infrastruktur/Betrieb und 6) Administration – operationalisiert. Übergeordnete Ziele sind die Ausweitung der Community-Integration, Verbesserung der KI-Fähigkeiten, Stabilisierung der Dienste, FAIRifizierung von Altdaten und Vertiefung der nationalen und internationalen Zusammenarbeit. Besonderer Wert wird auf Schulung, Outreach und die Verankerung von Forschungsdatenmanagement (FDM) in akademischen Lehrplänen gelegt. Text+ spielt auch eine zentrale Rolle in der Nationalen Forschungsdateninfrastruktur (NFDI), indem es zu konsortienübergreifenden Diensten beiträgt und aktiv an der Base4NFDI-Initiative sowie NFDI-Steuerungsgremien teilnimmt. International sichert das Konsortium die Interoperabilität mit europäischen Infrastrukturen, eng verbunden mit CLARIN, DARIAH und OPERAS. Durch diese Arbeit hilft Text+, die Vision von „Daten als Gemeingut“ zu verwirklichen und Innovation und Partizipation in einer digital transformierten akademischen Welt zu fördern.