Cremma

CREMMA (Akronym für Consortium pour la Reconnaissance d'Écritures Manuscrites des Matériaux Anciens) ist ein Forschungsprojekt zur automatischen Handschrifte…

CREMMA (Akronym für Consortium pour la Reconnaissance d'Écritures Manuscrites des Matériaux Anciens) ist ein Forschungsprojekt zur automatischen Handschrifterkennung (HTR) und Layout-Segmentierung von vormodernen Handschriften. Es entwickelt Transkriptionsrichtlinien und HTR-Modelle, transkribiert Handschriften und stellt sowohl Modelle als auch Trainingsdaten zur Nachnutzung unter freier Lizenz zur Verfügung.

Hintergrund und Kontext

Das Projekt entstand vor dem Hintergrund wachsender Bedeutung von HTR in den Digital Humanities mit dem Anspruch, nicht-kommerzielle Angebote zur Transkription historischer Handschriften zu stärken. In den Jahren 2020/21 wurde es im Rahmen des Großprojekts DIM MAP (Domaine d'intérêt majeur — Matériaux anciens et patrimoniaux) von der Region Île-de-France sowie der École nationale des chartes gefördert.[1][2] CREMMA nutzt für seine Datenerstellung eScriptorium sowie die Software Kraken (insbesondere das BLLA-Modell) zur Segmentierung und stellt seine Modelle und zugehörige Daten unter freien Lizenzen zur Verfügung.[3] Das Projekt stellt auch Zugänge zu seiner Instanz von eScriptorium zur Verfügung.[4]

Cremma erforscht überwiegend vormoderne Handschriften in lateinischer oder altfranzösischer Sprache.

Das Projekt hat Richtlinien entwickelt, die eine handschriftennahe, graphemische Transkription vorschreiben: Die Orthographie sowie Groß-/Kleinschreibung wird nicht normalisiert; Allographe werden immer nur durch je ein Zeichen wiedergegeben (wobei u und v als allograph gelten); Abbreviaturen und Abkürzungen nicht aufgelöst, sondern durch spezielle Zeichen wiedergegeben.[5][6] Dies erleichtert die Erstellung, Vereinheitlichung und maschinelle Auswertbarkeit der Trainingsdaten. Zur Qualitätssicherung wird die selbstentwickelte Software ChocoMufin eingesetzt, die Zeichen anhand projektspezifischer Konvertierungstabellen kontrolliert und automatisch korrigiert. Für die Segmentierung nutzt das Projekt das kontrollierte Vokabular SegmOnto, das eine einheitliche Beschreibung von Layout-Zonen (z. B. „MainZone“, „MargintextZone“) ermöglicht.[3]

Ein vom Projekt veröffentlichter Datensatz ist „CREMMA Medii Aevi“; er umfasst rund eine Million Zeichen für mittelalterliche Manuskripte in Latein und Altfranzösisch. Die Handschriften stammen überwiegend aus dem Zeitraum 1100–1500 und decken verschiedene Textgattungen ab.[7]

Einzelnachweise

  1. Projets soutenus : Consortium pour la Reconnaissance d’Écriture Manuscrite des Matériaux Anciens. DIM Patrimoines matériels – innovation, expérimentation et résilience, 2021, abgerufen am 10. Juli 2026.
  2. Inria et l’École lancent CREMMA (Consortium pour la reconnaissance d’écriture manuscrite des matériaux anciens). In: Gazette chartiste. École nationale des chartes, 19. Januar 2021, abgerufen am 10. Juli 2026 (französisch).
  3. a b Alix Chagué/Thibault Clérice/Laurent Romary: HTR-United : Mutualisons la vérité de terrain ! In: DHNord2021 - Publier, partager, réutiliser les données de la recherche : les data papers et leurs enjeux, MESHS, Lille 2021. Online.
  4. Ouverture du service HTR Cremma. Consortium pour la Reconnaissance d'Écriture Manuscrite des Matériaux Anciens, 2025, abgerufen am 10. Juli 2026 (französisch).
  5. Ariane Pinche: Guide de transcription pour les manuscrits du Xe au XVe siècle. In: HAL science ouverte. Centre pour la communication scientifique directe, 2022, abgerufen am 10. Juli 2026 (französisch).
  6. Ariane Pinche: HTR Models and genericity for Medieval Manuscripts. In: CREMMALAB: Constitution de corpus en ancien français pour l'HTR. 2022, abgerufen am 10. Juli 2026 (französisch).
  7. Thibault Clérice / Malamatenia Vlachou-Efstathiou / Alix Chagué: CREMMA Medii Aevi: Literary Manuscript Text Recognition in Latin. In: Journal of Open Humanities Data 9 (2023) article 4. doi:10.5334/johd.97

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.