Generierung eines Enrichment Cache mit Daten aus lobid-gnd und Wikidata für den Katalog des Deutschen Literaturarchivs Marbach auf Basis von im DLA verwendeten GND-IDs.
Gesamten Prozess starten:
taskDie in Taskfile.yml definierten Tasks können auch einzeln ausgeführt werden. In der Regel in dieser Reihenfolge:
datendienst: Download von GND-IDs aus dem DLA Datendienstlobid-download: Bulk-Download der GND als JSON-Lines über lobid-gndlobid-filter: GND-Download reduzieren auf im DLA verwendete GND-IDs- mit lobid-filter.py
lobid-transform: Ausgewählte Daten aus lobid-filtered in einzelne Tabellen schreibenwikidata-extract: Mit den aus lobid-gnd ermittelten Wikidata IDs den Wikidata Query Service abfragenwikidata-transform: Ausgewählte Daten aus wikidata-extracted in einzelne Tabellen schreibencommons-extract: Abfrage von Wikimedia Commons API query/imageinfocommons-transform: Aus imageinfo eine Rechteangabe generierenoutput: Plausibilitätsprüfung und ggf. Kopie der Daten in das Verzeichnis output
Der GitHub Actions Workflow default.yml führt den Gesamtprozess aus und lädt anschließend die neu generierten Daten mit einem Commit ins GitHub Repository.
Zwischenergebnisse werden im Ordner data abgelegt. Das Gesamtergebnis wird schließlich im Ordner output bereitgestellt. Für jedes ausgewählte Feld aus der GND oder Wikidata wird eine TSV-Datei bereitgestellt.
Die TSV-Dateien haben immer zwei Spalten:
- Spalte: GND-ID oder Wikidata-ID oder Wikimedia-Commons-Dateiname
- Spalte: Wert aus dem ausgewählten Feld
Jeder Wert kommt in eine eigene Zeile, ggf. wird die GND-ID bzw. Wikidata-ID wiederholt.
Beispiel aus output/lobid-wikidata.tsv:
116891998 Q95880566
116892927 Q20733597
116892927 Q94822365
Diese Daten werden im ETL-Workflow des Online-Katalogs geladen und zur Anreicherung verwendet:
- Import Enrichment Cache: dla-opac-transform: main.sh
- Beispiel für Anreicherung: dla-opac-transform: wikidata_pe.yaml