Remove redundant metadata (#685)

The metadata field (list of triples) in the pipeline Metadata class was redundant. Document metadata triples already flow directly from librarian to triple-store via emit_document_provenance() - they don't need to pass through the extraction pipeline. Additionally, chunker and PDF decoder were overwriting metadata to [] anyway, so any metadata passed through the pipeline was being discarded. Changes: - Remove metadata field from Metadata dataclass (schema/core/metadata.py) - Update all Metadata instantiations to remove metadata=[] parameter - Remove metadata handling from translators (document_loading, knowledge) - Remove metadata consumption from extractors (ontology, agent) - Update gateway serializers and import handlers - Update all unit, integration, and contract tests
2026-06-21 04:38:07 +02:00 · 2026-03-11 10:51:39 +00:00 · 2026-03-11 10:51:39 +00:00 · aa4f5c6c00
commit aa4f5c6c00
parent 1837d73f34
37 changed files with 106 additions and 343 deletions
--- a/tests/contract/test_structured_data_contracts.py
+++ b/tests/contract/test_structured_data_contracts.py
@ -95,9 +95,8 @@ class TestStructuredDataSchemaContracts:
            id="structured-data-001",
            user="test_user",
            collection="test_collection",
-            metadata=[]
        )
-        
+
        # Act
        submission = StructuredDataSubmission(
            metadata=metadata,
@ -121,9 +120,8 @@ class TestStructuredDataSchemaContracts:
            id="extracted-obj-001",
            user="test_user",
            collection="test_collection",
-            metadata=[]
        )
-        
+
        # Act
        obj = ExtractedObject(
            metadata=metadata,
@ -147,9 +145,8 @@ class TestStructuredDataSchemaContracts:
            id="extracted-batch-001",
            user="test_user",
            collection="test_collection",
-            metadata=[]
        )
-        
+
        # Act - create object with multiple values
        obj = ExtractedObject(
            metadata=metadata,
@ -180,11 +177,10 @@ class TestStructuredDataSchemaContracts:
        # Arrange
        metadata = Metadata(
            id="extracted-empty-001",
-            user="test_user", 
+            user="test_user",
            collection="test_collection",
-            metadata=[]
        )
-        
+
        # Act - create object with empty values array
        obj = ExtractedObject(
            metadata=metadata,
@ -283,7 +279,6 @@ class TestStructuredEmbeddingsContracts:
            id="struct-embed-001",
            user="test_user",
            collection="test_collection",
-            metadata=[]
        )

        # Act
@ -313,7 +308,7 @@ class TestStructuredDataSerializationContracts:
    def test_structured_data_submission_serialization(self):
        """Test StructuredDataSubmission serialization contract"""
        # Arrange
-        metadata = Metadata(id="test", user="user", collection="col", metadata=[])
+        metadata = Metadata(id="test", user="user", collection="col")
        submission_data = {
            "metadata": metadata,
            "format": "json",
@ -328,7 +323,7 @@ class TestStructuredDataSerializationContracts:
    def test_extracted_object_serialization(self):
        """Test ExtractedObject serialization contract"""
        # Arrange
-        metadata = Metadata(id="test", user="user", collection="col", metadata=[])
+        metadata = Metadata(id="test", user="user", collection="col")
        object_data = {
            "metadata": metadata,
            "schema_name": "test_schema",
@ -378,7 +373,7 @@ class TestStructuredDataSerializationContracts:
    def test_extracted_object_batch_serialization(self):
        """Test ExtractedObject batch serialization contract"""
        # Arrange
-        metadata = Metadata(id="test", user="user", collection="col", metadata=[])
+        metadata = Metadata(id="test", user="user", collection="col")
        batch_object_data = {
            "metadata": metadata,
            "schema_name": "test_schema",
@ -397,7 +392,7 @@ class TestStructuredDataSerializationContracts:
    def test_extracted_object_empty_batch_serialization(self):
        """Test ExtractedObject empty batch serialization contract"""
        # Arrange
-        metadata = Metadata(id="test", user="user", collection="col", metadata=[])
+        metadata = Metadata(id="test", user="user", collection="col")
        empty_batch_data = {
            "metadata": metadata,
            "schema_name": "test_schema",